VOL.2026.08.21·171 STORIES·AITOP DAILY

AITOP日报

二〇二六年八月二十一日 星期五DAILY · 每早八时
01

模型发布/更新

Model Releases
5

阿里发布 Qwen-UI-Agent,主打让模型真正“会用”每一块屏幕

官方IT之家原文 ↗

阿里推出 Qwen-UI-Agent,一个以真实世界为中心的 GUI 智能体基座模型,涵盖移动端、电脑端、网页端及深度搜索环境。在移动端 MobileWorld 基准上得分 82.1%,超越 GPT-5.6 Sol、Claude Opus 4.8 等模型;真机基准 MobileWorld-Real 得分 92.2%,接近满分。电脑端 OSWorld-Verified 得分 79.5%,超越 GPT-5.5、Gemini 3.1 Pro 等模型。浏览器 & DeepSearch 方面,WebArena 得分 73.6%,位列所有对比模型第一。

GEN-1.5 的成功秘诀:重复动作与 UMI 数据收集

X·KOLX:Jim Fan (@DrJimFan)原文 ↗

GEN-1.5 的成功秘诀在于利用人类数据中的自然重复动作。这些重复主要来自对称模式,如 IKEA 组装手册中的螺栓配对,以及人类的恢复动作。关键在于保留失败的尝试,而非过度清理数据。另一个关键因素是 UMI(直接人类数据收集),它比传统的遥操作(teleop)更能保留人类的物理直觉。有了足够数据,许多行为可以实现零样本学习,无需微调。

02

产品发布/更新

Product
5
03

行业动态

Industry
5
04

论文研究

Research
5

持续学习新方法:通过分离更新与评估提升AI智能体性能

X·KOLX:elvis (@omarsar0)原文 ↗

一篇关于持续学习的新论文提出了一种名为“受保护 harness 演化”的方法。该方法将 harness 组件的更新提议与实际提交分离开来。通过使用持续优化器和持续评估器,该方法在文本推理、多模态感知和开放世界交互等任务上实现了超过10%的相对增益。论文还定义并量化了“harness 级别遗忘”这一现象。

论文测试智能体能否训练其他智能体

X·KOLX:elvis (@omarsar0)原文 ↗

该论文分析了大量公开的智能体后训练轨迹。研究发现,智能体在第一步就锁定了训练策略,后续仅进行局部调整。论文尝试了三种改进方法:经验驱动的脚手架提升了GSM8K和HumanEval的分数,但策略仍保持冻结。人类指导能改变初始选择,但训练开始后智能体又回到局部循环。额外推理计算对简单任务有效,对最难任务几乎无效。

05

技巧与观点

Tips & Takes
5

优化提示词无法修复上下文管道问题

X·KOLX:Weaviate (@weaviate_io)原文 ↗

可靠智能体RAG依赖控制信息如何到达模型、何时到达以及以何种形式到达。上下文工程分为5个相互关联的系统:1. 查询增强,用户输入混乱,需重写、扩展或分解查询以匹配检索系统。2. 检索,分块存在权衡,小分块提高精度但丢失上下文,大分块增加上下文但消耗更多窗口。3. 记忆,完整对话历史会产生噪音,长期记忆应存储在模型外部并定期维护。4. 工具,工具描述和选择消耗上下文,暴露过多 poorly described 工具会降低效率。5. 智能体,连接所有部分但会放大上游错误。

171
今日事件
58
一手报道
31
新模型
57
信源
AITOP · 编辑系统自动生成