阿里刚发了 Qwen-UI-Agent,能直接操作手机电脑屏幕,移动端比 GPT-5.6 Sol 高 12 个点,还能在真实手机上跑任务,以后帮你自动查地址、订高铁、整理文件应该更靠谱了。
阿里Qwen-UI-Agent领先,AI智能体操作电脑成焦点
2026年8月21日,AI领域迎来多项重要进展,其中阿里Qwen-UI-Agent在多端GUI智能体基准测试中表现优异,图灵奖得主萨顿对合成数据提出质疑,OpenAI电脑操作功能接近实现。阿里发布Qwen-UI-Agent,在移动端MobileWorld基准上得分82.1%,超越GPT-5.6 Sol等模型;真机基准MobileWorld-Real得分92.2%,接近满分。图灵奖得主理查德·萨顿称合成数据是扩展大语言模型的“大错误”,认为应让智能体从自身经验中持续学习。OpenAI正在开发让AI智能体像人类一样操作电脑的能力,通过专门数据和训练提升模型能力,目前速度仍不及消费者期待,正研究“确认策略”平衡安全与易用性。
模型发布/更新
5 篇GEN-1.5 的成功秘诀在于利用人类数据中的自然重复动作。这些重复主要来自对称模式,如 IKEA 组装手册中的螺栓配对,以及人类的恢复动作。关键在于保留失败的尝试,而非过度清理数据。另一个关键因素是 UMI(直接人类数据收集),它比传统的遥操作(teleop)更能保留人类的物理直觉。有了足够数据,许多行为可以实现零样本学习,无需微调。
Claude Code实验里Fable 5主动搞了个GitHub Actions流程,自己把实验跑起来,比之前手动弄方便多了。
Liquid AI给LFM2.5模型加了三个drafters,解码速度能快3.18倍,但输出结果和原来一模一样,不用改现有应用就能用。
产品发布/更新
5 篇AWS 在 Bedrock AgentCore 里加了个 Policy 功能,能把自然语言写的规则变成代码,还能加时间限制,帮你管好 AI 智能体别乱跑。
OpenAI 正在让 ChatGPT 学会操作电脑,以后可能比你自己点鼠标还快。他们用了真人示范数据,还改了读取网页的方式,不过现在还慢,而且有安全风险。
行业动态
5 篇LangChain 下周四在 Sunnyvale 办活动,有 Expedia 工程师分享智能体实战,还有两个工作坊教你用 Deep Agents 和 LangSmith Engine,想学智能体开发的可以看看。
论文研究
5 篇技巧与观点
5 篇Earendil 的文章解释了 Harness 是什么,它能让模型变成智能体。它有四个核心部分,开源项目 Pi 已被共享 5000+ 扩展,可本地运行,让你拥有自己的智能体。