阿里刚发了 Qwen-UI-Agent,能直接操作手机电脑屏幕,移动端比 GPT-5.6 Sol 高 12 个点,还能在真实手机上跑任务,以后帮你自动查地址、订高铁、整理文件应该更靠谱了。
阿里推出 Qwen-UI-Agent,一个以真实世界为中心的 GUI 智能体基座模型,涵盖移动端、电脑端、网页端及深度搜索环境。在移动端 MobileWorld 基准上得分 82.1%,超越 GPT-5.6 Sol、Claude Opus 4.8 等模型;真机基准 MobileWorld-Real 得分 92.2%,接近满分。电脑端 OSWorld-Verified 得分 79.5%,超越 GPT-5.5、Gemini 3.1 Pro 等模型。浏览器 & DeepSearch 方面,WebArena 得分 73.6%,位列所有对比模型第一。
IT之家 8 月 20 日消息,据千问大模型官方公众号,阿里巴巴正式推出 Qwen-UI-Agent ,一个以真实世界为中心的 GUI 智能体基座模型,涵盖移动端、电脑端、网页端以及深度搜索(DeepSearch)环境。 据介绍,Qwen-UI-Agent 在 GUI 任务上全面对标乃至超越业界旗舰模型: 移动端: MobileWorld 82.1%, 分别领先 GPT-5.6 Sol、Claude Opus 4.8、Seed 2.1 Pro 12.0、14.6、8.9 个百分点;真机基准 MobileWorld-Real 92.2% ,超越 Gemini 3.1 Pro、Claude Opus 4.8、GPT-5.6 Sol、Seed 2.1 Pro ;AndroidDaily 高达 97.5% ,接近满分。 电脑端: OSWorld-Verified 79.5% ,超越 GPT-5.5、Gemini 3.1 Pro、Seed 2.1 Pro;OSWorld-v2 Partial 分数 40.0%,同时相比基线节省 58% 执行步数。 浏览器 & DeepSearch:WebArena 73.6%, 位列所有对比模型第一;BrowseComp-ZH 75.0%。 GUI Grounding:ScreenSpot-Pro 81.5%,在其余 4 个 grounding 评测基准也全部刷新 SOTA。 通用能力:通用和 Agentic 能力全面保持或超越训练基座模型,并在这两类任务上大幅领先 GUI 专用模型,从容应对真实世界的长尾需求。 Qwen-UI-Agent 搭建覆盖 100+ 台真实手机、150+ 应用 的真机移动环境,用于任务构建、轨迹采集、模型训练与评测,并自建 MobileWorld-Real 真机基准 (400+ 任务、100+ 应用),打通“从模拟到真实”的最后一公里。 Prompt: 我今天约了朋友去天目里喝咖啡,帮我在高德搜索查看详细地址,打开大众点找附近 1 公里内的咖啡馆,找人气最高的那家记下店名,再去小红书总结前五条笔记,看看大家推荐这家店的哪款咖啡。 Prompt: 下周三我从北京回来,帮我看一下 12306 最早到杭州西的那班高铁几点到。然后查一下杭州西坐地铁到阿里巴巴西溪园区要多久,算一下我几点能到公司。最后在钉钉安排一个到达后整点的会议。主题写 " 出差归来项目同步 ",参会人选我和张三。开一个小时,设置提前 5 分钟提醒。 Prompt: 在手机相册中找到所有收据,将它们移动到远程桌面上的 receipts 文件夹,按日期重命名,并在该文件夹中创建一个 Excel 文件汇总账单。 Qwen-UI-Agent 将安全判断贯穿任务执行全过程: 面对违法或高风险请求,它会不执行任何界面操作,直接拒绝并终止任务 ;面对支付、数据删除、隐私授权等敏感场景,则会 在关键步骤主动停手,向用户说明情况 ,待获得明确确认后再继续。危险请求不执行,敏感操作不擅自决定,让模型既能执行,也懂得何时停手。 GUI 操作之外,模型还能直接执行命令行操作,并在单次决策中批量输出多个动作。在电脑任务中,CLI 动作占比近半,约 40% 动作以 batched actions 形式输出,大幅缩短执行轨迹、拓展能力边界、提升执行效率。比如跨网站调研产品、核对价格,生成比价方案。 其支持在 超过 100 步 的超长轨迹上进行在线 RL 训练,约 10000 个并发环境 同时 rollout,配合模型自适应课程学习,持续攻克长程任务。 IT之家附上有关链接如下: 技术报告: https://arxiv.org/abs/2607.28227 项目主页 : https://tongyi-mai.github.io/Qwen-UI-Agent GitHub: https://github.com/Tongyi-MAI/MAI-UI