论文精选

HiViG:历史感知视觉批评器提升计算机使用智能体性能

A History-Aware Visually Grounded Critic for Computer Use Agents

精选理由

做GUI自动化智能体的团队终于有了能记住历史并看清屏幕的批评器——HiViG在长任务中显著提升成功率,建议做CUA开发的直接看论文。

AI 摘要

计算机使用智能体(CUA)在执行GUI任务时,现有批评模型存在短视和缺乏视觉基础两大局限。研究者提出HiViG框架,通过多模态批评器记录历史动作并基于截图验证执行坐标,在预执行阶段拦截错误。在网页、移动和桌面基准测试中,HiViG使Qwen3-VL-32B和Gemini-3-Flash的成功率分别提升5.8%和9.0%,并展现出强跨平台泛化能力。消融实验表明,宏观动作历史和视觉基础批评对长程GUI任务至关重要。

AI 翻译 · 中文

计算机使用智能体(CUA)在执行GUI任务时,现有批评模型存在短视和缺乏视觉基础两大局限。研究者提出HiViG框架,通过多模态批评器记录历史动作并基于截图验证执行坐标,在预执行阶段拦截错误。在网页、移动和桌面基准测试中,HiViG使Qwen3-VL-32B和Gemini-3-Flash的成功率分别提升5.8%和9.0%,并展现出强跨平台泛化能力。消融实验表明,宏观动作历史和视觉基础批评对长程GUI任务至关重要。

arXiv cs.AIVarious test-time interventions for Computer Use Agents (CUAs), including critic models, have been developed to improve performance through pre-execution action evaluation in complex Graphical User Interface (GUI) enviro