AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

CUA

共 1 条相关 AI 资讯
7月21日
09:12
09:12官方账号arXiv cs.AI@Barada Sahu, Shivesh Pandey
精选
使用verifier-guided repair对35B参数的计算机使用智能体(CUA)在五个oracle-graded环境中进行测试,方差分量分解显示评估方差几乎为零,训练种子效应不超过10%,而数据抽取在最难任务中占48%的主导方差。该任务的运行间分布为双模(Hartigan dip p=0.07, k=10),单次运行约有30%概率落入失败模式,均值±标准差无法正确描述。修复能力分两层:固定token安装可靠(成功率0.97±0.06),而开放式坐标点击修复仅部分有效(0.53±0.35),生成字段填充更弱(0.14±0.04)。框架级修复仅在任务是唯一剩余障碍时提升成功率(LinkedIn 8/20 vs 基准0/15, Fisher p=0.006)。作者发现单次改进报告约三分之一概率符号错误,并发布了cua_reliability库以支持多种子常规报告。
论文CUA35BSA-OPSD

推荐理由:这篇论文用严格的统计方法告诉你:CUA的修复效果不能只看单次跑分,一个看起来不错的改进有三分之一可能是错的。做AI agent的都应该看看这个库。
原文
精选全部日报登录