11:59官方账号arXiv cs.AI@Abhishek Pillai, Samir Kumar Nayak, Yuan ChenDesktop-Delta Bench (DDB) 是一个离线步骤级基准,包含2,013个人工验证的实例,覆盖约15个应用和50个任务域。DDB通过463个三帧时序排序实例(含105个跨轨迹干扰)和1,550个前后对比对来评估模型。在8个闭源和开源模型家族、32个排序和16个单动作设置中,最佳非干扰和干扰精确匹配率分别为65.1%和65.7%。单动作结果显示,推断动作类型比定位更难:点击F1为0.96,拖拽为0.76。DDB填补了GUI定位与最终任务成功之间的诊断空白。论文Desktop-Delta Bench计算机使用模型GUI代理推荐理由:想测试你的桌面Agent到底能不能分清操作后的界面变化?这个新基准有2000多个真实案例,能看出模型在哪类失败上翻车。原文稍后读已读值得跟进有用关注 Desktop-Delta Bench