10:09官方账号arXiv cs.AI@Yiyao Wang, Zhen Wen, Yinghao Tang, Yixiao Fu, Lin Yuan, Xiaolau Zhang, Jun Zhou, Wei ChenLiveEvalBench将网页生成评估重构为智能体化流程,由Build Engineer、Code Engineer、UI Tester三个角色协作覆盖部署、代码检查和浏览器交互。框架通过共享评分细则与实现落地标准结合,应对多种合法实现。实验显示其评估结果与人类专家高度一致,并对前沿模型的网页生成能力提供细粒度洞察。代码已开源在GitHub。论文LiveEvalBench网页生成智能体推荐理由:LiveEvalBench开源了,用三个AI角色协作评测网页生成,比静态基准更贴近真实开发场景。原文稍后读已读值得跟进有用关注 LiveEvalBench
09:53官方账号arXiv cs.AI@Grace Man Chen, Litao Guo, Yifan Wu, Yiyu Chen, Yenchi Tseng, Sicheng Liu, Yuyu Luo, Ying-Cong Chen论文提出UI2App基准,专门评估从截图推断交互行为的能力,无需文本或行为指导。基准包含327张截图,分为45个状态一致组,用于多路由网页应用。评估沿四个维度:可执行性、导航可达性、视觉保真度和交互推理,其中交互指标(IIS)按功能正确性和状态管理复杂度评分。在6个前沿视觉语言模型上,视觉保真度领先者仅得7.5的IIS,落后IIS冠军5.2倍;半数模型在高复杂度跨页面状态交互上得零。结果显示从静态截图推断完整交互行为仍是关键挑战。论文UI2App基准测试交互推理推荐理由:想测测视觉语言模型能不能只看截图就生成可交互的网页应用?这篇论文提出了UI2App基准,发现模型在视觉还原上还行,但交互推理差得远,最高分才7.5。原文稍后读已读值得跟进有用关注 UI2App