AITOPAI热报
今日精选全部动态早读东盟 AIAgent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOPAI热报

PRM

共 1 条相关 AI 资讯
9月3日
12:06
12:06官方账号arXiv cs.LG@Kelvin Li, Dhruv Pendharkar, Anish Pahilajani, Chuyi Shang, Leon Oks, Leonid Karlinsky, Rogerio Feris, Trevor Darrell, Roei Herzig
研究人员提出了一种名为predicted-state matching的新型训练目标,用于Web Agent的世界模型训练。该方法使用从WebArena Go-Browse轨迹中生成的分支式数据集,使模型能够区分真实结果状态与其他替代动作导致的状态。实验表明,该方法在预测状态匹配基准上优于传统监督式预测模型,在WebPRMBench上提升了PRM式动作排名,并在WebArena-Lite上提高了端到端任务成功率。
论文WebArenaWeb Agent世界模型

推荐理由:斯坦福团队新论文提出Web Agent世界模型新训练方法,在WebArena基准上表现更好。
原文
精选动态早读东盟登录