9月2日
09:37
09:37官方账号arXiv cs.AI@Leonardo Ranaldi, Sherrie Shen, Jushi Kai, Alexandra Birch
WorldBench是一个包含1600个任务的多语言基准测试,覆盖7种语言和8种文化。该基准测试通过结构化动作让智能体在沙盒环境中执行日常任务。研究显示前沿模型仅达到49.2%的约束任务成功率(CTS),所有模型在正确性和环境保持方面存在显著差距。
推荐理由:研究人员发布WorldBench基准,测试多语言智能体在真实场景中的表现,发现当前模型在长周期任务中表现脆弱。