主要来源lmarena.ai
查看原文事件专题 · 多源确认
Agent Arena因果追踪法量化人机协作价值,GLM-5.2和Claude Fable 5登榜
Agent Arena推出了因果追踪方法论,通过分析人类与AI代理协作的追踪数据来量化协作的真实价值,并能观测到广泛的模型行为。基于该方法的新排行榜显示,GLM-5.2 (Max)进入前十,成为最强开源模型,确认成功率比基线高+9.4%,表扬-抱怨比高+14.9%。Claude Fable 5在几乎所有指标上曾排名第一,但因美国政府指令暂停访问。排行榜基于数百万个真实世界长期代理任务,使用因果追踪评估模型相对于平均模型的表现。
当前结论
想看看人机协作到底有没有用?Agent Arena拿数据说话,GLM-5.2开源最强,Claude Fable 5刚登顶就被叫停,这瓜值得吃。
11 个信源82° AI 热度最后更新 2026/6/18 18:47:34
证据链
相关来源 1宝玉
查看原文相关来源 2IT之家
查看原文相关来源 3Pandaily
查看原文相关来源 4elvis
查看原文相关来源 5Decoder
查看原文相关来源 6@koltregaskes
查看原文相关来源 7Clement Delangue
查看原文相关来源 8Epoch AI
查看原文相关来源 9Together AI
查看原文相关来源 10Aadit Sheth
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。