主要来源宝玉
查看原文事件专题 · 多源确认
Agent Arena 排行榜更新:GPT-5.6 Sol 升至第2名
Agent Arena 基于 7.8K 真实世界的 agent 会话评测,GPT-5.6 Sol 位居第2,相比 GPT-5.5 (xHigh) 净提升 +1.6%,缩小了与领先的 Claude Fable 5 的差距。关键信号“Praise vs Complaint”显示 Claude Fable 5 得分为 +17.3%,高于 GPT-5.6 Sol 的 +10.9%。该排行榜由 Arena.ai 维护,通过数百万个长期 agent 任务测量模型表现,并采用因果追踪方法计算相对于平均模型的结果。
当前结论
OpenAI 的 GPT-5.6 Sol 在 Agent Arena 上冲到第2,离 Claude Fable 5 更近了。看看具体指标差异,特别是用户满意度的信号。
11 个信源73° AI 热度最后更新 2026/7/13 21:33:40
证据链
相关来源 1lmarena.ai
查看原文相关来源 2Greg Brockman
查看原文相关来源 3IT之家
查看原文相关来源 4Decoder
查看原文相关来源 5shao__meng
查看原文相关来源 6Simon Willison’s Weblog
查看原文相关来源 7Claude
查看原文相关来源 8arXiv: Anthropic
查看原文相关来源 9AI Engineer
查看原文相关来源 10Sam Altman
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。