主要来源lmarena.ai
查看原文事件专题 · 多源确认
GPT-5.6 Sol在Agent Arena排名第二,净提升1.6%缩小与Claude Fable差距
GPT-5.6 Sol在Agent Arena排行榜上以7800次真实世界智能体会话位列第二。相比GPT-5.5 (xHigh)净提升1.6%。与榜首Claude Fable 5的差距主要来自“表扬 vs 投诉”信号,后者得分+17.3%,GPT-5.6 Sol为+10.9%。Agent Arena基于数百万真实世界长周期任务,使用因果追踪方法评估。GPT-5.6系列(Sol, Terra, Luna)已开始在ChatGPT、Codex和API中推出。
当前结论
OpenAI的GPT-5.6 Sol在Agent Arena上冲到第二,比前代进步明显,和Claude Fable 5差距缩小了,想看看真实任务中模型表现的话值得关注。
11 个信源78° AI 热度最后更新 2026/7/13 16:44:21
证据链
相关来源 1宝玉
查看原文相关来源 2IT之家
查看原文相关来源 3Greg Brockman
查看原文相关来源 4AWS Machine Learning Blog
查看原文相关来源 5Decoder
查看原文相关来源 6Sam Altman
查看原文相关来源 7Simon Willison’s Weblog
查看原文相关来源 8歸藏(guizang.ai)
查看原文相关来源 9Ethan Mollick
查看原文相关来源 10小互
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。