主要来源lmarena.ai
查看原文事件专题 ·多源确认
GPT-5.6 Sol在Agent Arena排名第二,净提升1.6%缩小与Claude Fable差距
GPT-5.6 Sol在Agent Arena排行榜上以7800次真实世界智能体会话位列第二。相比GPT-5.5 (xHigh)净提升1.6%。与榜首Claude Fable 5的差距主要来自“表扬 vs 投诉”信号,后者得分+17.3%,GPT-5.6 Sol为+10.9%。Agent Arena基于数百万真实世界长周期任务,使用因果追踪方法评估。GPT-5.6系列(Sol, Terra, Luna)已开始在ChatGPT、Codex和API中推出。
当前结论
OpenAI的GPT-5.6 Sol在Agent Arena上冲到第二,比前代进步明显,和Claude Fable 5差距缩小了,想看看真实任务中模型表现的话值得关注。
11 个信源78° AI 热度最后更新 2026/7/13 16:44:21
证据链
11 个信源冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。