事件专题 · 多源确认

GPT-5.6 Sol在Agent Arena排名第二,净提升1.6%缩小与Claude Fable差距

GPT-5.6 Sol在Agent Arena排行榜上以7800次真实世界智能体会话位列第二。相比GPT-5.5 (xHigh)净提升1.6%。与榜首Claude Fable 5的差距主要来自“表扬 vs 投诉”信号,后者得分+17.3%,GPT-5.6 Sol为+10.9%。Agent Arena基于数百万真实世界长周期任务,使用因果追踪方法评估。GPT-5.6系列(Sol, Terra, Luna)已开始在ChatGPT、Codex和API中推出。

当前结论

OpenAI的GPT-5.6 Sol在Agent Arena上冲到第二,比前代进步明显,和Claude Fable 5差距缩小了,想看看真实任务中模型表现的话值得关注。

11 个信源78° AI 热度最后更新 2026/7/13 16:44:21

证据链

相关来源 4AWS Machine Learning Blog
查看原文
相关来源 7Simon Willison’s Weblog
查看原文
相关来源 8歸藏(guizang.ai)
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情