主要来源lmarena.ai
查看原文事件专题 · 多源确认
Claude Opus 5 与 GPT 5.6 在 Agent Arena 基准测试对比
OpenAI 的 GPT 5.6 Sol (xHigh) 在 Agent Arena 中排名第四,而 Anthropic 的 Claude Opus 5 (Max) 以 11.88% 的净提升位列第二,Opus 5 (High) 以 11.73% 净提升位列第三。Opus 5 Max 在 Confirmed Success 和 Praise vs Complaint 信号上均排名第一。Fable 5 (High) 在性价比上表现最优。Arena.ai 基于超过 7000 次真实世界智能体会话得出排名。
当前结论
想比较 Claude Opus 5 和 GPT 5.6 在真实智能体任务上的表现?这份报告用 7000+ 次任务告诉你谁更强、谁更划算。
11 个信源82° AI 热度最后更新 2026/7/29 16:00:56
证据链
相关来源 1Poe
查看原文相关来源 2AI Will
查看原文相关来源 3Y Combinator
查看原文相关来源 4IT之家
查看原文相关来源 5Simon Willison’s Weblog
查看原文相关来源 6arXiv: Anthropic
查看原文相关来源 7OpenAI Blog
查看原文相关来源 8向阳乔木
查看原文相关来源 9elvis
查看原文相关来源 10Decoder
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。