事件专题 · 多源确认

Claude Opus 5 与 GPT 5.6 在 Agent Arena 基准测试对比

OpenAI 的 GPT 5.6 Sol (xHigh) 在 Agent Arena 中排名第四,而 Anthropic 的 Claude Opus 5 (Max) 以 11.88% 的净提升位列第二,Opus 5 (High) 以 11.73% 净提升位列第三。Opus 5 Max 在 Confirmed Success 和 Praise vs Complaint 信号上均排名第一。Fable 5 (High) 在性价比上表现最优。Arena.ai 基于超过 7000 次真实世界智能体会话得出排名。

当前结论

想比较 Claude Opus 5 和 GPT 5.6 在真实智能体任务上的表现?这份报告用 7000+ 次任务告诉你谁更强、谁更划算。

11 个信源82° AI 热度最后更新 2026/7/29 16:00:56

证据链

相关来源 5Simon Willison’s Weblog
查看原文
相关来源 6arXiv: Anthropic
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情