事件专题 · 多源确认

Claude Opus 5 在 Agent Arena 排名第二第三

Anthropic 的 Claude Opus 5 (Max) 在 Agent Arena 中以 11.88% 净改进率位居第二,紧随其后的 Opus 5 (High) 以 11.73% 位列第三。该排名基于超过 7,000 次真实世界智能体会话,且 Opus 5 Max 在 Confirmed Success 和 Praise vs Complaint 信号上均获得第一。默认版本 Opus 5 (High) 在 Praise vs Complaint 信号排第三,在 Confirmed Success 信号排第四。Agent Arena 通过数百万个长期任务评估模型的工具调用和复杂工作流完成能力。

当前结论

Anthropic 的 Opus 5 在 Agent Arena 上超过 GPT-5.6,你也能用自己提示词在 agent 模式里测试它。

11 个信源67° AI 热度最后更新 2026/7/29 17:49:23

证据链

相关来源 3arXiv: Anthropic
查看原文
相关来源 10Simon Willison’s Weblog
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情