事件专题 ·多源确认

Agent Arena 发布智能体任务榜单:Anthropic 模型居 Code、Work、Chat 三类榜首

Arena.ai 的 Agent Arena 基于 Agent 解决真实任务的在线记录,对模型在 Code、Chat、Work 三类智能体任务上排名。Anthropic 的 Claude Fable 5.1(Max)在 Code 和 Work 排第 1、Chat 排第 2,Claude Sonnet 5.5(Max)在 Chat 排第 1。OpenAI 的 GPT 6 Astra(Max)在三个类别均进前 4,Code 排第 2。Google 的 Gemini 4 Argon(High)Code 排第 14、Work 排第 12,但 Chat 排第 5,显示其在对话类任务上的差异化优势。榜单截至 2026 年 10 月 5 日。

当前结论

Arena.ai 更新了 Agent Arena 榜单,Anthropic 和 OpenAI 的模型在真实任务上谁强谁弱,一目了然。

11 个信源58° AI 热度最后更新 2026/10/5 19:02:23

证据链

11 个信源
相关来源 2Clement Delangue
查看原文
相关来源 3VTV Công nghệ
查看原文
相关来源 9AWS Machine Learning Blog
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。