主要来源lmarena.ai
查看原文事件专题 ·多源确认
Agent Arena 发布智能体任务榜单:Anthropic 模型居 Code、Work、Chat 三类榜首
Arena.ai 的 Agent Arena 基于 Agent 解决真实任务的在线记录,对模型在 Code、Chat、Work 三类智能体任务上排名。Anthropic 的 Claude Fable 5.1(Max)在 Code 和 Work 排第 1、Chat 排第 2,Claude Sonnet 5.5(Max)在 Chat 排第 1。OpenAI 的 GPT 6 Astra(Max)在三个类别均进前 4,Code 排第 2。Google 的 Gemini 4 Argon(High)Code 排第 14、Work 排第 12,但 Chat 排第 5,显示其在对话类任务上的差异化优势。榜单截至 2026 年 10 月 5 日。
当前结论
Arena.ai 更新了 Agent Arena 榜单,Anthropic 和 OpenAI 的模型在真实任务上谁强谁弱,一目了然。
11 个信源58° AI 热度最后更新 2026/10/5 19:02:23
证据链
11 个信源冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。