主要来源lmarena.ai
查看原文事件专题 · 多源确认
Claude Fable 5 进入 Agent 模式,Agent Arena 排行榜揭晓
Anthropic 的 Claude Fable 5 模型已上线 Agent 模式,用户可在 Agent Arena 中测试其智能体能力。Agent Arena 是一个基于真实用户任务的智能体评估平台,通过数百万次实时会话衡量模型在代码编写、网页搜索、文件操作等复杂工作流中的表现。排行榜基于 30 万+任务、200 万+工具调用和 4000 万行代码构建,当前排名第一的是 OpenAI 的 GPT-5.5 (High),Claude-Opus-4.7 (Thinking) 位列第二。评估信号包括任务成功率、可操控性、错误恢复、用户反馈和工具幻觉等。
当前结论
想对比主流模型在真实任务中的智能体能力?Agent Arena 用 30 万+任务和 200 万+工具调用给出了量化排名,做 AI 应用选型的团队可以直接参考排行榜做决策。
11 个信源83° AI 热度最后更新 2026/6/9 18:58:11
证据链
相关来源 1AI Will
查看原文相关来源 2rohanpaul_ai
查看原文相关来源 3Genspark
查看原文相关来源 4宝玉
查看原文相关来源 5Aravind Srinivas
查看原文相关来源 6IT之家
查看原文相关来源 7Alex Albert
查看原文相关来源 8Lovable
查看原文相关来源 9Notion
查看原文相关来源 10Cognition
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。