主要来源lmarena.ai
查看原文事件专题 · 多源确认
Claude Sonnet 5 (Thinking) 在Agent Arena排行榜位列第6
Anthropic 发布 Claude Sonnet 5 (Thinking),在 Agent Arena 排行榜上排名第6。该基准测试基于全球用户的数百万个真实长程智能体任务。模型可调用网络搜索、文件系统和终端等工具完成复杂工作流。Claude Sonnet 5 在任务成功率、用户满意度及 bash 能力上表现最强,工具幻觉率保持稳定。其可操控性分数置信区间较宽,仍在稳定中。
当前结论
Anthropic 新出的 Claude Sonnet 5 主打智能体能力,Agent Arena 排第6,能自己规划并用工具完成任务。关心自主执行模型的可以看看它的实际表现。
11 个信源76° AI 热度最后更新 2026/7/7 13:24:50
证据链
相关来源 1shao__meng
查看原文相关来源 2IT之家
查看原文相关来源 3Anthropic
查看原文相关来源 4berryxia
查看原文相关来源 5AI Will
查看原文相关来源 6Decoder
查看原文相关来源 7Sualeh Asif
查看原文相关来源 8Geek
查看原文相关来源 9向阳乔木
查看原文相关来源 10elvis
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。