主要来源Artificial Analysis
查看原文事件专题 · 多源确认
Artificial Analysis 更新编程智能体排行:DeepSWE 取代 SWE-Bench Pro,Claude Fable 5 登顶
Artificial Analysis 更新了其编程智能体指数,用 Datacurve 的 DeepSWE 基准测试取代了 SWE-Bench Pro。DeepSWE 从零编写任务,避免模型从公开 GitHub 问题或 PR 中记忆答案,解决了原基准可被游戏化的问题。更新后,Codex with GPT-5.5 (xhigh) 得分从 65 升至 76,超越 Claude Code with Opus 4.8 (max) 的 73 分;新发布的 Claude Fable 5 (max) 在 Claude Code 中以 77 分位居榜首。这一变化揭示了原基准对某些模型组合的偏差。
当前结论
基准测试更新直接影响了主流编程智能体的排名,做 AI 编程工具选型或评估模型能力的开发者值得关注——Claude Fable 5 新登顶,Codex 也大幅提升,建议点开看具体得分和对比。
11 个信源73° AI 热度最后更新 2026/6/12 07:09:35
证据链
相关来源 1lmarena.ai
查看原文相关来源 2Decoder
查看原文相关来源 3Aravind Srinivas
查看原文相关来源 4shao__meng
查看原文相关来源 5AI Will
查看原文相关来源 6rohanpaul_ai
查看原文相关来源 7Nous Research
查看原文相关来源 8Perplexity
查看原文相关来源 9IT之家
查看原文相关来源 10小互
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。