主要来源lmarena.ai
查看原文事件专题 · 多源确认
Agent Arena 上线:AI 智能体能力被量化排名,GPT-5.5 居首
Arena 平台推出 Agent Mode 和 Agent Arena 排行榜,用于评估 AI 智能体在真实任务中的表现。用户可以在 Agent Mode 中让模型执行深度研究、复杂 bash 操作、编写代码、创建幻灯片等任务,每次会话都会贡献到排行榜。排行榜基于 30 万+ 任务、200 万+ 工具调用和 4000 万行代码,通过因果推断衡量任务成功、可操控性、错误恢复、用户反馈和工具幻觉五个信号。目前排名第一的是 OpenAI 的 GPT-5.5(High),其次是 Anthropic 的 Claude-Opus-4.7(Thinking)和智谱的 GLM-5.1。
当前结论
做 AI 智能体开发或选型的团队终于有了可量化的评估标准——Agent Arena 用真实用户任务和因果推断排出了模型的实际能力,值得参考排行榜来选模型或优化自己的智能体。
11 个信源76° AI 热度最后更新 2026/6/5 14:19:06
证据链
相关来源 1rohanpaul_ai
查看原文相关来源 2Fireworks AI
查看原文相关来源 3IT之家
查看原文相关来源 4AI Will
查看原文相关来源 5Mustafa Suleyman
查看原文相关来源 6宝玉
查看原文相关来源 7Anthropic
查看原文相关来源 8cat
查看原文相关来源 9Lenny Rachitsky
查看原文相关来源 10arXiv: Anthropic
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。