agentarena·concept

Agent Arena

别名
首次出现
2026-06-04
最近出现
2026-07-27
累计提及
119
§ 01综述

Agent Arena 是一个基于百万级真实智能体任务的大规模模型评估排行榜,由 lmarena.ai 推出,用于衡量语言模型在长期复杂任务中的表现。该平台通过自动化测试和用户投票,提供多维度性能指标。

Agent Arena 近期进展

  • 2025年4月12日:Kimi K3 正式登陆 Agent Arena,接受长期智能体任务评估,其表现将与其他模型进行对比。原文链接
  • 2025年4月12日:Inkling 多模态模型加入 Agent Arena 并开放权重,支持图像与文本混合任务。原文链接
  • 2025年4月11日:Agent Arena 发布排行榜(基于百万真实智能体任务),Meta 的 Muse Spark 1.1 排名第五。原文链接
  • 2025年4月11日:GPT-5.6 Sol 升至第二名(净提升1.6%),缩小与第一名 Claude Fable 的差距;Grok-4.5 排名第13(基于9.8K实时会话),幻觉指标位列第4。原文链接
  • 当前焦点与观察点

  • 竞争格局:榜首争夺激烈,Claude Fable 暂居第一,但 GPT-5.6 Sol 快速追赶。Meta、Anthropic、OpenAI 等巨头持续投入,新入局者(如 Kimi K3、Inkling)加速生态丰富。
  • 评估维度:Agent Arena 强调长期任务完成度、可操纵性、幻觉率等指标,与传统问答式排行榜(如 Chatbot Arena)形成互补,推动模型走向更实用的智能体应用。
  • 争议点:虽然基于百万任务,但任务类型和难度权重可能影响排名公允性;部分模型(如 Grok-4.5)在幻觉指标上表现优异但总排名靠后,提示需要更透明的评分细则。
  • § 02相关报道10 条在档
    1. 01
      GPT-5.6 三变体 Agent Arena 战绩:Sol +10.1%,Terra +4.0%,Luna +3.3%
      lmarena.ai
    2. 02
      GPT-5.6 Terra和Luna加入Agent Arena,排名#15和#17
      lmarena.ai
    3. 03
      Kimi K3 (Max) 登顶 Frontend Code Arena,开放权重和整体均第一
      lmarena.ai
    4. 04
      Agent Arena 排行榜上线,采用因果追踪评测方法
      lmarena.ai
    5. 05
      Kimi K3 (Max)在Agent Arena开放权重模型中登顶
      lmarena.ai
    6. 06
      Kimi K3 (Max) 登顶开源权重 Agent Arena,净提升 +9.75%
      lmarena.ai
    7. 07
      Claude Opus 5登陆Arena,静态基准达Fable 5级,价格减半
      lmarena.ai
    8. 08
      腾讯混元Hy3在Agent Arena和代码竞技场排名靠前
      Hunyuan
    9. 09
      Agent Arena 与 Frontend Code Arena 排行榜发布
      lmarena.ai
    10. 10
      腾讯Hy3在Agent Arena开源模型排第5,总体第25
      lmarena.ai
    § 03邻近话题

    本页综述由 AITOP 基于公开报道整理。原报道版权归各自来源所有。

    /topic/Agent%20Arena