capabilities

general · 首次出现 2026-05-22 · 最近出现 2026-09-10 · 累计提及 139

综述

  • capabilities 是人工智能领域衡量模型性能的关键指标,代表着模型在特定任务上的表现能力。
  • capabilities 近期进展

  • DeepSeek Harness 把 Prompt 做成运行时,能力模块自带 Prompt 指导:DeepSeek Harness 引入了Prompt作为运行时的一部分,这提高了模型在特定任务上的能力。
  • Moonshot Kimi K3 以 156 分刷新 ECI 开放权重纪录:Moonshot Kimi K3 在 Epoch 能力指数(ECI)上取得了156分,刷新了开放权重纪录。
  • GLM-5.2 在 Epoch 能力指数获开源模型最高分152:GLM-5.2 在ECI上获得了152分,成为开源模型中的最高分。
  • ECI 榜单显示前沿 AI 模型领先地位平均仅维持 7 周:ECI榜单显示,前沿AI模型的领先地位平均仅维持7周,表明竞争非常激烈。
  • 当前焦点与观察点

  • GPT-4统治期长达一年,当前顶级模型仅维持七周(Decoder):GPT-4曾统治AI模型领域一年,但现在的顶级模型领先地位仅维持7周。
  • GPT-4 在Epoch Capabilities Index领先352天,远超其他模型(Epoch AI):GPT-4在ECI上领先352天,显示了其在能力指数上的优势。
  • Claude Fable 5 在 ECI 上获 161 分,超越 GPT-5.5 Pro(Epoch AI):Claude Fable 5 在ECI上以161分超越GPT-5.5 Pro,表明其在能力上的提升。
  • ABC-Bench:评估LLM智能体的生物安全能力基准(arXiv: OpenAI):ABC-Bench是一个新的基准,用于评估大型语言模型(LLM)在生物安全领域的智能体能力。
  • 理解LLM的能力、局限与社会影响(OpenAI Blog):OpenAI探讨了LLM的能力、局限以及它们对社会的影响。
  • 相关报道

    10 条在档