last·general

Last

别名
首次出现
2026-05-22
最近出现
2026-07-27
累计提及
216
§ 01综述

Last 指“Agents' Last Exam”(ALE),是一个由AI社区新提出的、针对智能体在真实专业任务中表现的终极基准测试,旨在衡量前沿模型在复杂多步骤工作流上的能力。该测试包含超过1000个精心设计的任务,涉及编程、数据分析、研究等专业领域,目前最佳模型得分不足50%。

Agents' Last Exam 近期进展

  • 2026年7月,OpenAI发布GPT-5.6系列(Luna、Terra、Sol三款模型),其中旗舰模型GPT-5.6 Sol在Agents' Last Exam中取得53.6分,超越此前领先的Claude Fable 5(得分未公开),成为该基准测试的最新冠军。(OpenAI发布GPT-5.6系列:Luna、Terra、Sol三款模型)
  • 基准测试发布者Philipp Schmid透露,ALE设计为包含1000多个真实专业任务,覆盖编程、数据分析、研究等,强调多步骤自主推理。多数模型得分低于50%,显示当前AI在复杂任务中仍远未达到人类专家水平。(Agent 终极基准测试 ALE:1000+ 真实专业任务,最佳模型得分不足 50%)
  • 行业反响显示,ALE被视作评估AI实用性的重要里程碑。OpenAI还聘请了前Scale AI评估专家Calvin Zhang负责模型评估,以提升在ALE等测试上的表现。(Calvin Zhang离开Scale AI加入OpenAI,负责模型评估)
  • 当前焦点与观察点

    Last作为基准测试,其设计引发了关于AI评估方向的讨论。一方面,它强调真实多步骤任务,能更准确反映模型的实际应用能力;另一方面,有观点指出测试任务可能仍偏向软件开发领域,对通用智能的衡量存在局限。此外,模型得分突破50%的GPT-5.6 Sol虽领先,但距离人类专家水平仍有较大差距,表明智能体在真实工作流中的可靠性仍是难题。随着OpenAI、Anthropic等持续优化模型,ALE未来可能成为衡量AI进展的“最后一考”,但如何避免过度拟合基准、拓展任务多样性,仍是业界关注的焦点。

    § 02相关报道10 条在档
    1. 01
      GPT-5.6 Sol在“The Last Ones”网络靶场创下网络安全新纪录
      OpenAI
    2. 02
      GPT-5.6 Sol 在网络安全领域达到最先进水平,可发现和修复新型漏洞
      Greg Brockman
    3. 03
      BrainPilot:开源多智能体系统加速脑科学研究
      arXiv cs.AI
    4. 04
      OpenAI 发布 GPT-5.6 系列模型,性能大幅提升且成本降低
      SuperTechFans
    5. 05
      GPT-5.6 Sol 在 Agents' Last Exam 中创 53.6 高分
      AI Will
    6. 06
      OpenAI发布GPT-5.6系列:Luna、Terra、Sol三款模型
      Simon Willison’s Weblog
    7. 07
      GPT-5.6 Sol在Agents' Last Exam上以53.6分超越Claude Fable 5
      OpenAI
    8. 08
      Calvin Zhang离开Scale AI加入OpenAI,负责模型评估
      AI Will
    9. 09
      Jerry Liu:编程抽象转向英文,用markdown写Agent
      Jerry Liu
    10. 10
      Agent 终极基准测试 ALE:1000+ 真实专业任务,最佳模型得分不足 50%
      Philipp Schmid
    § 03邻近话题

    本页综述由 AITOP 基于公开报道整理。原报道版权归各自来源所有。

    /topic/Last