№last·general
Last
别名
- 首次出现
- 2026-05-22
- 最近出现
- 2026-07-27
- 累计提及
- 216
§ 01综述
Last 指“Agents' Last Exam”(ALE),是一个由AI社区新提出的、针对智能体在真实专业任务中表现的终极基准测试,旨在衡量前沿模型在复杂多步骤工作流上的能力。该测试包含超过1000个精心设计的任务,涉及编程、数据分析、研究等专业领域,目前最佳模型得分不足50%。
Agents' Last Exam 近期进展
2026年7月,OpenAI发布GPT-5.6系列(Luna、Terra、Sol三款模型),其中旗舰模型GPT-5.6 Sol在Agents' Last Exam中取得53.6分,超越此前领先的Claude Fable 5(得分未公开),成为该基准测试的最新冠军。(OpenAI发布GPT-5.6系列:Luna、Terra、Sol三款模型)
基准测试发布者Philipp Schmid透露,ALE设计为包含1000多个真实专业任务,覆盖编程、数据分析、研究等,强调多步骤自主推理。多数模型得分低于50%,显示当前AI在复杂任务中仍远未达到人类专家水平。(Agent 终极基准测试 ALE:1000+ 真实专业任务,最佳模型得分不足 50%)
行业反响显示,ALE被视作评估AI实用性的重要里程碑。OpenAI还聘请了前Scale AI评估专家Calvin Zhang负责模型评估,以提升在ALE等测试上的表现。(Calvin Zhang离开Scale AI加入OpenAI,负责模型评估)
当前焦点与观察点
Last作为基准测试,其设计引发了关于AI评估方向的讨论。一方面,它强调真实多步骤任务,能更准确反映模型的实际应用能力;另一方面,有观点指出测试任务可能仍偏向软件开发领域,对通用智能的衡量存在局限。此外,模型得分突破50%的GPT-5.6 Sol虽领先,但距离人类专家水平仍有较大差距,表明智能体在真实工作流中的可靠性仍是难题。随着OpenAI、Anthropic等持续优化模型,ALE未来可能成为衡量AI进展的“最后一考”,但如何避免过度拟合基准、拓展任务多样性,仍是业界关注的焦点。