模型14:43Agent 终极基准测试 ALE:1000+ 真实专业任务,最佳模型得分不足 50%ALE 揭示了当前 AI 智能体在真实专业任务上的真实水平,做智能体开发或评估的团队值得关注——它可能是衡量 Agent 能力的最后一把尺子。#智能体#基准测试#ALE#真实任务Philipp Schmid@_philschmid原文稍后读已读值得跟进有用关注 智能体