#智能体评估
Khosla Ventures 官宣投委会级别的合作:给 LMArena 背书,这家做模型排行榜的团队现在开始测真实环境里的智能体表现了。
LangChain 实测 Jev 当智能体评估裁判:单次 0.44 秒、整轮 0.34 美元,比 Claude 便宜 83 倍。
想了解如何评估不同智能体框架,Amazon Bedrock AgentCore 评估服务值得一试,无需关心具体框架,只需关注OpenTelemetry数据即可。
如果你在用 LangSmith 调试 agent,这个教程教你用 harborframework 一键跑评估,还带完整追踪,省去手动排查的麻烦。
这篇论文发布了MacAgentBench,一个包含676个macOS桌面任务的智能体基准。它用细粒度评分发现Claude Opus 4.6配合OpenClaw能拿到73.7%的正确率,而且不同模型表面分一样但实际完成能力差很多,值得研究智能体的去看。
做智能体评测或基准测试的团队终于有了一个通用框架——AgentBeats 用智能体评估智能体,解决了传统测试碎片化、难复现的痛点,建议做 Agent 平台或竞赛的开发者点开看看。
做游戏 AI 或 VLM 智能体评估的团队,终于有了一个能同时看冷启动能力和学习改进曲线的统一基准,比单次分数更有参考价值,做智能体训练的值得点开。
Anthropic 首次公开为 Claude Code 招聘模型性能方向的 PM,说明智能体评估正从研究走向产品化。做 AI 产品经理或智能体开发的团队,可以从中看到行业对 agentic evals 的重视程度,值得关注。
做 Agent 系统或智能体框架的开发者,别再只盯着 token 和调用次数了——这篇论文给出了一个更聪明的衡量标准,直接帮你判断系统是否真的在“学习”。建议点开看看 EFC 怎么算,能省不少试错成本。