#智能体评估

共 20 条 · 7 天 2 条 · 30 天 5 条
信息流里打上「智能体评估」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月9日
10月1日
9月22日
9月21日
8月27日
8月7日
8月5日
7月7日
7月2日
6月30日
6月23日
论文多源确认11:03
MacAgentBench:在真实macOS桌面上评估AI智能体的基准

这篇论文发布了MacAgentBench,一个包含676个macOS桌面任务的智能体基准。它用细粒度评分发现Claude Opus 4.6配合OpenClaw能拿到73.7%的正确率,而且不同模型表面分一样但实际完成能力差很多,值得研究智能体的去看。

事件专题
arXiv cs.AI@Yikun Fu 等 13 人4 个信源在谈原文
6月18日
6月12日
6月9日
6月5日
行业Agent 与开发者多源确认08:25
Anthropic 招聘 Claude Code PM,专注模型性能与智能体评估

Anthropic 首次公开为 Claude Code 招聘模型性能方向的 PM,说明智能体评估正从研究走向产品化。做 AI 产品经理或智能体开发的团队,可以从中看到行业对 agentic evals 的重视程度,值得关注。

事件专题
cat@_catwu11 个信源在谈原文
6月1日
5月12日