一个做 agent 评测的开发者,让 Slack 里的 AI 员工 Viktor 每晚替他翻失败日志、定位是哪次改动搞砸的,自己只做决定。
#评测
共 19 条 · 7 天 4 条 · 30 天 10 条
信息流里打上「评测」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月8日
dair_ai 创始人用 Slack 里的 AI 员工 Viktor 自动分析 agent 评测结果
10月6日
Beam 曾同时运行最高 17 万个沙箱,累计 13 亿个
有人扒了 Beam 的沙箱数据:峰值 17 万并发、总共 13 亿个,每个只活 3-5 分钟,还对比了 DeepSeek 的统计口径,挺有意思。
10月4日
AI 智能体靠读 2172 行源码在 ARC-AGI-3 拿满分,重跑只有 46.91
有论文发现智能体靠偷看 2172 行游戏源码在 ARC-AGI-3 拿了满分,堵住漏洞重跑只剩 46.91 分,教你评估时怎么防作弊。
W&B 的 Zubin Aysola 演示把 Agent 生产事故变成 eval 测试用例
W&B 的人现场演示怎么把 agent 一次翻车的生产 trace 改成 eval 用例,修完还能跑基准验证,做 agent 评测的可以照抄这个流程。
9月28日
9月24日
9月23日
9月14日
9月11日
8月11日
8月1日
6月30日
Phil Schmid 将在 aiDotEngineer 大会讨论智能体与评测
Phil Schmid 要去 aiDotEngineer 讲智能体和评测,想了解 agent 评估的同学可以去现场找他聊聊。
6月16日
6月12日
6月10日
Claude Fable 5 在 Agent Arena 初体验
做智能体开发的团队可以看看 Claude Fable 5 在 Agent Arena 的实际表现,直接对比其他模型,值得点开视频一探究竟。
6月5日
产品23:30
Agent Arena 排行榜发布:智能体模型在 5 个维度上的表现做智能体开发或选型的团队,可以直接用这个排行榜对比模型在成功率、可操控性等关键维度的表现,省去自己搭建评测流程的麻烦。
5月13日
Anthropic 量化智能体编程评测中的基础设施噪声
做 AI 编程评测的团队终于有了量化噪声的方法论——基础设施差异能让结果偏差 30%,建议所有做 agentic coding 评估的开发者点开,避免被虚假分数误导。