事件专题 ·多源确认

Agent基准测试需评估评分者而非仅任务

Parsewave审查了Zapier的AutomationBench中全部600个公开任务,发现206个评分者存在缺陷。研究人员使用智能体生成看似正确但实际错误的答案,验证评分者准确性。修复后的评分者在1,235次Kimi K3测试中,27.9%的情况下给出不同评分结果。任务813案例显示,原评分者仅检查Salesforce笔记而忽略DocuSign模板,错误通过13项检查。

当前结论

Zapier的AutomationBench基准测试被多家前沿实验室引用,但评分者存在严重缺陷,修复后评分差异达27.9%。

5 个信源73° AI 热度最后更新 2026/10/6 21:55:21

证据链

5 个信源

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。