OpenAI 发现一个流行代码基准有30%的题有问题,分数虚高,直接影响了部署和安全判断。做评测或选模型的人得看这个。
OpenAI 审计发现 SWE-Bench Pro 中约30%的任务存在致命缺陷,包括过严测试、题面欠指定、低覆盖测试和误导性题面。此前公开731题上,前沿模型通过率八个月内从23.3%升至80.3%,但分数飙升主要源于评测噪声而非能力提升。OpenAI 采用自动化质检、人机协同深审和人工标注三层流程,人工审核更常判出“坏题”(约30%)。OpenAI 因此撤回对 SWE-Bench Pro 的推荐,呼吁社区设计更可靠、难刷的编程评测基准。
SWE-Bench Pro 不再可靠:~30% 任务存在致命缺陷,OpenAI 撤回推荐 背景:OpenAI 为什么要重新审这个榜 准确评测直接关系到部署与安全判断(含 Preparedness F...
SWE-Bench Pro 不再可靠:~30% 任务存在致命缺陷,OpenAI 撤回推荐 背景:OpenAI 为什么要重新审这个榜 准确评测直接关系到部署与安全判断(含 Preparedness Framework)。此前 OpenAI 已指出 SWE-bench Verified 存在设计与污染问题,分数不再反映真实软件工程能力,于是推荐 SWE-Bench Pro——更长 horizon、更贴近真实改动,从公开/私有仓库的历史变更中抽取任务:模型需实现功能并通过新测试,且不破坏既有行为。 公开 731 题上,前沿模型通过率在约八个月内从 23.3% 升至 80.3%。分数飙升本身就要求追问:进步是能力,还是评测噪声? 方法:如何把「坏题」找出来 目标很明确:失败应反映模型不足,成功应反映对题面要求的完整、有效解。 流程分三层: · 自动化质检:对照题面、模型尝试、评分测试,标出可疑题(约 286 题)。 · 人机协同深审:Codex 类 investigator agent 可进仓库、跑测试、看失败模式;多轮独立审计后由研究员定标。 · 人工标注:每题由 5 名有经验工程师独立审题面、测试与 gold patch,再参考流水线材料;分歧与低置信度升级复审。 人工比 agent 更常判「坏题」,也更常给多标签;两者大类一致约 74%。Agent 路径偏保守,尤其低估 低覆盖测试(人工约 9.4% vs agent 约 4.1%)。 四类主要失效模式 · 过严测试:测的是未在题面要求的实现细节,功能正确也会挂 · 题面欠指定:隐藏测试要求的内容题面未写、也无法合理推断 · 低覆盖测试:测不全,残缺修复也能过 · 误导性题面:把模型引向错误行为,或与测试要求矛盾 讨论:根因与启示 开源 PR 本是给人协作的:描述、合并代码、单测往往经多轮协商,并不天然构成干净、自洽的评测单元。尤其 PR 里的测试常为「验证某次具体改动」而写,而非「实现无关的验收标准」——于是容易过严或与题面错位。 另一面:模型变强后,用 agent 大规模检查题面、测试、patch、trace 变得可行,评测质检本身也在 agent 化。 OpenAI 的主张是:希望社区由有经验工程师专门为测模型能力设计新榜,既保留难度与真实感,又便于全程人工把关。好评测应:难刷、可信、真正反映能力或对齐——因为这些数字会进入部署与安全决策。 Separating signal from noise in coding evaluations openai.com/index/separati… OpenAI @OpenAI We audited SWE-Bench Pro, one of the most widely used AI coding benchmarks, and found it no longer reliably measures frontier coding capability. We find 30% of SWE-Bench Pro tasks to be broken, and are retracting our previous recommendation that the research community use it as a leading coding eval. openai.com/index/separati… 🔗 View Quoted Tweet 💬 1 🔄 0 ❤️ 0 👀 76 📊 1 ⚡