事件专题 · 多源确认

OpenAI 指出 SWE-Bench Pro 约 30% 评测任务存在缺陷

OpenAI 分析 Scale AI 推出的编程基准 SWE-Bench Pro,在 731 个公开测试任务中约 30% 存在评测缺陷。前沿模型通过率从 2024 年初的 23.3% 升至 8 个月后的 80.3%,OpenAI 认为该基准已无法有效评估模型能力。人工标注识别出 249 个失效任务(占 34.1%),问题包括测试过严、提示不充分、范围过窄和误导性提示。典型错误是要求行首 1 个空格但隐藏测试要求 2 个空格。OpenAI 撤回对其的采用建议,呼吁设计新基准。

当前结论

OpenAI 扒了权威编程基准的皮,发现三成题有坑,想测 AI 写代码别轻信 SWE-Bench Pro 了。

11 个信源72° AI 热度最后更新 2026/7/9 07:44:27

证据链

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情