主要来源IT之家
查看原文事件专题 · 多源确认
OpenAI 指出 SWE-Bench Pro 约 30% 评测任务存在缺陷
OpenAI 分析 Scale AI 推出的编程基准 SWE-Bench Pro,在 731 个公开测试任务中约 30% 存在评测缺陷。前沿模型通过率从 2024 年初的 23.3% 升至 8 个月后的 80.3%,OpenAI 认为该基准已无法有效评估模型能力。人工标注识别出 249 个失效任务(占 34.1%),问题包括测试过严、提示不充分、范围过窄和误导性提示。典型错误是要求行首 1 个空格但隐藏测试要求 2 个空格。OpenAI 撤回对其的采用建议,呼吁设计新基准。
当前结论
OpenAI 扒了权威编程基准的皮,发现三成题有坑,想测 AI 写代码别轻信 SWE-Bench Pro 了。
11 个信源72° AI 热度最后更新 2026/7/9 07:44:27
证据链
相关来源 1OpenAI Blog
查看原文相关来源 2shao__meng
查看原文相关来源 3Decoder
查看原文相关来源 4AI Will
查看原文相关来源 5marktechpost
查看原文相关来源 6@OpenAIDevs
查看原文相关来源 7@koltregaskes
查看原文相关来源 8Greg Brockman
查看原文相关来源 9Genspark
查看原文相关来源 10pandaily
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。