主要来源shao__meng
查看原文事件专题 · 多源确认
SWE-Bench Pro 约30%任务存在缺陷,OpenAI 撤回推荐
OpenAI 审计发现 SWE-Bench Pro 中约30%的任务存在致命缺陷,包括过严测试、题面欠指定、低覆盖测试和误导性题面。此前公开731题上,前沿模型通过率八个月内从23.3%升至80.3%,但分数飙升主要源于评测噪声而非能力提升。OpenAI 采用自动化质检、人机协同深审和人工标注三层流程,人工审核更常判出“坏题”(约30%)。OpenAI 因此撤回对 SWE-Bench Pro 的推荐,呼吁社区设计更可靠、难刷的编程评测基准。
当前结论
OpenAI 发现一个流行代码基准有30%的题有问题,分数虚高,直接影响了部署和安全判断。做评测或选模型的人得看这个。
11 个信源88° AI 热度最后更新 2026/7/9 00:33:20
证据链
相关来源 1OpenAI
查看原文相关来源 2Decoder
查看原文相关来源 3IT之家
查看原文相关来源 4techcrunch
查看原文相关来源 5AI Will
查看原文相关来源 6@koltregaskes
查看原文相关来源 7Greg Brockman
查看原文相关来源 8Genspark
查看原文相关来源 9pandaily
查看原文相关来源 10Latent Space (swyx)
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。