事件专题 · 多源确认

SWE-Bench Pro 约30%任务存在缺陷,OpenAI 撤回推荐

OpenAI 审计发现 SWE-Bench Pro 中约30%的任务存在致命缺陷,包括过严测试、题面欠指定、低覆盖测试和误导性题面。此前公开731题上,前沿模型通过率八个月内从23.3%升至80.3%,但分数飙升主要源于评测噪声而非能力提升。OpenAI 采用自动化质检、人机协同深审和人工标注三层流程,人工审核更常判出“坏题”(约30%)。OpenAI 因此撤回对 SWE-Bench Pro 的推荐,呼吁社区设计更可靠、难刷的编程评测基准。

当前结论

OpenAI 发现一个流行代码基准有30%的题有问题,分数虚高,直接影响了部署和安全判断。做评测或选模型的人得看这个。

11 个信源88° AI 热度最后更新 2026/7/9 00:33:20

证据链

相关来源 10Latent Space (swyx)
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情