事件专题 · 多源确认

OpenAI 发现热门AI编程测试SWE-Bench Pro中约30%任务有缺陷

OpenAI 审查了 SWE-Bench Pro 基准测试,发现约30%的任务存在缺陷。该公司已在官网上撤回对该测试的先前认可。SWE-Bench Pro 常被用于评估AI模型(如 GPT-4)的编程能力,但OpenAI指出许多任务存在数据污染或描述不清的问题。

当前结论

OpenAI自己查了SWE-Bench Pro,发现三成测试题有毛病,所以不认这个榜了。做AI编程的可以看看。

11 个信源73° AI 热度最后更新 2026/7/9 13:23:57

证据链

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情