主要来源Decoder
查看原文事件专题 · 多源确认
OpenAI 发现热门AI编程测试SWE-Bench Pro中约30%任务有缺陷
OpenAI 审查了 SWE-Bench Pro 基准测试,发现约30%的任务存在缺陷。该公司已在官网上撤回对该测试的先前认可。SWE-Bench Pro 常被用于评估AI模型(如 GPT-4)的编程能力,但OpenAI指出许多任务存在数据污染或描述不清的问题。
当前结论
OpenAI自己查了SWE-Bench Pro,发现三成测试题有毛病,所以不认这个榜了。做AI编程的可以看看。
11 个信源73° AI 热度最后更新 2026/7/9 13:23:57
证据链
相关来源 1OpenAI
查看原文相关来源 2shao__meng
查看原文相关来源 3IT之家
查看原文相关来源 4Greg Brockman
查看原文相关来源 5Genspark
查看原文相关来源 6pandaily
查看原文相关来源 7小互
查看原文相关来源 8Ethan Mollick
查看原文相关来源 9宝玉
查看原文相关来源 10AI Will
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。