行业多源确认88°09:23SWE-Bench Pro 约30%任务存在缺陷,OpenAI 撤回推荐OpenAI 发现一个流行代码基准有30%的题有问题,分数虚高,直接影响了部署和安全判断。做评测或选模型的人得看这个。#SWE-Bench Pro#OpenAI#基准测试#代码评测10 个信源在谈事件专题shao__meng@shao__meng11 个信源在谈原文稍后读已读值得跟进有用关注 SWE-Bench Pro