行业精选72°

OpenAI 指出 SWE-Bench Pro 约 30% 评测任务存在缺陷

OpenAI 挑战 AI 评测基准 SWE-Bench Pro:约 30% 存在评测缺陷

精选理由

OpenAI 扒了权威编程基准的皮,发现三成题有坑,想测 AI 写代码别轻信 SWE-Bench Pro 了。

AI 摘要

OpenAI 分析 Scale AI 推出的编程基准 SWE-Bench Pro,在 731 个公开测试任务中约 30% 存在评测缺陷。前沿模型通过率从 2024 年初的 23.3% 升至 8 个月后的 80.3%,OpenAI 认为该基准已无法有效评估模型能力。人工标注识别出 249 个失效任务(占 34.1%),问题包括测试过严、提示不充分、范围过窄和误导性提示。典型错误是要求行首 1 个空格但隐藏测试要求 2 个空格。OpenAI 撤回对其的采用建议,呼吁设计新基准。

原文 · IT之家

OpenAI 挑战 AI 评测基准 SWE-Bench Pro:约 30% 存在评测缺陷

IT之家 7 月 9 日消息,OpenAI 昨日(7 月 8 日)发布博文, 挑战行业权威评测基准 SWE-Bench Pro,认为在 731 个公开测试任务中,约 30% 存在评测缺陷。 IT之家注:SWE-Bench Pro 是由 Scale AI 推出的大语言模型与 AI 智能体编程能力评测基准,因高度贴近实际企业级开发且具备极高的防作弊标准,现已成为 AI 软件工程领域的行业权威基准。 OpenAI 在博文中指出,在 731 个公开测试任务中,前沿模型在 8 个月内通过率从 23.3% 升至 80.3%,认为该基准已无法有效评估模型的软件开发能力。 OpenAI 介绍称,其数据点分析流程标记出 200 个失效任务,占全部 731 个公开任务的 27.4%;并行开展的人工标注活动识别出 249 个失效任务,占 34.1%。基于上述两条审查路径,OpenAI 预估 WE-Bench Pro 约 30% 的任务存在缺陷。 在问题类型方面,OpenAI 将其划分为 4 类: 测试过严,把题面未写明的实现方式也列为硬性要求 提示不充分,隐藏测试执行未写明、且无法合理推断的要求 测试范围过窄,不完整修复也可能通过。 提示具有误导性,指向与测试要求不一致的行为 OpenAI 还披露一个典型问题,题面要求把内容转为 Markdown 时,行首加入 1 个空格,但隐藏测试却要求 2 个空格,导致模型按说明编写代码仍被判错。 基于这次分析,OpenAI 撤回此前对 SWE-Bench Pro 的采用建议,并称后续需要由资深软件开发者专门为 AI 评测设计新的基准。

OpenAI 指出 SWE-Bench Pro 约 30% 评测任务存在缺陷 · AI 热点