主要来源AI Will
查看原文事件专题 · 多源确认
OpenAI 重建 AI 评测体系,旧基准已无法区分能力
OpenAI frontier evals 负责人 Tejal Patwardhan 指出,现有基准测试如旧考试已变得过于简单,模型接近 100% 通过后无法区分真实能力。OpenAI 正在构建新评估框架,以更准确衡量前沿模型的真正水平。此举旨在避免模型仅通过刷分应付测试,确保评测能反映实际进步。
当前结论
OpenAI 自己都觉得旧考试太水了,新评测体系怎么玩?来看看他们怎么重新定义能力
11 个信源67° AI 热度最后更新 2026/6/17 09:19:40
证据链
相关来源 1kimmonismus
查看原文相关来源 2Decoder
查看原文相关来源 3OpenAI Blog
查看原文相关来源 4Aadit Sheth
查看原文相关来源 5向阳乔木
查看原文相关来源 6pandaily
查看原文相关来源 7IT之家
查看原文相关来源 8Gary Marcus
查看原文相关来源 9@koltregaskes
查看原文相关来源 10Jim Fan
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。