事件专题 ·多源确认

预测者普遍低估 AI 进展:IMO 金牌比专家预测提前五年

这份盘点对比了专家与超级预测者(SF)对 AI 能力的预测与实际结果。OpenAI 在 2025 年 7 月达到 IMO 金牌水平,比专家中位预测的 2030 年提前约五年;MATH 87.8% 和 MMLU 88.7% 的成绩也远超 2022 年时专家 21%/25% 的概率估计。Cybench 90% 于 2026 年达成,早于专家预测的 2028 年。偏差最大的是 LiveCodeBench Pro Hard,2026 年 5 月实际达到 53.8%,而预测仅为 12%-14%。生物风险则相反,实际仅 5%(RCT),低于超级预测者的 16% 和病毒学家的 40%。

当前结论

把专家和超级预测者的 AI 预测跟实际成绩逐条对账,IMO 金牌提前了五年,数字都在这,看看大家都错在哪。

5 个信源73° AI 热度最后更新 2026/9/24 08:26:02

证据链

5 个信源
相关来源 1Artificial Analysis
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。