国产模型Qwen3.8和Kimi K3在IMO 2026中拿了满分,速度还很快,想看看它们数学推理能力有多强?
博主@berryxia测试了GPT-SOL-5.6-High、Claude-Fable-5、Qwen3.8-Max-Preview和KIMI K3在IMO 2026(满分42分)中的表现。结果显示GPT-SOL-5.6-High用时14m58s、Qwen3.8-Max-Preview用时45分钟、Kimi K3用时1h32m6s,三者均获得满分42分。Claude-Fable-5未能完成任务。去年仅有Gemini Deep Think和一个实验性OpenAI模型勉强得到35分,今年已有多个主流模型稳定满分。
兄弟们,国产模型高光时刻来了。结果有点牛逼。 去年IMO大赛,只有Gemini Deep Thin…
兄弟们,国产模型高光时刻来了。结果有点牛逼。
去年IMO大赛,只有Gemini Deep Think和一个实验性OpenAI模型勉强拿到35分。
而就在今年刚刚结束IMO 2026 大赛中,我实测了模型GPT-SOL-5.6-High 、Claude-Fable-5 、Qwen3.8-Max-Preview、KIMI K3 模型,满分为42分,6道题目。
结论: 3个模型全部执行完成任务并且得分为满分42分,Fable 5 把我的额度干没了还没有完成任务。
因为结果都正确,时间排序如下: 1、 GPT-SOL-5.6-High (14m58s), 2、Qwen3.8-Max-Preview (45mins), 3、Kimi K3 (1h32m6s)
每个模型都是一次性解决所有问题,与博主@@deedydas 测试的时间和次数有点不同。基本都是一次性在CLI终端跑完。
去年还是“接近人类顶尖水平”,今年已经变成多个主流模型都能稳定一次过。
数学竞赛这种需要严密推理、多步推导、创造性解题的顶级人类挑战,现在对前沿模型来说已经不是障碍了。
速度的问题也可能受到API速率和算力的影响,真的没有想到如今已经IMO都可以轻松完赛啊!
真的是感慨AI的前沿领域已经正式远远超越了国际数学奥林匹克竞赛(IMO)的数学范畴啊。