主要来源berryxia
查看原文事件专题 · 多源确认
多个模型在IMO 2026获满分,国产模型Qwen3.8和Kimi K3表现出色
博主@berryxia测试了GPT-SOL-5.6-High、Claude-Fable-5、Qwen3.8-Max-Preview和KIMI K3在IMO 2026(满分42分)中的表现。结果显示GPT-SOL-5.6-High用时14m58s、Qwen3.8-Max-Preview用时45分钟、Kimi K3用时1h32m6s,三者均获得满分42分。Claude-Fable-5未能完成任务。去年仅有Gemini Deep Think和一个实验性OpenAI模型勉强得到35分,今年已有多个主流模型稳定满分。
当前结论
国产模型Qwen3.8和Kimi K3在IMO 2026中拿了满分,速度还很快,想看看它们数学推理能力有多强?
11 个信源78° AI 热度最后更新 2026/7/21 15:20:55
证据链
相关来源 1SuperTechFans
查看原文相关来源 2IT之家
查看原文相关来源 3AI Will
查看原文相关来源 4marktechpost
查看原文相关来源 5岚叔
查看原文相关来源 6lmarena.ai
查看原文相关来源 7Pandaily
查看原文相关来源 8elvis
查看原文相关来源 9歸藏(guizang.ai)
查看原文相关来源 10Greg Brockman
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。