OpenAI 让新模型一口气写了 722 篇数学证明,结果 3 篇有错被撤下,14 篇在改。矩阵乘法复杂度那些问题挺有意思,可以翻翻。
#Lean
一篇用 SCI 层级理论拆解自动形式化局限的论文,直接指向 OpenAI 的 Navier-Stokes 证明——Lean 验证过了,原文可能还是错的。
一个 135M 的小模型在 Lean 证明上干翻了 7B 的 DeepSeek-Prover,靠的是让符号引擎算数、模型只做规划,思路挺反直觉的。
Gary Marcus 拆解了 OpenAI 数学成绩背后的门道,说其实靠 Lean 符号验证撑着,顺带回应了关于他的各种争议说法。
OpenAI 的一万个智能体 88 小时写完 166 页 Navier-Stokes 证明,还用 61.6 万行 Lean 验证了,但没人读过全文。这篇 essay 探讨数学界该不该接受这种证明,观点挺有意思。
Anthropic 的 Boris Cherny 拿 Opus 5.5 写 Lean 验证 Claude Agent SDK,几条提示词修出 16 个 bug,并发代码排查可以抄这个思路。
Claude 把黎曼零点下界从 41.6% 推到 67.2%,人类 50 年才推不到 9 个百分点,它一步干了 26 个点。
OpenAI用Astra模型解决了十个多年没人做出来的数学难题,整个研究烧了约2000美元的token,还在Lean里验证过,值得看看。
形式化证明领域终于有了计算高效的实用方案——4B 模型就能超越 671B 巨无霸,做定理证明或形式化验证的团队可以直接用,省下大量算力成本。
Trellis 解决了自动形式化中可靠性与成本之间的平衡问题,做定理证明或形式化验证的开发者可以直接用这个工作流来生成 Lean 证明,值得关注其开源实现。
做数学推理或智能体开发的团队值得关注——LEAP 用通用模型+验证反馈循环就超越了专用系统,说明智能体框架设计比模型本身更关键,建议点开论文看具体架构。