一个从数据、工具到权重全开源的 Lean 4 定理证明器,用 AlphaProof 万分之一不到的算力拿到 MiniF2F 50.8% pass@16,搞形式化验证的可以自己复现了。
#Lean 4
Read this if you're interested in how generative AI is revolutionizing machine verification and the Salt method's impact on productivity. It's a fascinating look at the future of AI development without human intervention.
一个神经外科医生借 GPT-5.6 证明了 Crouzeix 猜想,数学家集体震惊。完整提示词和代码都开源了,可以看看。
DeepMind 用 Lean 4 把 Erdős-Selfridge 问题的一个下界(lcm>10000)变成了机器可检查的定理。对形式化数学和定理证明器感兴趣的话,这个工作很硬核。
这论文搞了个叫EG-VAR的框架,用Lean内核做形式化验证,让LLM的推理结果100%可追溯,在TableBench上满分,比普通工具调用靠谱太多了。
Mistral AI 新出的 Leanstral 1.5,专攻数学证明,miniF2F满分,解决成本只要几美元,比竞品便宜几十倍,搞形式化验证的可以试试。
Mistral 新模型 Leanstral 1.5 专攻形式化验证,能自动找出代码漏洞,数学基准也比同类强。
Mistral开源了Leanstral 1.5,一个能解数学竞赛题的Lean 4代码模型,Apache-2.0免费商用,实测解决587道Putnam难题,值得看看。
形式化定理证明一直门槛高、成本高,Goedel-Architect 用蓝图+精炼策略大幅提升效率,做数学证明或形式化验证的团队值得关注,开源且成本极低。
形式验证是 AI 生成代码质量保障的关键,做 AI 安全或软件验证的开发者可以直接用这个基准测试自己的模型,看看能否补全 Lean 证明。
程序验证是 AI 安全的关键环节,Claude Code 在 Lean 4 上接近完美的表现意味着做形式化验证的团队可以大幅提升效率,建议关注其编译器闭环范式。
这个案例对做AI辅助形式化验证的团队很有参考价值——它清晰展示了当前AI在局部引理证明上的能力,以及全局推理的瓶颈,做Lean或定理证明器开发的值得点开看看。
该基准填补了形式化定理证明中奖励模型评估工具的空白,揭示专用定理证明模型在评估任务上的不足,为改进RL训练信号提供了明确方向。