#形式化验证
一篇用 SCI 层级理论拆解自动形式化局限的论文,直接指向 OpenAI 的 Navier-Stokes 证明——Lean 验证过了,原文可能还是错的。
OpenAI 的一万个智能体 88 小时写完 166 页 Navier-Stokes 证明,还用 61.6 万行 Lean 验证了,但没人读过全文。这篇 essay 探讨数学界该不该接受这种证明,观点挺有意思。
这论文搞了个 CAPRI 工具,管 LLM 改 Isabelle 证明,能查它有没有动不该动的地方。12 个失败证明跑 180 次,修复率直观看得很清楚,想用 LLM 做形式化证明的可以看看。
OpenAI用Astra模型解决了十个多年没人做出来的数学难题,整个研究烧了约2000美元的token,还在Lean里验证过,值得看看。
DeepMind 用 Lean 4 把 Erdős-Selfridge 问题的一个下界(lcm>10000)变成了机器可检查的定理。对形式化数学和定理证明器感兴趣的话,这个工作很硬核。
一个用Claude写Prolog代码并用LPTP证明正确性的实验。有具体的数字和流程,适合对LLM+形式化验证感兴趣的人。
这论文搞了个叫EG-VAR的框架,用Lean内核做形式化验证,让LLM的推理结果100%可追溯,在TableBench上满分,比普通工具调用靠谱太多了。
这篇论文用Isabelle/HOL把一阶模态逻辑的深和浅嵌入都严格形式化了,还自动化证明了忠实性,做形式化逻辑或模态逻辑验证的值得看。
Mistral 新模型 Leanstral 1.5 专攻形式化验证,能自动找出代码漏洞,数学基准也比同类强。
这篇论文把盾牌合成从运行时约束工具重新定义为设计阶段的分析框架,做网络安全架构和形式化验证的团队值得一读——它提供了一种新思路,用形式化方法回答“系统到底能不能防住”这个根本问题。
形式化证明领域终于有了计算高效的实用方案——4B 模型就能超越 671B 巨无霸,做定理证明或形式化验证的团队可以直接用,省下大量算力成本。
做AI安全验证的团队终于有了兼顾精度和效率的方案——STBP用混合策略解决了传统方法要么太松要么太慢的困境,做视频/3D视觉鲁棒性验证的开发者可以直接参考。
形式化验证团队终于有了LLM能力的基准数据——当前模型无法可靠生成TLA+规范,但渐进式提示和推理对齐是突破口,做形式化方法或分布式系统验证的开发者值得关注。
多组件LLM系统的组合一致性是实际部署中的关键问题,做智能体架构或概率推理的开发者会直接受益——本文提供了可计算的诊断方法和理论边界,值得关注其修复方案。
数学研究者和 AI 爱好者会兴奋——AlphaProof Nexus 用数百美元成本就解决了人类 56 年未解的难题,证明 AI 已能自主推进数学前沿,值得点开看看具体怎么做到的。
程序验证是 AI 安全的关键环节,Claude Code 在 Lean 4 上接近完美的表现意味着做形式化验证的团队可以大幅提升效率,建议关注其编译器闭环范式。
这个案例对做AI辅助形式化验证的团队很有参考价值——它清晰展示了当前AI在局部引理证明上的能力,以及全局推理的瓶颈,做Lean或定理证明器开发的值得点开看看。
做AI规划或程序合成的团队,这篇论文提供了一种减少LLM调用次数、提升生成效率的实用方法——用形式化属性替代分数反馈,直接给反例引导修复,值得点开看看具体实现。
该工作为元Agent的运行时追踪和干预提供了一种形式化、高性能的解决方案,尤其适合需要细粒度回溯和优化的复杂Agent系统开发。其Lean形式化和Git式执行轨迹的设计对AI安全与调试有实际参考价值。