8月14日
11:29
11:29官方账号arXiv cs.LG@Zhe Ye, Hantao Lou, Yuechun Sun, Peiyang Song, Zhengxu Yan, Timothe Kasriel, Qingyang Zhang, Kaiyu Yang, Soonho Kong, Jingxuan He, Dawn Song
精选
Vero是首个评估仓库级联合实现与证明合成的基准,包含43个多模块实例。实例来自Python、Dafny、Verus和Coq的真实仓库,覆盖密码协议到分布式系统等领域。每个实例基于Lean 4,支持仅证明和代码加证明两种评估模式。最强智能体配置仅完整解决27/43个实例,在最高难度仓库上未闭合任何规格。
推荐理由:Vero拿43个真实仓库考AI写代码加形式化证明,最强配置只过了27个,想看看代码生成靠谱程度的可以来测测。
7月13日
10:46
10:46官方账号arXiv cs.AI@Chengkai Zhu, Ziao Tang, Guocheng Zhen, Yimeng Cao, Yusheng Zhao, Ranyiliu Chen, Xuanqiang Zhao, Lei Zhang, Xin Wang
哈佛大学研究团队发布了Lean-QIT,一个基于Lean 4定理证明器的库,用于有限维量子信息论的形式化。它提供了量子态、信道、源编码和信道编码的可组合接口,并形式化了Schumacher量子源编码定理、Holevo-Schumacher-Westmoreland经典容量定理及纠缠辅助经典容量定理(含强逆)。该基础设施分离了操作定义与解析刻画,为AI辅助形式化和自动化证明搜索提供了可复用基础。
推荐理由:想用机器验证量子编码定理?Lean-QIT在Lean 4里搭好了整套框架,连HSW定理都形式化了,做量子信息形式化研究的朋友可以复用。
6月5日
12:07
12:07官方账号arXiv cs.AI@Jui-Hui Chung, Ziyang Cai, Zihao Li, Qishuo Yin, Rohit Agarwal, Simon Park, Rodrigo Porto, Narutatsu Ri, Ziran Yang, Shange Tang, Xingyu Dang, Hongzhou Lin, Mengdi Wang, Danqi Chen, Chi Jin, Liam H Fowl, Sanjeev Arora
精选83°
Goedel-Architect 是一个基于 Lean 4 的智能体框架,通过生成和精炼“蓝图”(定义和引理的依赖图)来简化形式化定理证明。它先根据自然语言证明生成蓝图,然后并行证明每个引理节点,失败节点会驱动全局蓝图精炼,避免了传统递归分解的低效循环。使用开源模型 DeepSeek-V4-Flash 作为骨干,在 MiniF2F-test 上达到 99.2% pass@1,在 PutnamBench 上达到 75.6% pass@1。结合自然语言证明引导,可解决更难的题目,如 IMO 2025 的 4/6 和 Putnam 2025 的 11/12。该框架在开源管道中实现了最先进性能,且成本比同类开源方案低 500 倍。
事件专题

推荐理由:形式化定理证明一直门槛高、成本高,Goedel-Architect 用蓝图+精炼策略大幅提升效率,做数学证明或形式化验证的团队值得关注,开源且成本极低。