8月14日
11:29
11:29官方账号arXiv cs.LG@Zhe Ye, Hantao Lou, Yuechun Sun, Peiyang Song, Zhengxu Yan, Timothe Kasriel, Qingyang Zhang, Kaiyu Yang, Soonho Kong, Jingxuan He, Dawn Song
精选
Vero是首个评估仓库级联合实现与证明合成的基准,包含43个多模块实例。实例来自Python、Dafny、Verus和Coq的真实仓库,覆盖密码协议到分布式系统等领域。每个实例基于Lean 4,支持仅证明和代码加证明两种评估模式。最强智能体配置仅完整解决27/43个实例,在最高难度仓库上未闭合任何规格。
推荐理由:Vero拿43个真实仓库考AI写代码加形式化证明,最强配置只过了27个,想看看代码生成靠谱程度的可以来测测。
8月4日
03:08
7月24日
11:04
11:04官方一手arXiv: Anthropic@Fred Mesnard, Thierry Marianne, Étienne Payet, Wim Vanhoof
本研究通过提示Claude生成Prolog代码和测试,并使用LPTP进行形式化证明。Claude为前33个P-99问题生成了58个逻辑过程、508个测试和257个引理(共11800行证明)。作者手动检查了所有代码和证明,验证了类型、终止性、唯一性等性质。该实验展示了“vibe-coding/vericoding”方法用于Prolog编程的可能性。
推荐理由:一个用Claude写Prolog代码并用LPTP证明正确性的实验。有具体的数字和流程,适合对LLM+形式化验证感兴趣的人。
7月14日
10:02
10:02官方账号arXiv cs.AI@Parastou Fahim, Constantino Lagoa, Rômulo Meira-G'oes
现有LTL学习方案通常假设演示正确,但实际中传感器故障或数据丢失会导致轨迹不确定。本文提出用汉明距离建模不确定性,为每条观测轨迹生成多个可能估计,并通过约束确保每组至少一条与学习公式一致。问题归约为伪布尔优化,在评估中恢复的规范比现有LTL学习方法更接近真实公式。
推荐理由:这篇论文解决了现实场景中演示数据不确定的问题,用汉明距离和伪布尔优化改进LTL学习,结果更靠谱,适合做形式化验证的朋友看看。
7月13日
10:46
10:46官方账号arXiv cs.AI@Chengkai Zhu, Ziao Tang, Guocheng Zhen, Yimeng Cao, Yusheng Zhao, Ranyiliu Chen, Xuanqiang Zhao, Lei Zhang, Xin Wang
哈佛大学研究团队发布了Lean-QIT,一个基于Lean 4定理证明器的库,用于有限维量子信息论的形式化。它提供了量子态、信道、源编码和信道编码的可组合接口,并形式化了Schumacher量子源编码定理、Holevo-Schumacher-Westmoreland经典容量定理及纠缠辅助经典容量定理(含强逆)。该基础设施分离了操作定义与解析刻画,为AI辅助形式化和自动化证明搜索提供了可复用基础。
推荐理由:想用机器验证量子编码定理?Lean-QIT在Lean 4里搭好了整套框架,连HSW定理都形式化了,做量子信息形式化研究的朋友可以复用。
6月12日
10:26
10:26官方账号arXiv cs.AI@Achraf Hsain, Sultan Almuhammadi
本文提出盾牌强化学习(shielded reinforcement learning)不应仅作为运行时安全机制,而应作为设计阶段的分析工具。作者通过一个受约束的双人安全博弈实例,将规范编译、乘积博弈构建、吸引子计算和获胜区域提取等自动机理论方法,用于生成系统的结构性洞察,而非对部署智能体的运行时限制。该方法输出一个“可防御性判定”——一个形式化证书,表明拓扑-规范对是否可防御,并附带获胜区域和盾牌。结合吸引子结构的拓扑级度量和盾牌约束下的对抗多智能体强化学习行为,形成“可防御性指纹”,同时捕捉形式安全属性和自适应博弈下的操作行为。通过假设分析发现,形式可防御性与操作有效性捕捉了安全的不同方面:小的架构变化可导致操作结果的巨大变化,而形式安全裕度几乎不变。因此,盾牌合成最有价值之处不在于作为安全智能体的部署机制,而在于回答系统是否、何处以及如何可防御的架构问题。
推荐理由:这篇论文把盾牌合成从运行时约束工具重新定义为设计阶段的分析框架,做网络安全架构和形式化验证的团队值得一读——它提供了一种新思路,用形式化方法回答“系统到底能不能防住”这个根本问题。
09:44
09:44官方一手arXiv: DeepSeek@Joshua Ong Jun Leang, Zheng Zhao, Mihaela Cătălina Stoian, Qiyuan Xu, Haonan Li, Wenda Li, Shay B. Cohen, Eleonora Giunchiglia
精选73°
Pythagoras-Prover 是一个计算高效的 Lean 定理证明器系列,包含 4B 和 32B 参数的自回归模型,以及首个基于扩散的证明器(4B)。通过课程式监督微调和动态证明过滤,训练效率大幅提升。其 4B 模型在 MiniF2F-Test 上以 86.1% 的 pass@32 超越 DeepSeek-Prover-V2-671B(82.4%),参数减少约 167 倍;32B 模型达到 93.0%,创下开源新纪录。团队还提出了增强型 Lean 形式化方法(ALF),通过扰动已知问题生成变体,减少对表面形式的依赖,并发布了 MiniF2F-ALF 基准。
推荐理由:形式化证明领域终于有了计算高效的实用方案——4B 模型就能超越 671B 巨无霸,做定理证明或形式化验证的团队可以直接用,省下大量算力成本。
5月26日
5月12日