22:39elvis@omarsar0精选一篇新论文主张自改进智能体在优化自身的同时也应演化其评估基准。研究者实现了一个自进化的Lean证明智能体,其工作流、提示和工具均可被重写。该智能体采用共同进化课程,仅在当前难度被掌握后才引入更难的证明任务。经过15代进化,共同进化智能体在miniF2F上的留出解决率达到45.1%,而种子版本仅为12.7%,固定基准最优版本为32.0%。论文强调将每步奖励锚定在形式验证器上,可避免奖励黑客攻击。论文自改进智能体共同进化形式验证推荐理由:这篇论文提出智能体和基准一起进化,15代后证明正确率从12.7%飙升到45.1%,思路很新。原文稍后读已读值得跟进有用关注 自改进智能体
16:00IT之家(博客/媒体)精选Mistral AI 于7月2日发布 Leanstral 1.5 模型,拥有119B参数(激活6B),采用Apache-2.0开源。该模型在miniF2F形式数学基准测试的验证集和测试集上均达100%完成率。在PutnamBench数学竞赛的672道Lean 4问题中可解决587道,FATE-H硕士级基准达成率87%,FATE-X博士级达成率34%,均为最佳表现。其平均解决成本仅4美元,远低于Seed-Prover 1.5的300美元以上和Aleph Prover的54~68美元。实际测试中在57个代码库标记47个违规属性,发现11个真实缺陷,含5个此前未报告的问题。AI模型Leanstral 1.5Mistral AILean 4推荐理由:Mistral AI 新出的 Leanstral 1.5,专攻数学证明,miniF2F满分,解决成本只要几美元,比竞品便宜几十倍,搞形式化验证的可以试试。原文稍后读已读值得跟进有用关注 Leanstral 1.5