7月30日
09:27
09:27官方账号arXiv cs.LG@Joachim Bona-Pellissier, Giacomo Meanti, Matteo Santacesaria, Lorenzo Rosasco
本论文提出PIKS(物理信息核方法),在通用核(如高斯核或Matérn核)下证明了对线性微分约束的普适一致性,即估计器能渐近学习目标并满足物理约束。作者推导了在适当源条件下的有限样本界,将经典核方法的算子理论分析扩展至物理信息机器学习。数值实验表明,PIKS在多个问题上与PINNs及传统有限元方法具有竞争力。
推荐理由:这篇论文给核方法在物理信息学习里补上了理论短板,证明用高斯核就能渐近满足约束,还跟PINNs比了效果,搞理论的值得看。
09:26
09:26官方账号arXiv cs.LG@Fengming Yu, Haiwei Pan, Kejia Zhang, Chunling Chen, Jian Guan, Baoying Ma
CoCaRS 提出一种基于相关校准的冗余抑制方法,用于解决异构知识蒸馏中教师和学生模型架构差异导致的表示不一致问题。该方法通过混淆证据估计和强度分配控制校准特征去相关,并采用自适应系数调节降低对超参数的敏感性。在 CIFAR-100 和 ImageNet-1K 上的实验验证了 CoCaRS 能提升蒸馏性能并减少系数设置敏感度。
推荐理由:想提升异构模型蒸馏效果?CoCaRS 用三种新模块解决特征冗余和系数敏感问题,实验在 CIFAR-100 和 ImageNet-1K 上表现更好。
09:21
09:21官方一手arXiv: OpenAI@Nicholas T. Runcie, Fergus Imrie, Charlotte M. Deane
NISPO是一个基于RDKit的开源Python包,用于生成系统IUPAC名称。它由OpenAI Codex配合GPT-5.5模型通过自改进循环开发而来。在SureChEMBL的268万分子上训练后,在PubChem的1.03亿测试集上达到98.1%的往返准确率。NISPO使用OPSIN工具验证名称正确性。项目已开源在GitHub。
事件专题

推荐理由:想自动生成分子IUPAC名称?试试NISPO,开源、基于RDKit,在1亿分子上验证准确率98.1%。
09:20
09:20官方一手arXiv: DeepSeek@Peiding Wang, Li Zhang, Fang Liu, Taichuan Li, Yinghao Zhu
CodeSpec提出双可执行规范方法,从子需求语义与仓库架构配对构建可靠功能链,并编译为互补的架构和行为规范。在FeatureBench上,使用DeepSeek-V4-Pro达到70.7%、55.0%和49.9%的通过率,优于Claude Code等基线。在NL2Repo-Bench上验证了泛化性。该方法通过可执行规范保证长周期开发中设计与实现的一致性。
事件专题

推荐理由:这篇论文搞了个CodeSpec,让代码智能体在仓库里加新功能时先建可执行规范,在FeatureBench上用DeepSeek-V4-Pro跑到70.7%通过率,比Claude Code靠谱不少。
09:17
09:17官方账号arXiv cs.LG@Petr Simecek, Elnaz Babayeva, Jiri Balhar, Michal Bida, Michal Buran, Vaclav Cadek, Luigino Camastra, Tomas Dulka, Michal Janocko, Tomas Klohna, Pavel Kohout, Ondrej Kokes, Adam Krivka, Jakub Kubik, Patrik Mada, Igor Morgenstern, Marek Pavelka, Joshua Rogers, Petr Stastny, Jan Tattermusch, Dmitrijs Trizna, Martin Votruba, Guido Vranken, Jakub Zikl, Evelina Gabasova, Stanislav Fort
论文提出HoF-Bench基准,由AISLE发现的95个真实CVE组成,覆盖8个开源仓库。在严格协议下,一个最小化LLM分析器重新发现了65个CVE(68%)。10个检测骨干包括5个开源模型(21B-284B参数)和5个专有小模型,均无前沿模型参与。基准提供7,600条模型-CVE通过记录,用于比较漏洞扫描器的可靠性。数据集已在Hugging Face发布。
推荐理由:想看开源模型能不能真挖漏洞?这个基准用95个真实CVE测了10种模型,最弱的也能找回68%,数据很实在。
04:12
04:12官方账号arXiv cs.LG@Fan Yang, Madelyn Weller, Dimuthu Fernando, Hila Livneh, Yuxin Wen
该论文提出联邦纵贯生存建模框架,结合纵贯传感器表征学习和客户端可分离离散时间风险目标。在4个C-MAPSS涡扇发动机退化子集上模拟分散训练,结果显示协同训练比孤立本地训练性能一致提升。该方法无需共享原始传感器数据或失效记录,且性能接近集中训练。
推荐理由:这篇论文提出了联邦学习框架,让不同机构在不共享数据的情况下一起训练故障预测模型,效果和集中训练差不多,挺实用的。
7月29日
12:01
12:01官方账号arXiv cs.AI@Haolei Xu, Xiaowen Xu, Haiwen Hong, Zixuan Ni, Hongxing Li, Yiwen Qiu, Weiming Lu, Yongliang Shen
提出Relay-OPD方法,解决同策略蒸馏(OPD)中的前缀失败问题:当学生模型进入错误推理方向后,后续生成偏离正确路径。该方法利用教师-学生在失败前缀上的延续不对称性作为无标签触发信号,让教师短暂接管生成然后交回学生训练。使用Qwen3-4B-Instruct-2507作为教师,Qwen3-0.6B/1.7B-Non-Thinking作为学生,在8个数学推理基准上,Relay-OPD在全部基准中取得最佳或次佳结果,1.7B模型平均超越标准OPD 5.73%,超越最强基线FastOPD 1.49%,且训练轨迹长度减少超过50%。
推荐理由:这篇论文提出了一个很聪明的改进:当学生模型推理跑偏时,让老师模型短暂接管一段,再交回学生继续训练。在Qwen3小模型上效果明显,数学推理准确率提升,训练还更快。
11:57
11:57官方账号arXiv cs.AI@Ankang Yang, Jitao Zhao, Di Jin, Yuxiao Huang, Dongxiao He
CHARM是一种多模态图基础模型,通过分层上下文建模解决零样本迁移问题。它用层次化图上下文替代孤立原始节点,捕捉多模态语义和跨模态关系。在多个零样本多模态图任务上,CHARM取得一致改进。
推荐理由:这篇论文提出了CHARM,用分层上下文建模多模态图,不需要目标域微调就能零样本迁移,比现有GNN和LLM方法更通用。
11:52
11:52官方账号arXiv cs.AI@Shuyue Wei, Chang Liu, Zimu Zhou, Yongxin Tong, Lizhen Cui
MemLens是一种为LLM智能体设计的价值感知内存管理系统,采用Shapley式评估对记忆记录进行价值排序。系统提供交互式分析仪表板,支持用户检查记忆价值、可视化分层记忆结构。通过研究助手应用,用户可比较不同记忆策略在响应质量、检索延迟和token消耗方面的表现。该系统旨在实现高效、可解释的长期记忆管理。
推荐理由:这篇论文提出了MemLens,能让LLM智能体更聪明地管理记忆,通过价值感知和交互分析来避免冗余记录。对智能体长期记忆感兴趣的话,值得一读。
11:40
11:40官方账号arXiv cs.AI@Jintao Xu, Yingzheng Ma, Jiong Dong, Yongzhi Qi, Jianshen Zhang
论文研究多仓库库存分配中MIP公式的实例级选择问题,提出一种求解器引导的LLM框架,通过SFT、IPO和GRPO训练选择器。实验基于京东数据,Hit Ratio@1从21.45%提升至50.42%,Hit Ratio@2从70.47%提升至82.31%,分配质量比固定最优公式高12.57个百分点,与事后最优差距缩小至4.85个百分点。
推荐理由:京东数据验证的一种新方法,用LLM和GRPO自动选库存分配公式,准确率翻倍,搞供应链优化的可以关注。
11:36
11:36官方账号arXiv cs.LG@Gaspard Lambrechts, Adrien Bolland, Daniel Ebi, Damien Ernst
论文提出Reinformed Dreamer算法,通过潜在引导改进不对称表示学习,解决了Informed Dreamer在特权信息表示上的局限。在多个强化学习基准测试中,相比Dreamer基线,Reinformed Dreamer表现出更一致的性能提升。该方法利用训练期间的额外监督信息学习更好的观察和特权信息表示。
推荐理由:如果你做强化学习,特别关注世界模型,这篇论文提出Reinformed Dreamer,用潜在引导训练不对称表示,比Informed Dreamer更稳定地超越Dreamer。
11:35
11:35官方账号arXiv cs.LG@Neta Shaul, Chao Liu, Arash Vahdat, Julius Berner
论文提出Parallel Decoding Distillation (PDD),一种基于轨迹的蒸馏方法,用于加速扩散模型和流匹配模型的推理。PDD兼容LTX-2.3 Text-to-Video/Audio、Wan 14B Text-to-Video和Qwen-Image Text-to-Image等预训练模型,支持4-8次函数评估。相比依赖变分分数蒸馏(VSD)和对抗损失的方法,PDD训练更简单,避免了模式坍塌,提升了生成视频的多样性。
推荐理由:这篇论文提出PDD方法,能用更少的采样步数生成高质量视频和图像,而且训练比VSD简单多了,适合搞生成加速的研究者看看。
11:32
11:32官方账号arXiv cs.LG@Malena Loza, David Chushig-Muzo, Eva Milara, Luis Bote-Curiel, Luis Estrada-Petrocelli, Felipe Grijalva
论文评估了9种表格基础模型(TabPFNv2、TabICL、Mitra等)在分布偏移下的表现。使用了HELOC、Voting和Childhood Lead三个真实数据集,涵盖标签、社会经济和地理偏移类型。结果显示所有模型性能均系统性下降,偏移差距在0.003到0.060之间,且高性能模型需要大幅计算资源。
推荐理由:想知道表格模型换了数据还灵不灵?这篇论文测了9个主流模型,结果全都不乐观,性能差距最小也有0.003。
11:28
11:28官方账号arXiv cs.LG@Pierre Chambon, Kunhao Zheng, Juliette Decugis, Benoit Sagot, Gabriel Synnaeve
论文提出DMC-Optim基准,用于评估代码优化RL。通过三阶段方法解决测量噪声和奖励稀疏问题:构建校准沙箱测试,组合正确性与速度奖励,并适配GRPO到稀疏场景。在DMC-Optim上,Qwen 2.5 7B的top-50% pass@1从18.0%提升至31.3%,CWM 32B从30.7%提升至50.4%。top-30%时CWM 32B相对提升125%,且保持纯正确性分数不变。在LCB上,CWM 32B赢得83%的中位数样本速度对比。
推荐理由:一篇教你用强化学习优化代码执行速度的论文,针对测量噪声和奖励稀疏问题设计了DMC-Optim基准和三阶段方法,让Qwen 2.5 7B的pass@1从18%提到31%,CWM 32B提到50%。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。