7月13日
09:25
09:25官方账号arXiv cs.LG@Alexander Munteanu, Matteo Russo, David Saulpic, Chris Schwiegelshohn
该论文提出了一种保持线段结构的终端嵌入,解决了传统终端嵌入无法处理直线插值等线性结构的问题。利用该嵌入,作者获得了首个无维度依赖的时间序列聚类coresets,基于Fréchet距离。实验在合成和真实时间序列数据上显示,终端嵌入性能与Johnson-Lindenstrauss嵌入相当,且优于PCA。
推荐理由:这篇论文把终端嵌入推广到了线段结构,首次做出了无维度依赖的时间序列聚类coresets,比PCA效果还好。
09:21
09:21官方账号arXiv cs.LG@Mingxiang Luo, Xinnan Mao, Lu Wang, Lei Bai, Feng Ding, Yuqiang Li
该论文提出自适应多教师路由(ATR)方法,仅用0.2%的候选结构真实r$^2$SCAN标签,即可生成289万条可追溯的r$^2$SCAN级伪标签用于预训练。在MP-r$^2$SCAN基准上,基于ATR数据集训练的轻量级CHGNet模型持续优于基线和非路由对照组。有限温度分子动力学实验表明,ATR在多个材料系统中提高了动力学鲁棒性,避免了模拟中的灾难性结构坍缩。
推荐理由:这篇论文给出了一个很实用的思路:用多个预训练模型做教师,主动拒绝不可靠的结构,只用少量高精度标签就能生成大量高质量数据,对材料模拟的同学很有参考价值。
09:16
09:16官方账号arXiv cs.LG@Tamás Matuszka, András Tamásy, Balázs Szolár
这篇论文提出一个多模态框架,结合视觉和轨迹表示(Exo-Trajectory和ScenarioFormer)进行自动驾驶场景检索。实验显示,轨迹表示在运动中心事件(如cut-ins、转弯、交通排队)上表现优秀,而视觉嵌入在外观信息重要时更有效。两者结合始终提升检索质量,取得最佳整体性能。研究基于大规模自动驾驶数据集,对比了视觉基线。
推荐理由:这篇论文对比了视觉和轨迹两种方法,告诉你什么时候该用哪个,还发现组合起来效果最好。搞自动驾驶数据挖掘或场景验证的可以看看。
09:12
09:12官方一手arXiv: DeepSeek@Alexander Tian, Aditya Ghai, Sanjit Neelam, Zaal Vasania, Akshay Mishra
精选
COBS通过引入压缩的二阶统计量改进了DeepSeek Native Sparse Attention(NSA)的块选择策略。在32k RULER长上下文检索基准上,COBS将平均分从NSA基线的0.2999提升至0.8195,接近稠密注意力的0.9040,缩小了约86%的差距。其KV缓存读取流量仅为稠密注意力的1/15.15,比NSA基线高1.21倍。模型保持短上下文行为,并在位置负对数似然上低于稠密注意力。
推荐理由:COBS在NSA基础上加了个二阶统计量,长上下文检索分数从0.3拉到0.82,接近稠密注意力但省了十几倍带宽,很实用。
7月10日
12:19
12:19官方账号arXiv cs.AI@Xinyan Chen, Ziyu Guo, Renrui Zhang, Dongzhi Jiang, Hongsheng Li
OpenCoF 是一个包含 OpenCoF-17K 数据集和 Wan-CoF 模型的推理框架,覆盖 11 个任务家族。在 4 个视频推理基准上,Wan-CoF 相比 Wan2.2-I2V-A14B 基线取得显著提升。模型引入视觉和文本推理 token,分别捕捉低级视觉线索和高级语义先验。实验通过注意力分析探讨了这些 token 在不同深度、去噪步骤、空间和时间上的贡献。
推荐理由:这篇论文用视频帧序列做推理,比传统的思维链更直观。他们把 Wan2.2 模型微调成 Wan-CoF,在多个基准上分数更高,还开源了数据集和代码。
12:18
12:18官方账号arXiv cs.AI@Yifan Zhou, Qihao Yang, Yan Li, Donggang Li, Xiru Hu, Hokin Deng, Ziyang Gong, Xuanyi Zhou, Huacan Wang, Xiangchao Yan, Wanghan Xu, Wenlong Zhang, Shaofeng Zhang, Yue Zhou, Yifan Yang, Zhihang Zhong, Xue Yang
该论文提出IdeaGene-Bench (IG-Bench)基准,包含1,961条黄金谱系轨迹、1,085个Idea Genome对象和920个pairwise GenomeDiff记录,覆盖10个科学领域。IG-Exam含42个任务类型、1,029个实例,用于封闭式谱系推理;IG-Arena使用种群进化得分(PES)评估生成质量。在14个LLM科学家的测试中,最强系统仅达到27.3%的精确准确率,且结构化谱系上下文会打乱模型排名。该研究揭示了当前AI在科学思想继承与变异推理上的组合瓶颈。
推荐理由:这篇论文拿IdeaGene-Bench测了14个LLM,最强也只有27.3%准确率,而且加谱系信息反而搞乱排名。想看看AI离真正理解科学进化还有多远?读它。
11:49
11:49官方账号arXiv cs.LG@Nathan Pruyne, Benjamin Stoler, William Chen, Chien-yu Huang, Shinji Watanabe, Chris Donahue
MulTTiPop数据集包含572段流行音乐,总计3.5小时音频,覆盖1930年代至2000年代的多种风格。数据通过元数据匹配从Lakh MIDI和TheoryTab数据集提取,并手动对齐节拍后调整MIDI时间。评估现有自动音乐转录模型,最佳模型仅达38% Onset F1,显示改进空间巨大。
推荐理由:做音乐转录的看过来,MulTTiPop是新的多轨基准,覆盖老歌到现代,现有模型只拿38%得分,挑战很大。
11:40
11:40官方账号arXiv cs.LG@Chuning Zhu, Eva Xu, Jose Barreiros, Krishnan Srinivasan, Paarth Shah, Abhishek Gupta
Latent Memory Palace (LMP) 方法提出将控制策略的推理形式化为自回归变分推断,通过组织信息于潜在记忆宫殿实现自适应迭代检索。该方法推导出潜在空间强化学习技术以优化变分下界,得到策略 LMP-π 在仿真和真实场景中表现优异,并展示可解释的测试时计算分配。LMP-tok 作为变长动作分词器,显著提升了自回归策略的性能。论文提供了通过变分推断视角进行潜在推理控制的新观点。
推荐理由:这篇论文提出了Latent Memory Palace方法,把推理当成自回归变分推断来控制机器人,在模拟和现实任务都很强,还带可变长动作分词器,做控制方向的朋友可以看看。
11:38
11:38官方账号arXiv cs.LG@Xiao Fu, Yue Hu, Meida Chen, Peter Anthony Beerel, Barath Raghavan
该论文提出LTM,一种多模态重建框架,利用过时的数字高程模型(DEM)作为几何先验,通过物理像素对齐替代传统特征匹配,计算复杂度大幅降低。在基于真实野火区域的模拟器上,方法生成高保真深度图并保持实时性能。相比现有技术,重建精度和计算效率均有显著提升。
推荐理由:这篇论文用旧DEM数据低成本做高精度3D地形重建,比LiDAR省钱,比纯图像方法更准,还实时。搞野火应急或地理信息的人可以看看。
11:23
11:23官方账号arXiv cs.LG@Yann Claes, Pierre Geurts, Vân Anh Huynh-Thu
论文提出一种通过偏依赖约束引导神经网络训练的新方法,使模型对特定特征的响应符合先验知识。在多个回归任务(包括动态系统预测)上的实验表明,该方法训练的模型比无约束模型性能更好且数据效率更高。从约束模型得到的解释与实际用户知识一致,而无约束模型则不然。
推荐理由:这篇论文给了你可解释AI的新思路:用偏依赖约束让模型学得更准,还能确保解释符合常识,尤其适合回归问题。
11:21
11:21官方账号arXiv cs.LG@Hyunho Mo, Djura Smits, Mahlet A. Birhanu, Maarten J. G. Leening, Daniel Bos, Pim van der Harst, Esther E. Bron
该研究提出使用联邦深度学习进行隐私保护的心血管疾病风险预测,整合了两个异质性队列:Lifelines(148,230名参与者,自报结果)和Rotterdam Study(10,155名参与者,临床链接结果)。联邦训练的深度生存模型在Rotterdam Study上C-statistic从0.728升至0.739,在Lifelines上从0.783升至0.787,均优于本地训练模型。结果表明联邦学习能在不共享患者数据的前提下提升预测性能。
推荐理由:这篇论文展示了联邦学习如何让两个不同规模、不同数据来源的医院协同训练模型,预测心血管病风险更准还保护隐私,值得医疗AI从业者看看。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。