7月2日
12:35
12:35官方账号arXiv cs.LG@Zijian Zhang, Rizhen Hu, Athanasios Glentis, Dawei Li, Chung-Yiu Yau, Hongzhou Lin, Mingyi Hong
本文基于Qwen3和Qwen2.5共7个模型,使用GRPO、GiGPO、Dr. GRPO三种RL算法,在数学推理、代码生成和智能体决策任务上实验。研究发现训练单层Transformer即可恢复全参数RL训练大部分甚至全部改进。作者引入“层贡献”指标量化单层训练相比全参数训练的收益比例。结果显示RL收益高度集中于少数中间层,输入输出层贡献显著较低。
推荐理由:这篇论文发现RL训练只需调优一层Transformer就能接近全参数效果,还揭秘中间层才是关键,刷新认知。
12:25
12:25官方账号arXiv cs.LG@Chuanming Yu, Jiaming Liu, Zihao Ge, Xiongfei Wu, Lulu Zhu, Pengzhan Zhao, Jianjun Zhao
该论文对7个模型对(跨越监督学习和强化学习)进行了量子机器学习与经典方法的统一实证比较。结果显示,量子模型在整体预测性能、策略稳定性和训练时间上尚未超越经典基线。不过,量子方法在噪声过滤和假阳性控制上展现了潜力。研究还总结了量子ML在硬件环境、训练效率和收敛稳定性方面的挑战。代码已开源在GitHub。
推荐理由:这篇论文用7组模型对比告诉你:现阶段量子机器学习还没跑赢经典方法,但在过滤噪声上有戏。想了解量子ML实际表现可以看看。
12:21
12:21官方账号arXiv cs.LG@Kornelius Raeth, Nicole Ludwig
该论文提出决策感知训练方法,在基于样本的生成模型训练中,将能量分数(energy score)目标与可微决策损失(decision loss)结合,直接惩罚下游决策成本。决策损失本身是严格适当的评分规则,具有理论保证。在1个合成任务和2个真实世界任务上验证,该方法在成本敏感区域提升性能,同时保留完整概率预测。
推荐理由:这篇论文提出一个很实用的思路:训练生成模型时直接考虑下游决策成本,而不是只匹配数据密度。在概率预测场景中特别有价值。
12:20
12:20官方账号arXiv cs.LG@Landon Dyken, Sharmistha Chakrabarti, Nathan Debardeleben, Steve Petruzza, Qi Wu, Will Usher, Sidharth Kumar
本文提出一种基于3D高斯原语的显式模型用于体数据压缩。该模型将3D高斯集合重新解释为标量场的显式表示。采用采样策略通过加权聚合重建标量值,并开发了CUDA加速的采样管线。与隐式神经表示相比,在结构化体数据上实现有竞争力的重建质量和显著训练加速,在非结构化体数据上全面优于现有方法。
推荐理由:这篇论文用3D高斯替代隐式网络来压缩体数据,速度更快、省去网格存储,对非结构化数据尤其厉害。
11:09
11:09官方账号arXiv cs.LG@Chandni Nagda, Mayank Shrivastavam Gudrun Thorkelsdottir, Gan Zhang, Morteza Mardani, Arindam Banerjee
论文提出Flow Proposal Particle Filters(FPPF),通过生成模型学习最优提议分布进行粒子传播。FPPF能降低权重方差、延缓退化,并保留贝叶斯更新步骤。通过局部化策略扩展到高维问题。在多个非线性、非高斯、高维动力系统实验中,FPPF优于统计基线和其它生成方法。
推荐理由:这篇论文提出了一种叫FPPF的新粒子滤波方法,用生成模型做提议分布,解决了高维和非线性场景的退化问题,实验结果很扎实。
10:27
10:27官方账号arXiv cs.AI@Liyuan Zhu, Shengyu Huang, Amrita Mazumdar, Tianye Li, Zan Gojcic, Gordon Wetzstein, Iro Armeni, Shalini De Mello, Alex Trevithick
该方法提出从单目视频生成可自由渲染的动态3D高斯表示。通过视频模型条件化密集像素对齐渲染,编码外观、几何和3D场景运动,以纠正初始重建的伪影并填补缺失区域。训练时构建了多视角视频对和动态3DGS数据集,模拟单目重建的典型伪影。测试时将模型生成的新区域和运动蒸馏回单一一致的高质量动态3DGS,在4D重建上达到新SOTA,并泛化到视角变化大的野外视频。
推荐理由:想从普通视频生成能自由旋转看的3D场景?这个新方法用高斯点云重建动态效果,超越现有4D重建技术。
10:23
10:23官方账号arXiv cs.AI@Zhuoxuan Zhang, Kangqi Ni, Yuhang Chen, Mingfu Liang, Xiaohan Wei, Yunchen Pu, Fei Tian, Chonglin Sun, Frank Shyu, Adam, Song, Sandeep Pandey, Luke Simon, Tianlong Chen, Xi Liu
生成式推理重排序器(GR2)通过自回归解码生成推理链后再排序,准确率高但推理速度慢。论文提出Diffusion-GR2,将自回归重排序器转换为块扩散模型,并行解码多个位置。通过转换微调(CFT)解决结构间隙,确保输出有效排列;通过在线蒸馏(OPD)和强化学习(RL)弥补分布间隙。在Amazon Beauty数据集上,Diffusion-GR2准确率接近自回归基线,推理吞吐量提升2.4-3.5倍。消融实验显示CFT恢复大部分转换损失,在线蒸馏进一步缩小差距。
推荐理由:想加速推理重排序又不想掉精度?这篇把自回归GR2换成块扩散,速度提升2.4倍以上,准确率几乎没降,干货满满。
10:15
10:15官方账号arXiv cs.AI@Hao Huang
论文将Muon优化器解释为隐式残差连接。正交化更新牺牲局部梯度保真度,但改善下游层的表示保留。在受控线性优化中,Muon学习对局部目标拟合慢但下游层易利用的表示。该视角为设计平衡局部下降与下游可用性的优化器提供了新思路。
推荐理由:这篇论文给了Muon一个新视角:它不只是优化器,更像隐式残差连接,专门为下游层保留好的表示。想理解Muon为什么管用的可以看看。
10:12
10:12官方一手arXiv: DeepSeek@Robson Alves Vilar, Emanuel Dantas Filho, Ademar França de Sousa Neto, Mirko Perkusich, Danyllo Wagner Albuquerque, João Paiva, Kyller Gorgônio, Angelo Perkusich
一项研究评估了GPT-5 mini、Gemini 3 Flash和DeepSeek Chat 3.2在993道PSM I风格Scrum认证题上的表现,使用零样本、链式思考和源接地三种提示策略。Gemini 3 Flash准确率最高,GPT-5 mini次之,DeepSeek Chat 3.2最低。模型在单选题上表现最好,但在多选题和判断题上错误更多。定性分析发现错误系统性源于过度泛化、限制性措辞和复合干扰项。
推荐理由:想了解GPT-5 mini、Gemini 3 Flash、DeepSeek Chat谁更适合Scrum考试?这篇论文用993道真题实测了准确率和稳定性,还分析了典型错误原因。
10:10
10:10官方一手arXiv: Google DeepMind@Jinwen Wang, Youfang Lin, Xiaobo Hu, Qian Xu, Shuo Wang, Zhuo Chen, Kai Lv
T2RD提出通过自监督方式将观测分解为任务相关和任务无关表示,包含三个组件:任务相关表示一致性、交叉重建和交叉动态预测。前两个组件实现内容与风格特征解耦,第三个组件引入动态预测以进一步提取任务相关特征。在DeepMind Control Suite和Robotic Manipulation任务上,T2RD实现了SOTA的泛化性能和样本效率。
推荐理由:这篇论文教你用自监督方法解耦视觉特征,T2RD在泛化能力上比现有方法强出一截,做机器人和控制任务的值得看看。
10:08
10:08官方账号arXiv cs.LG@Konstantin Häberle, Helmut Bölcskei
该论文基于Cover(1965)提出的函数计数理论,针对低维数据结构构建了二元分类的数学框架。通过修正一般位置假设以反映低维性,导出了体现数据结构的二分计数。进一步将Cover的分离容量和泛化问题推广到低维设定,揭示了数据结构对分类能力的影响。
推荐理由:这篇论文把Cover上世纪60年代的函数计数理论套到低维数据上,分析低维结构怎么影响分类能力,比原来的理论更贴合真实数据。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。