№优化器·general
优化器
别名
- 首次出现
- 2026-05-22
- 最近出现
- 2026-07-29
- 累计提及
- 23
§ 01综述
优化器是深度学习训练中用于更新模型参数以最小化损失函数的算法,其性能直接影响模型的收敛速度和最终精度。近期,研究者们提出多种新型优化器或改进方法,重点关注超越经典Adam的潜力、矩阵感知设计以及训练动态的理论分析。
优化器近期进展
EISAM:外梯度改进锐度感知最小化
arXiv cs.LG 2607.06151v1 提出 EISAM,通过外梯度法改进锐度感知最小化(SAM),在多个图像分类任务上实现了更优的泛化性能,同时保持了训练稳定性。
SOAP与Muon加速机器学习原子间势训练
arXiv cs.AI 2607.02499v1 报告 SOAP和Muon优化器在训练机器学习原子间势时超越Adam,其中Muon基于矩阵分解思想,在多种势函数训练中收敛速度提升2-5倍。
Muon优化器新解:隐式残差连接机制
arXiv cs.AI 2607.01124v1 揭示Muon优化器内部存在隐式残差连接,解释了其避免梯度消失、加速训练的原理,为设计更高效优化器提供理论支持。
Evil Spectra:优化器如何影响突现错位
arXiv cs.LG 2606.31591v1 发现不同优化器会放大或抑制模型中的突现错位现象,Adam和Muon在特定频率谱上表现差异显著,提示优化器选择需考虑模型对齐风险。
Muon在矩阵分解中避免慢鞍点
arXiv cs.LG 2606.30509v1 证明Muon优化器在矩阵分解任务中能有效避免慢鞍点动力学,收敛到平衡解,而Adam易陷入平坦区域。
Hessian特征向量位移揭示训练动态
arXiv cs.LG 2606.30226v1 通过分析Hessian特征向量位移,发现优化器依赖的训练动态:Muon使特征向量更快对齐主曲率方向,而Adam保持较慢变化。
Tensorion:Muon的张量感知泛化
arXiv cs.LG 2606.25975v1 提出Tensorion,将Muon优化器的矩阵感知思想推广到高阶张量,适用于Transformer等模型,在语言建模任务上获得更优损失。
MD解耦:解耦幅度与方向训练
arXiv cs.LG 2606.25971v1 提出MD解耦方法,将权重向量的幅度和方向分开更新,使用不同学习率,在CIFAR和ImageNet上提升准确率1-2%。
AngularMuown:显式角度步长衰减
arXiv cs.LG 2606.23637v1 提出AngularMuown,为矩阵感知优化器引入显式角度步长衰减策略,在BERT预训练中比Adam快1.3倍。
Hyperball优化包装器提升大模型预训练效率
arXiv cs.LG 2606.16899v1 提出Hyperball包装器,将任何优化器嵌入超球空间约束更新幅度,在GPT-2和LLaMA等模型上预训练步数减少约30%。
当前焦点与观察点
当前优化器研究聚焦于超越Adam的实际性能提升与理论理解。Muon及其变体成为热点,因其在矩阵分解、原子势、大语言模型等领域展现出加速收敛和避免鞍点的优势。同时,研究者开始关注优化器对模型行为(如突现错位、训练动态)的深远影响,表明优化器不仅是工具,更影响模型的内禀性质。此外,通用包装方法(如Hyperball)和方向幅度解耦策略提供了即插即用的改进可能。未来,优化器的选择应综合考虑任务结构、模型规模和安全性,而不仅是收敛速度。