8月6日
7月3日
11:47
11:47官方账号arXiv cs.AI@Gil Harari, Yoel Zimmermann, Ola Tangen Kulseng, Laura Zichi, Chuin Wei Tan, Marc L. Descoteaux, Boris Kozinsky
论文系统比较了Muon、SOAP和SOAP-Muon三种优化器在训练NequIP和Allegro MLIP模型时的表现。实验发现SOAP和SOAP-Muon在收敛速度和最终精度上均显著超越Adam,其中SOAP-Muon综合最优。Muon仅提供部分改进,在部分力监督场景下这些优化器优势更加明显。结果表明优化器选择是MLIP训练中一个被忽视但影响巨大的设计维度。
推荐理由:训练MLIP别再默认用Adam了,试试SOAP或SOAP-Muon,收敛更快精度更高,尤其在有部分力监督时提升明显。
7月2日
10:15
10:15官方账号arXiv cs.AI@Hao Huang
论文将Muon优化器解释为隐式残差连接。正交化更新牺牲局部梯度保真度,但改善下游层的表示保留。在受控线性优化中,Muon学习对局部目标拟合慢但下游层易利用的表示。该视角为设计平衡局部下降与下游可用性的优化器提供了新思路。
推荐理由:这篇论文给了Muon一个新视角:它不只是优化器,更像隐式残差连接,专门为下游层保留好的表示。想理解Muon为什么管用的可以看看。
6月30日
11:05
11:05官方账号arXiv cs.LG@Marcelina Marjankowska, Valerio Modugno, Paolo Barucca
该论文研究训练过程中Hessian矩阵领先特征向量的动态演化。作者在多层感知机分类任务上,通过位移和逆参与率两个统计量跟踪特征向量变化。结果显示SGD训练下曲率方向逐渐趋于稳定,而Adam则持续重组特征向量。Adam还表现出局部化现象,少量参数主导领先曲率方向。这些发现揭示了优化器差异对训练轨迹的影响。
推荐理由:这篇论文分析了SGD和Adam训练中Hessian特征向量的不同行为,发现Adam会让少量参数主导曲率方向,直观解释了为什么两种优化器训练结果不同。
6月25日
10:31
10:31官方账号arXiv cs.LG@Alexander Hägele, Alejandro Hernández-Cano, Atli Kosson, Martin Jaggi
论文提出MD Decoupling优化器修改方法,将每个权重分解为超球面上的固定范数方向与可学习的每行每列幅度增益,以解耦幅度和方向的更新。该方法与Adam和Muon等基础优化器兼容,消除了对权重衰减和warmup的需求。实验表明,MD Decoupling在宽模型和大型MoE模型上均优于精心调优的基线,并允许跨模型宽度直接迁移学习率而不需重新调参。
推荐理由:这篇论文提出了一种简单通用的优化器改进方案,能解耦权重幅度和方向,消除权重衰减和warmup,在Adam和Muon上都有效,值得关注。
6月9日
6月5日
5月13日
19:12
19:12官方账号arXiv cs.LG@Kexuan Shi, Hanxuan Li, Zeju Qiu, Yandong Wen, Simon Buchholz, Weiyang Liu
精选
Pion 是一种用于大语言模型训练的新型优化器,通过左右正交变换更新权重矩阵,在整个训练过程中保持其奇异值不变。与 Adam 和 Muon 等加法优化器不同,Pion 在固定权重矩阵谱范数的同时调节其几何结构,提供了一种稳定的优化机制。实验表明,Pion 在 LLM 预训练和微调中均能作为标准优化器的稳定且有竞争力的替代方案。
推荐理由:Pion 解决了传统优化器在训练中破坏权重矩阵谱结构的问题,做 LLM 训练的研究者和工程师值得关注,尤其适合追求训练稳定性和模型质量的团队。