8月17日
8月7日
09:55
09:55官方账号arXiv cs.LG@Mikhail Solonko, Molozhavenko Alexander, Maxim Rakhuba
Muon是一种矩阵感知优化方法,用于Stiefel流形(正交列矩阵集合)上的优化。以往将Muon扩展到该流形的做法依赖启发式或迭代近似。新论文证明Stiefel Muon更新存在精确闭式解,并据此实现高效算法Skewon。Skewon在平滑非凸条件下具有一阶收敛保证。
推荐理由:Muon在矩阵优化里挺火,但上Stiefel流形一直靠近似。这篇论文给了精确闭式解,还做了个Skewon,收敛性有保障,做正交约束优化的值得看。
8月6日
7月3日
11:47
11:47官方账号arXiv cs.AI@Gil Harari, Yoel Zimmermann, Ola Tangen Kulseng, Laura Zichi, Chuin Wei Tan, Marc L. Descoteaux, Boris Kozinsky
论文系统比较了Muon、SOAP和SOAP-Muon三种优化器在训练NequIP和Allegro MLIP模型时的表现。实验发现SOAP和SOAP-Muon在收敛速度和最终精度上均显著超越Adam,其中SOAP-Muon综合最优。Muon仅提供部分改进,在部分力监督场景下这些优化器优势更加明显。结果表明优化器选择是MLIP训练中一个被忽视但影响巨大的设计维度。
推荐理由:训练MLIP别再默认用Adam了,试试SOAP或SOAP-Muon,收敛更快精度更高,尤其在有部分力监督时提升明显。
7月2日
10:15
10:15官方账号arXiv cs.AI@Hao Huang
论文将Muon优化器解释为隐式残差连接。正交化更新牺牲局部梯度保真度,但改善下游层的表示保留。在受控线性优化中,Muon学习对局部目标拟合慢但下游层易利用的表示。该视角为设计平衡局部下降与下游可用性的优化器提供了新思路。
推荐理由:这篇论文给了Muon一个新视角:它不只是优化器,更像隐式残差连接,专门为下游层保留好的表示。想理解Muon为什么管用的可以看看。
6月30日
15:35
15:35官方账号arXiv cs.LG@Philip Zmushko, Egor Petrov, Nursultan Abdullaev, Mikhail Khrushchev, Samuel Horváth
该研究挑战了异步流水线并行中梯度陈旧导致不稳定的普遍假设。论文发现,在PipeDream-2BW调度下,一步延迟的退化强烈依赖于优化器选择:AdamW遭受严重退化,而Muon表现出强鲁棒性。作者提出了一种优化器无关的Error Feedback修正进一步缓解延迟影响,并在高达10B参数的模型上验证了与同步训练的性能差距已被消除。理论分析证明了Muon在有无修正下的收敛性。
推荐理由:这篇论文用Muon优化器颠覆了'异步流水线并行梯度延迟必然拉胯训练'的老观念,10B参数实验证明性能和同步训练一样好,做大型LLM预训练的同学应该看看。
6月25日
10:31
10:31官方账号arXiv cs.LG@Alexander Hägele, Alejandro Hernández-Cano, Atli Kosson, Martin Jaggi
论文提出MD Decoupling优化器修改方法,将每个权重分解为超球面上的固定范数方向与可学习的每行每列幅度增益,以解耦幅度和方向的更新。该方法与Adam和Muon等基础优化器兼容,消除了对权重衰减和warmup的需求。实验表明,MD Decoupling在宽模型和大型MoE模型上均优于精心调优的基线,并允许跨模型宽度直接迁移学习率而不需重新调参。
推荐理由:这篇论文提出了一种简单通用的优化器改进方案,能解耦权重幅度和方向,消除权重衰减和warmup,在Adam和Muon上都有效,值得关注。