10:35官方账号arXiv cs.LG@Ben Anson, Conor Houghton, Edward MilsomMuon 优化器在神经网络预训练中优于常见替代方法,但在 PEFT(参数高效微调)中很少使用。原因在于 LoRA 的低秩参数化无法直接对权重更新做正交化。作者提出 sMuon,通过线性化和最小二乘近似松弛的 Muon 目标,且实现只用 matmul 运算。在 SFT 和 ReLoRA 预训练实验中,sMuon 相比基线有适度性能提升。论文MuonLoRAsMuon推荐理由:Muon 优化器跟 LoRA 本来不搭,这篇论文用数学近似硬凑出了个 sMuon,微调性能有提升,实现还只用矩阵乘法。原文稍后读已读值得跟进有用关注 Muon
10:56官方账号arXiv cs.LG@Ali Janati, Kaoutar El Maghraoui, Andrei Kanavalau, Anass Belfatmi论文报告,Muon优化器训练Transformer解(a+b) mod 113时,虽比AdamW更快grok,但9种配置均在后grokking阶段失去泛化,5个种子中有4个的AdamW参考准确率跌到27.59%。梯度降到10^-6后,Muon的步长弹性为-0.03,AdamW为+1.5,Muon组每参数移动快8.0倍。冻结嵌入/读出层可消除崩溃:451,400步和5个配对种子中,未冻结组出现137-321次低于阈值评估,冻结组为零。傅里叶滤波显示掩蔽场景下任务对齐族单独达100%,完整模型仅45.85%,重新缩放可恢复99.9%。论文MuonAdamWgrokking推荐理由:Muon grok虽快,后grokking会崩到27.59%;冻结embedding/readout就能稳。想用Muon训Transformer的注意。原文稍后读已读值得跟进有用关注 Muon
09:55官方账号arXiv cs.LG@Mikhail Solonko, Molozhavenko Alexander, Maxim RakhubaMuon是一种矩阵感知优化方法,用于Stiefel流形(正交列矩阵集合)上的优化。以往将Muon扩展到该流形的做法依赖启发式或迭代近似。新论文证明Stiefel Muon更新存在精确闭式解,并据此实现高效算法Skewon。Skewon在平滑非凸条件下具有一阶收敛保证。论文MuonSkewonStiefel流形推荐理由:Muon在矩阵优化里挺火,但上Stiefel流形一直靠近似。这篇论文给了精确闭式解,还做了个Skewon,收敛性有保障,做正交约束优化的值得看。原文稍后读已读值得跟进有用关注 Muon
11:48官方账号arXiv cs.LG@Devender Singh论文研究矩阵分解模型 W=UV^T 下不同优化器的隐式偏置。梯度下降、动量、共享标量Adam、Muon、Shampoo具有规范等变性,Adam和RMSProp等坐标级方法不具备,因此后者无法继承低秩偏置。结构定理刻画了无记忆等变规则等价于Gram决定的左预条件,传递定理把梯度流的路径性质推广到公共标量流。在欠定矩阵感知的9种更新规则实验中,从坐标级到共享标量预条件的单参数族单调恢复偏置,说明各向异性是主因。Transformer实验中,Adam第一步就让两个规范等价初始化分离,最终 W_Q^T W_K 的相对Frobenius距离相差56%。高光谱数据集在匹配训练损失下,梯度下降在最低采样密度时将留出误差降低43-44%。论文AdamMuon优化器推荐理由:这篇论文证明了Adam没有梯度下降的低秩隐式偏置,在Transformer里能让等价初始化差56%,不是调参小事。原文稍后读已读值得跟进有用关注 Adam
11:43官方账号arXiv cs.LG@Tongle Wu, Huanyu Dong, Ying Sun, Ziye MaMALT在Muon基础上加入轻量对角预条件器,以感知损失曲率并降低对曲率各向异性的敏感度。它使用Newton-Schulz迭代正交化预条件后的动量,并通过范数嫁接控制更新幅度。进一步提出的MALTER通过自适应步长重缩放提升对随机梯度噪声的鲁棒性。在GPT-2 Small、Medium、Large预训练实验中,MALT和MALTER均优于Muon,且内存占用和耗时几乎不变。论文MALTMuonGPT-2推荐理由:MALT优化器给Muon加了轻量对角预条件,在GPT-2上比Muon更快更好,内存几乎没增加,适合大模型预训练。原文稍后读已读值得跟进有用关注 MALT
12:05官方账号arXiv cs.LG@Arslan Battalov, Karim Kramin, Alexander Markotenko, Sofia SinitsinaMuon是一种通过Newton-Schulz迭代在谱范数下做最速下降的优化器,此前证据几乎全部来自Transformer模型。这篇论文在Mamba-2 130M上对比了Muon与AdamW,只改变哪些权重组用Muon训练。结果显示只有输出投影用Muon时收益最明显,输入投影或两者都用效果更差。优势主要体现在token效率上,在两个语料和两个token预算下都成立,且超过计算最优训练点后依然持续。较低的条件数不能解释增益,因为条件数更低的输入投影反而没有帮助。论文MuonMamba优化器推荐理由:Muon优化器之前都在Transformer上测试,这篇论文把它用到Mamba-2 130M上,发现输出投影用Muon最划算,训练效率更高,值得看看。原文稍后读已读值得跟进有用关注 Muon
11:32官方账号arXiv cs.AI@Chuyan Chen, Peng Sun, Kun YuanCMuon是一种针对Diffusion Transformer(DiT)训练的新优化器,通过将参数矩阵分块后再做正交化,解决了原版Muon在后期收敛停滞的问题。在ImageNet 256上,用CMuon训练的675M参数DiT仅用200个epoch就达到FID 1.18。相比AdamW,训练速度提升超过2倍。该方法能有效避免融合张量引发的隐式子空间耦合,保持更新方向准确。论文CMuonMuonDiT推荐理由:写了个新优化器CMuon,训练扩散Transformer比AdamW快两倍多,675M模型200轮就跑到FID 1.18,厉害得很。原文稍后读已读值得跟进有用关注 CMuon
11:32官方账号arXiv cs.LG@Maria Smirnova, Alexey Kravatskiy论文提出 SignMuon,将 Muon 优化器的更新逐参数取符号压缩为 1 bit。在 CIFAR-10 与 nanoGPT speedrun 实验中,SignMuon 优于 SignSGD,但作者构造线性函数实例证明它可能上升。把符号操作放在线性最小化 Oracle 之前或两侧同样无法保证下降。误差反馈用在 Muon 输出上对所有平滑常数、步长和动量都可能失效;用在梯度上则有效,EF21-MuonSign 在光滑非凸问题上达到 O(T^{-1/2}) 平方梯度范数收敛率。实验里最强的压缩方法是符号放在 Oracle 之后,尽管该配置理论上发散。论文MuonSignMuon误差反馈推荐理由:把 Muon 更新压成每参数 1 bit 的符号,实验里 sign-after-LMO 最强,尽管理论上会发散,结论很反直觉。原文稍后读已读值得跟进有用关注 Muon
11:34官方账号arXiv cs.LG@Wenzhi Zhong, Edward Milsom, Michael MurraySharpness-Aware Minimization(SAM)通过鼓励对参数扰动不敏感来提升泛化,但扰动几何依赖尚未清晰。本文借鉴Muon优化器的矩阵感知思路,为矩阵权重引入逐层谱内扰动,并与AdamW/SGDW或Muon外更新组合。在ImageNet-1K上对ViT-Small/16和ResNet-50的实验表明,谱内步+Muon外步在两类模型上均取得最高验证准确率。该工作揭示了谱范数几何在SAM中的有效性。AI模型SAMMuonImageNet-1K推荐理由:这个研究把SAM的内扰动改成矩阵谱范数,再用Muon做外更新,在ImageNet的ViT和ResNet上准确率都最高。原文稍后读已读值得跟进有用关注 SAM
11:01elvis@omarsar0精选78°NVIDIA新研究指出AdamW优化器在大规模训练中存在规模上限,batch size达到1亿tokens进行下一个token预测时AdamW性能下降,而SOAP和Muon保持训练稳定性和质量。研究团队通过每步QR正交化和改进预条件策略解决了SOAP在大batch size下的loss spikes问题。在数十亿参数、数万亿tokens训练中,两种优化器持续优于AdamW。论文地址arxiv.org/abs/2607.20548。AI模型AdamWSOAPMuon3 个信源在谈事件专题推荐理由:NVIDIA找到AdamW的短板了,批量干到1亿tokens它就崩,但SOAP和Muon依然稳,还解决了训练崩溃的毛病,训大模型可以看看这个。原文稍后读已读值得跟进有用关注 AdamW
09:34官方账号arXiv cs.AI@Kai Ruan, Jinghao Lin, Zihe Huang, Ziqi Zhou, Qianshan Wei, Xuan Wang, Hao SunMuon优化器在稀疏奖励智能体强化学习中展现优势。使用Qwen2.5-0.5B-Instruct和ALFWorld环境,在Group-in-Group Policy Optimization (GiGPO)下,仅将Muon应用于隐藏权重矩阵,最终窗口验证成功率从0.290提升至0.546(+88%),而高学习率AdamW无后更新成功。在3e-5学习率下,Muon将GRPO成功率从0.161提升至0.268;在1e-5下,GraphGPO Muon达到0.901,归一化验证AUC从0.399增至0.556,并提前30和60轮达到0.5和0.75成功率。该结果表明Muon可提升智能体强化学习性能,但效果依赖优势估计器和学习率。论文MuonAdamW智能体推荐理由:这篇论文发现Muon优化器让智能体RL成功率从29%飙到55%,比AdamW快60步,还分析了学习率的影响。原文稍后读已读值得跟进有用关注 Muon
11:47官方账号arXiv cs.AI@Gil Harari, Yoel Zimmermann, Ola Tangen Kulseng, Laura Zichi, Chuin Wei Tan, Marc L. Descoteaux, Boris Kozinsky论文系统比较了Muon、SOAP和SOAP-Muon三种优化器在训练NequIP和Allegro MLIP模型时的表现。实验发现SOAP和SOAP-Muon在收敛速度和最终精度上均显著超越Adam,其中SOAP-Muon综合最优。Muon仅提供部分改进,在部分力监督场景下这些优化器优势更加明显。结果表明优化器选择是MLIP训练中一个被忽视但影响巨大的设计维度。论文SOAPMuonAdam推荐理由:训练MLIP别再默认用Adam了,试试SOAP或SOAP-Muon,收敛更快精度更高,尤其在有部分力监督时提升明显。原文稍后读已读值得跟进有用关注 SOAP
10:15官方账号arXiv cs.AI@Hao Huang论文将Muon优化器解释为隐式残差连接。正交化更新牺牲局部梯度保真度,但改善下游层的表示保留。在受控线性优化中,Muon学习对局部目标拟合慢但下游层易利用的表示。该视角为设计平衡局部下降与下游可用性的优化器提供了新思路。论文Muon优化器残差连接推荐理由:这篇论文给了Muon一个新视角:它不只是优化器,更像隐式残差连接,专门为下游层保留好的表示。想理解Muon为什么管用的可以看看。原文稍后读已读值得跟进有用关注 Muon
09:59官方账号arXiv cs.LG@Jason R. Brown, Patrick Leask, Lev McKinney该论文系统研究了语言模型微调时的突现错位现象。作者在Qwen3家族多个模型上实验,发现优化器选择造成7倍的对齐率差异,而模型规模(1B-235B)影响可忽略。Muon优化器通过隐式正则化使LoRA适配器的奇异值分布更均匀,从而最好地保持对齐。额外添加谱正则化损失项可显著恢复Adam和Lion等易错位优化器的对齐性能。论文Qwen3MuonAdam推荐理由:这篇论文告诉你:选对优化器能把模型对齐率差7倍,Muon比Adam更靠谱,还能用谱正则化补救。原文稍后读已读值得跟进有用关注 Qwen3
15:35官方账号arXiv cs.LG@Philip Zmushko, Egor Petrov, Nursultan Abdullaev, Mikhail Khrushchev, Samuel Horváth该研究挑战了异步流水线并行中梯度陈旧导致不稳定的普遍假设。论文发现,在PipeDream-2BW调度下,一步延迟的退化强烈依赖于优化器选择:AdamW遭受严重退化,而Muon表现出强鲁棒性。作者提出了一种优化器无关的Error Feedback修正进一步缓解延迟影响,并在高达10B参数的模型上验证了与同步训练的性能差距已被消除。理论分析证明了Muon在有无修正下的收敛性。论文PipeDream-2BWMuonAdamW推荐理由:这篇论文用Muon优化器颠覆了'异步流水线并行梯度延迟必然拉胯训练'的老观念,10B参数实验证明性能和同步训练一样好,做大型LLM预训练的同学应该看看。原文稍后读已读值得跟进有用关注 PipeDream-2BW
12:10官方账号arXiv cs.LG@Mark Rhee, Jamie Simon, Dhruva Karkada该论文研究Muon优化器在矩阵分解问题中的参数动力学,发现其与梯度下降有三点关键差异:1)Muon避免从小初始化开始的慢鞍点动力学,以相同速率学习所有顶模,较小模先收敛;2)即使学习率超过局部损失尖锐度的临界阈值,Muon仍保持稳定,允许通过指数学习率退火实现快速收敛;3)Muon流守恒矩阵√(P^T P)-√(Q^T Q),而梯度流守恒P^T P - Q^T Q。从零初始化时,两者都能找到平衡解。论文还推导了简单设定下的对齐速率,并利用Muon结构属性设计了仅需两步达到近完美对齐的学习率调度。论文Muon矩阵分解优化器推荐理由:如果你关注优化器理论,这篇论文揭示了Muon比梯度下降更快的机制,并且给出了一个只需两步就对齐参数的学习率调度,很实用。原文稍后读已读值得跟进有用关注 Muon
10:32官方账号arXiv cs.LG@Vladimir Bogachev, Vladimir Aletov, Alexander Molozhavenko, Sergei Kudriashov, Maxim RakhubaMuon优化器通过谱范数约束执行最速下降,但仅适用于矩阵。Tensorion将这一方法扩展到高阶张量,基于线性最小化预言机(LMO)在张量范数球上进行优化。其LMO通过自适应选择展开矩阵可高效计算,且当限制为二阶张量时精确恢复Muon。在张量计算机视觉任务中,Tensorion相比Adam和现有张量感知基线展现出更优的收敛行为与更稳定的梯度更新。论文TensorionMuon优化器推荐理由:想优化张量参数?这篇论文把Muon优雅地推广到高阶张量,实验比Adam更稳健。原文稍后读已读值得跟进有用关注 Tensorion
10:31官方账号arXiv cs.LG@Alexander Hägele, Alejandro Hernández-Cano, Atli Kosson, Martin Jaggi论文提出MD Decoupling优化器修改方法,将每个权重分解为超球面上的固定范数方向与可学习的每行每列幅度增益,以解耦幅度和方向的更新。该方法与Adam和Muon等基础优化器兼容,消除了对权重衰减和warmup的需求。实验表明,MD Decoupling在宽模型和大型MoE模型上均优于精心调优的基线,并允许跨模型宽度直接迁移学习率而不需重新调参。论文MD DecouplingAdamMuon推荐理由:这篇论文提出了一种简单通用的优化器改进方案,能解耦权重幅度和方向,消除权重衰减和warmup,在Adam和Muon上都有效,值得关注。原文稍后读已读值得跟进有用关注 MD Decoupling
11:04官方账号arXiv cs.LG@Kaiyue Wen, Xingyu Dang, Kaifeng Lyu, Tengyu Ma, Percy Liang论文提出Hyperball,一种简单优化器包装器,固定权重矩阵及其更新量的Frobenius范数,解决Muon等优化器在大模型(如1.2B参数Qwen3模型)上相比AdamW加速效果衰减的问题。实验表明,Muon+Hyperball实现20-30% token等效加速,并改善学习率在宽度和深度上的迁移。该方法受理论启发:权重衰减导致平衡权重范数仅依赖于超参数,进而决定角度学习率。论文HyperballMuonQwen3推荐理由:Muon在大模型上加速效果缩水?Hyperball通过固定矩阵范数,让Muon在1.2B Qwen3上又快了20-30%,还更好调参。原文稍后读已读值得跟进有用关注 Hyperball
11:11官方账号arXiv cs.LG@Florian Hübler, Thomas Pethick, Suvrit SraMuon和Scion等非欧几里得优化方法在训练Transformer时表现优异,但其理论优势一直未明确。本研究证明在重尾非凸场景(随机梯度p阶中心矩有界,p∈(1,2])下,非欧几里得方法在更强的平稳性度量下达到最优样本复杂度,而欧几里得方法有额外维度依赖。对于m×n矩阵,Muon在核范数下找到ε-稳定点仅需O(min{m,n}Δ1L/ε^2(σ/ε)^{p/(p-1)})个样本,可吸收重尾噪声而无额外维度开销。实验在大型语言模型上验证了理论,并表明其他Schatten几何在某些设置下也可与Muon竞争。论文MuonScion优化算法推荐理由:Muon为何能训练Transformer?原文稍后读已读值得跟进有用关注 Muon
11:02官方账号arXiv cs.AI@Tianyu Ruan, Fengzhuo Zhang, Shuche Wang, Shihua Zhang精选72°Muon 作为预训练大语言模型和视觉分类器的新兴优化器,其效率优势已超过 Adam 和 SGD,但特征学习优势尚不明确。本文通过鲁棒性和迁移性视角研究 Muon 的特征学习优势:在损坏图像和文本上评估预训练模型,发现 Muon 学到的特征比 Adam 和 SGD 更鲁棒,且这种优势体现在更大的 logit 边际上。通过下游任务的线性分类器或微调,Muon 的特征迁移效果更好,这得益于隐藏状态的有效秩更高。在含多组件的分类问题中,论文从理论上证明了 Muon 能获得更大边际和更高有效秩。论文Muon优化器鲁棒性推荐理由:Muon 优化器在鲁棒性和迁移性上全面超越 Adam,做预训练或迁移学习的团队值得关注,尤其是需要模型对噪声和下游任务更鲁棒的场景。原文稍后读已读值得跟进有用关注 Muon
10:28官方账号arXiv cs.LG@Xianliang Li, Zihan Zhang, Weiyang Liu, Han BaoMuon优化器在大语言模型训练中表现出色,但其动量机制的理论作用一直不明确。本文通过将动量视为一种频谱滤波器,证明了在信号加扰动的梯度模型下,动量能有效抑制扰动并保留主导信号,从而扩大两者间的频谱间隙。这种间隙的扩大稳定了传递给Muon正交化步骤的矩阵的奇异子空间,使更新更可靠。实验表明,先应用动量再进行正交化比反向顺序或移除动量能更好地对齐梯度信号。该理论为理解其他基于矩阵的优化器中动量的作用提供了起点。论文Muon动量频谱滤波推荐理由:做LLM训练或优化器研究的团队,这篇论文把Muon动量从玄学变成了可解释的频谱滤波机制,看完能直接指导你调参——先降噪再正交化,效果更稳。原文稍后读已读值得跟进有用关注 Muon
10:11官方账号arXiv cs.AI@Thomas Massena, Corentin Friedrich, Mathieu Serrurier精选这篇论文提出了一种数据驱动的优化器设计方法,能够根据梯度与激活统计信息动态选择每层神经网络的最优更新几何结构,在SGD和Muon之间自适应插值。该方法基于单步随机特征回归代理模型推导出闭式准则,并整合参数级预处理,可恢复SGD、Muon、Adam和MuAdam作为特例。通过高效计算策略,仅增加约3%的运行开销,在三种训练场景中与Muon和AdamW的最佳性能持平或更优。这项工作为超越静态几何的优化器设计开辟了新路径。论文优化器自适应几何Muon推荐理由:这篇论文解决了优化器几何结构固定、无法适应问题几何的问题,做深度学习训练和优化器研究的开发者可以直接参考其自适应方法,有望提升模型训练效率。原文稍后读已读值得跟进有用关注 优化器
11:05官方账号arXiv cs.LG@Abdurakhmon Sadiev, Artavazd Maranjyan, Ivan Ilin, Peter Richtárik精选Muon 作为 AdamW 的替代方案在神经网络训练中表现出色,但基于线性最小化预言机(LMO)的方法通常采用同步训练,在异构分布式系统中受限于慢速工作节点。本文提出 Ringmaster LMO,一种异步 LMO 动量方法,借鉴 Ringmaster ASGD 的延迟阈值思想,通过丢弃过时梯度实现最优时间复杂度。该方法在广义 (L0, L1)-光滑性下建立了收敛保证,并开发了参数无关的变体。实验表明,在随机二次问题和 NanoChat 语言模型预训练中,Ringmaster LMO 在异构环境下显著优于同步和异步基线。论文异步训练分布式系统优化算法推荐理由:分布式训练团队终于有了异步 LMO 方法的理论保障——Ringmaster LMO 解决了异构集群中慢节点拖累效率的问题,做大规模预训练或异构系统优化的开发者值得关注。原文稍后读已读值得跟进有用关注 异步训练