10:56官方账号arXiv cs.LG@Ali Janati, Kaoutar El Maghraoui, Andrei Kanavalau, Anass Belfatmi论文报告,Muon优化器训练Transformer解(a+b) mod 113时,虽比AdamW更快grok,但9种配置均在后grokking阶段失去泛化,5个种子中有4个的AdamW参考准确率跌到27.59%。梯度降到10^-6后,Muon的步长弹性为-0.03,AdamW为+1.5,Muon组每参数移动快8.0倍。冻结嵌入/读出层可消除崩溃:451,400步和5个配对种子中,未冻结组出现137-321次低于阈值评估,冻结组为零。傅里叶滤波显示掩蔽场景下任务对齐族单独达100%,完整模型仅45.85%,重新缩放可恢复99.9%。论文MuonAdamWgrokking推荐理由:Muon grok虽快,后grokking会崩到27.59%;冻结embedding/readout就能稳。想用Muon训Transformer的注意。原文稍后读已读值得跟进有用关注 Muon
12:28官方一手arXiv: DeepSeek@Masato Fujitake论文提出 MESH,一种用于 MoE 专家层的隐藏动量 Sinkhorn 更新。在 110M 参数 DeepSeek 风格 MoE 预训练中,SAGE/Sinkhorn 混合把优化器状态从 0.883GB 降到 0.331GB,但评估损失 3.8265,差于 AdamW 基线的 3.58-3.64。MESH 在梯度缓冲区生命周期内恢复一阶矩信号,且不将专家一阶矩存入优化器状态。两个额外种子中,MESH 和 MESH-B 相对 AdamW 减少 62.5% 优化器状态内存,峰值 CUDA 分配下降约 12.6%,评估损失差距较小。论文MESHSinkhorn混合专家模型推荐理由:MoE 训练显存吃紧?MESH 方法砍掉六成优化器内存,损失只差一点,做大规模训练的可以试试。原文稍后读已读值得跟进有用关注 MESH
12:05官方账号arXiv cs.LG@Arslan Battalov, Karim Kramin, Alexander Markotenko, Sofia SinitsinaMuon是一种通过Newton-Schulz迭代在谱范数下做最速下降的优化器,此前证据几乎全部来自Transformer模型。这篇论文在Mamba-2 130M上对比了Muon与AdamW,只改变哪些权重组用Muon训练。结果显示只有输出投影用Muon时收益最明显,输入投影或两者都用效果更差。优势主要体现在token效率上,在两个语料和两个token预算下都成立,且超过计算最优训练点后依然持续。较低的条件数不能解释增益,因为条件数更低的输入投影反而没有帮助。论文MuonMamba优化器推荐理由:Muon优化器之前都在Transformer上测试,这篇论文把它用到Mamba-2 130M上,发现输出投影用Muon最划算,训练效率更高,值得看看。原文稍后读已读值得跟进有用关注 Muon
09:29官方账号arXiv cs.LG@Xiaotian Zhang, Lai Shun Chan, Yue Shang, Entao Yang, Ge Zhang一篇来自arXiv的论文研究了高熵解对模型鲁棒性的影响。作者以模算术中的grokking为受控场景,对比AdamW训练的Transformer与基于Wang-Landau分子动力学采样的高熵模型。噪声注入实验显示,AdamW模型在强制记忆随机标签后,原任务测试准确率从100%跌至75%以下,而高熵模型仍保持约95%。通过奇异值分解发现,高熵网络在注意力层和MLP层具有更高的有效秩,可缓冲灾难性遗忘。论文GrokkingAdamWWang-Landau推荐理由:这篇论文用模算术实验揭穿了一个幻觉:模型泛化好不代表扛得住后续干扰。高熵模型比AdamW更抗遗忘,想了解训练鲁棒性的可以看看。原文稍后读已读值得跟进有用关注 Grokking
11:01elvis@omarsar0精选78°NVIDIA新研究指出AdamW优化器在大规模训练中存在规模上限,batch size达到1亿tokens进行下一个token预测时AdamW性能下降,而SOAP和Muon保持训练稳定性和质量。研究团队通过每步QR正交化和改进预条件策略解决了SOAP在大batch size下的loss spikes问题。在数十亿参数、数万亿tokens训练中,两种优化器持续优于AdamW。论文地址arxiv.org/abs/2607.20548。AI模型AdamWSOAPMuon3 个信源在谈事件专题推荐理由:NVIDIA找到AdamW的短板了,批量干到1亿tokens它就崩,但SOAP和Muon依然稳,还解决了训练崩溃的毛病,训大模型可以看看这个。原文稍后读已读值得跟进有用关注 AdamW
09:34官方账号arXiv cs.AI@Kai Ruan, Jinghao Lin, Zihe Huang, Ziqi Zhou, Qianshan Wei, Xuan Wang, Hao SunMuon优化器在稀疏奖励智能体强化学习中展现优势。使用Qwen2.5-0.5B-Instruct和ALFWorld环境,在Group-in-Group Policy Optimization (GiGPO)下,仅将Muon应用于隐藏权重矩阵,最终窗口验证成功率从0.290提升至0.546(+88%),而高学习率AdamW无后更新成功。在3e-5学习率下,Muon将GRPO成功率从0.161提升至0.268;在1e-5下,GraphGPO Muon达到0.901,归一化验证AUC从0.399增至0.556,并提前30和60轮达到0.5和0.75成功率。该结果表明Muon可提升智能体强化学习性能,但效果依赖优势估计器和学习率。论文MuonAdamW智能体推荐理由:这篇论文发现Muon优化器让智能体RL成功率从29%飙到55%,比AdamW快60步,还分析了学习率的影响。原文稍后读已读值得跟进有用关注 Muon
15:35官方账号arXiv cs.LG@Philip Zmushko, Egor Petrov, Nursultan Abdullaev, Mikhail Khrushchev, Samuel Horváth该研究挑战了异步流水线并行中梯度陈旧导致不稳定的普遍假设。论文发现,在PipeDream-2BW调度下,一步延迟的退化强烈依赖于优化器选择:AdamW遭受严重退化,而Muon表现出强鲁棒性。作者提出了一种优化器无关的Error Feedback修正进一步缓解延迟影响,并在高达10B参数的模型上验证了与同步训练的性能差距已被消除。理论分析证明了Muon在有无修正下的收敛性。论文PipeDream-2BWMuonAdamW推荐理由:这篇论文用Muon优化器颠覆了'异步流水线并行梯度延迟必然拉胯训练'的老观念,10B参数实验证明性能和同步训练一样好,做大型LLM预训练的同学应该看看。原文稍后读已读值得跟进有用关注 PipeDream-2BW
13:15官方账号arXiv cs.AI@Dingzhi Yu, Hongyi Tao, Yuanyu Wan, Luo Luo, Lijun ZhangAdamW是训练大型语言模型的默认优化器,但其理论主要建立在有限方差假设上。实证发现LLM预训练中的随机梯度噪声通常是重尾的。近期Lion、Muon等符号优化器已取得重尾收敛率,AdaGrad也能在重尾噪声下收敛。本文提出一个开放问题:AdamW能否在相同重尾假设下收敛?作者证明了一个正加权度量基准,并通过走廊下界机制表明分母记忆可能隐藏大梯度。论文AdamWLLM重尾噪声推荐理由:AdamW天天用但理论有坑,这篇论文把收敛性列为开放问题,还给出了新分析框架。做LLM训练优化的人该看看。原文稍后读已读值得跟进有用关注 AdamW
10:59官方账号arXiv cs.AI@Dayal Singh Kalra, Maissam Barkeshli精选本文提出一个框架,通过三个指标量化超参数迁移效果:缩放律拟合质量、外推鲁棒性、参数化导致的渐近损失惩罚。研究发现,μP 相比标准参数化(SP)在 AdamW 训练中的优势,主要源于嵌入层学习率的最大化。SP 中嵌入层学习率是瓶颈,导致训练不稳定;将其按宽度因子放大以匹配 μP 可显著平滑训练并改善迁移。此外,权重衰减改善缩放律拟合,但在固定 token-per-parameter 设置下会损害外推鲁棒性。论文超参数迁移嵌入层学习率μP推荐理由:做 LLM 训练调参的团队会关心——嵌入层学习率是 μP 优势的关键,直接放大 SP 的嵌入层学习率就能获得类似效果,值得在实验中验证。原文稍后读已读值得跟进有用关注 超参数迁移