10:56官方账号arXiv cs.LG@Ali Janati, Kaoutar El Maghraoui, Andrei Kanavalau, Anass Belfatmi论文报告,Muon优化器训练Transformer解(a+b) mod 113时,虽比AdamW更快grok,但9种配置均在后grokking阶段失去泛化,5个种子中有4个的AdamW参考准确率跌到27.59%。梯度降到10^-6后,Muon的步长弹性为-0.03,AdamW为+1.5,Muon组每参数移动快8.0倍。冻结嵌入/读出层可消除崩溃:451,400步和5个配对种子中,未冻结组出现137-321次低于阈值评估,冻结组为零。傅里叶滤波显示掩蔽场景下任务对齐族单独达100%,完整模型仅45.85%,重新缩放可恢复99.9%。论文MuonAdamWgrokking推荐理由:Muon grok虽快,后grokking会崩到27.59%;冻结embedding/readout就能稳。想用Muon训Transformer的注意。原文稍后读已读值得跟进有用关注 Muon