8月27日
11:02
11:02官方账号arXiv cs.LG@Xiaodong Wu, Wenyi Yu, Chao Zhang, Philip Woodland
精选
研究通过Transformer损失景观的谱探针分析,解释了为什么Muon比Adam在大语言模型预训练中表现更好。提出Spectral-Aware Muon (SAMuon)改进方案,通过静态谱先验放大bulk部分,在124M到1B参数的模型上优于AdamW和Muon基准。SAMuon需要更少的训练token达到相同验证损失。
推荐理由:这篇论文揭示了为什么Muon优于Adam,并提出了改进方案SAMuon,值得AI模型研究者关注。