7月27日
10:55
10:55官方账号arXiv cs.LG@Yihao Xiao, Jialong Sun, Zitian Gao, Zeming Wei, Chutian Wang, Ran Tao, Jiaye Teng, Bryan Dai
论文分析了Hyperball风格优化器在大规模训练中的优势来源,通过推导角度有效学习率发现径向更新对角度位移影响有限,无法解释MuonH与MuonWD的收敛差异。数值实验表明两者差异主要来自有效步长的演化而非更新方向。预训练实验显示更激进的学习率衰减虽能加速早期训练但可能损害后期性能。代码已开源。
推荐理由:这篇论文把Hyperball优化器的机制拆开来看,发现它并不像传说中那样自动解决学习率调度问题,掌握好调度才是关键。