10:55官方账号arXiv cs.LG@Yihao Xiao, Jialong Sun, Zitian Gao, Zeming Wei, Chutian Wang, Ran Tao, Jiaye Teng, Bryan Dai论文分析了Hyperball风格优化器在大规模训练中的优势来源,通过推导角度有效学习率发现径向更新对角度位移影响有限,无法解释MuonH与MuonWD的收敛差异。数值实验表明两者差异主要来自有效步长的演化而非更新方向。预训练实验显示更激进的学习率衰减虽能加速早期训练但可能损害后期性能。代码已开源。论文HyperballMuonHMuonWD推荐理由:这篇论文把Hyperball优化器的机制拆开来看,发现它并不像传说中那样自动解决学习率调度问题,掌握好调度才是关键。原文稍后读已读值得跟进有用关注 Hyperball
11:04官方账号arXiv cs.LG@Kaiyue Wen, Xingyu Dang, Kaifeng Lyu, Tengyu Ma, Percy Liang论文提出Hyperball,一种简单优化器包装器,固定权重矩阵及其更新量的Frobenius范数,解决Muon等优化器在大模型(如1.2B参数Qwen3模型)上相比AdamW加速效果衰减的问题。实验表明,Muon+Hyperball实现20-30% token等效加速,并改善学习率在宽度和深度上的迁移。该方法受理论启发:权重衰减导致平衡权重范数仅依赖于超参数,进而决定角度学习率。论文HyperballMuonQwen3推荐理由:Muon在大模型上加速效果缩水?Hyperball通过固定矩阵范数,让Muon在1.2B Qwen3上又快了20-30%,还更好调参。原文稍后读已读值得跟进有用关注 Hyperball