11:43官方账号arXiv cs.LG@Tongle Wu, Huanyu Dong, Ying Sun, Ziye MaMALT在Muon基础上加入轻量对角预条件器,以感知损失曲率并降低对曲率各向异性的敏感度。它使用Newton-Schulz迭代正交化预条件后的动量,并通过范数嫁接控制更新幅度。进一步提出的MALTER通过自适应步长重缩放提升对随机梯度噪声的鲁棒性。在GPT-2 Small、Medium、Large预训练实验中,MALT和MALTER均优于Muon,且内存占用和耗时几乎不变。论文MALTMuonGPT-2推荐理由:MALT优化器给Muon加了轻量对角预条件,在GPT-2上比Muon更快更好,内存几乎没增加,适合大模型预训练。原文稍后读已读值得跟进有用关注 MALT