11:01elvis@omarsar0精选78°NVIDIA新研究指出AdamW优化器在大规模训练中存在规模上限,batch size达到1亿tokens进行下一个token预测时AdamW性能下降,而SOAP和Muon保持训练稳定性和质量。研究团队通过每步QR正交化和改进预条件策略解决了SOAP在大batch size下的loss spikes问题。在数十亿参数、数万亿tokens训练中,两种优化器持续优于AdamW。论文地址arxiv.org/abs/2607.20548。AI模型AdamWSOAPMuon3 个信源在谈事件专题推荐理由:NVIDIA找到AdamW的短板了,批量干到1亿tokens它就崩,但SOAP和Muon依然稳,还解决了训练崩溃的毛病,训大模型可以看看这个。原文稍后读已读值得跟进有用关注 AdamW
11:47官方账号arXiv cs.AI@Gil Harari, Yoel Zimmermann, Ola Tangen Kulseng, Laura Zichi, Chuin Wei Tan, Marc L. Descoteaux, Boris Kozinsky论文系统比较了Muon、SOAP和SOAP-Muon三种优化器在训练NequIP和Allegro MLIP模型时的表现。实验发现SOAP和SOAP-Muon在收敛速度和最终精度上均显著超越Adam,其中SOAP-Muon综合最优。Muon仅提供部分改进,在部分力监督场景下这些优化器优势更加明显。结果表明优化器选择是MLIP训练中一个被忽视但影响巨大的设计维度。论文SOAPMuonAdam推荐理由:训练MLIP别再默认用Adam了,试试SOAP或SOAP-Muon,收敛更快精度更高,尤其在有部分力监督时提升明显。原文稍后读已读值得跟进有用关注 SOAP