主要来源elvis
查看原文事件专题 · 多源确认
NVIDIA新研究:AdamW存在规模上限,SOAP和Muon在大规模训练中更优
NVIDIA新研究指出AdamW优化器在大规模训练中存在规模上限,batch size达到1亿tokens进行下一个token预测时AdamW性能下降,而SOAP和Muon保持训练稳定性和质量。研究团队通过每步QR正交化和改进预条件策略解决了SOAP在大batch size下的loss spikes问题。在数十亿参数、数万亿tokens训练中,两种优化器持续优于AdamW。论文地址arxiv.org/abs/2607.20548。
当前结论
NVIDIA找到AdamW的短板了,批量干到1亿tokens它就崩,但SOAP和Muon依然稳,还解决了训练崩溃的毛病,训大模型可以看看这个。
4 个信源78° AI 热度最后更新 2026/7/26 20:09:01
证据链
相关来源 1NVIDIA AI
查看原文相关来源 2AI Will
查看原文相关来源 3小互
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。