论文15:35One-Step Gradient Delay不是大规模异步流水线并行LLM预训练的障碍这篇论文用Muon优化器颠覆了'异步流水线并行梯度延迟必然拉胯训练'的老观念,10B参数实验证明性能和同步训练一样好,做大型LLM预训练的同学应该看看。#PipeDream-2BW#Muon#AdamW#异步流水线并行aarXiv cs.LG@Philip Zmushko 等 5 人原文稍后读已读值得跟进有用关注 PipeDream-2BW