8月21日
10:07
10:07官方账号arXiv cs.LG@Nayeon Kim, Hojin Lee, Yunju Bak, Jaesun Park, Boseop Kim
该研究提出一种计算高效的两步超参数迁移框架,用于为大型 MoE 模型估算最优学习率。首先,通过 MuP 适应和 Muon 优化器,证明了最优学习率在宽度缩放模型间可一致迁移。其次,通过建立预测性缩放定律,将小模型在有限预算下的最优值线性回归,成功外推至万亿 token 规模(R²=0.95)。该方法在 155B 总参数的 MoE 基础模型预训练中得到验证。
推荐理由:研究人员提出了一种方法,能通过小模型实验,准确预测万亿 token 规模 MoE 模型的最优学习率,省去了大量计算成本。他们用 155B 参数的模型验证了方法的有效性。