8月21日
10:07
10:07官方账号arXiv cs.LG@Nayeon Kim, Hojin Lee, Yunju Bak, Jaesun Park, Boseop Kim
该研究提出一种计算高效的两步超参数迁移框架,用于为大型 MoE 模型估算最优学习率。首先,通过 MuP 适应和 Muon 优化器,证明了最优学习率在宽度缩放模型间可一致迁移。其次,通过建立预测性缩放定律,将小模型在有限预算下的最优值线性回归,成功外推至万亿 token 规模(R²=0.95)。该方法在 155B 总参数的 MoE 基础模型预训练中得到验证。
推荐理由:研究人员提出了一种方法,能通过小模型实验,准确预测万亿 token 规模 MoE 模型的最优学习率,省去了大量计算成本。他们用 155B 参数的模型验证了方法的有效性。
7月28日
14:09
14:09向阳乔木@vista8
Scaling Laws(缩放定律)描述了模型性能随计算量、数据量和参数规模变化的幂律关系。该定律由OpenAI在2020年提出,指导了大模型训练的资源分配。理解Scaling Laws有助于设计更高效的模型训练策略。
事件专题

推荐理由:想搞懂大模型为什么越训越大?这个视频用动画讲清Scaling Laws的缩放规律,比看论文容易多了。
5月14日