论文精选11:22Complete-muE:MoE模型最优超参数迁移与缩放框架做大规模MoE模型训练的团队终于有了可靠的超参数迁移方案——不用为每个专家配置重新调参,直接复用密集模型的超参数即可,建议做预训练优化的点开看看。#MoE模型#超参数迁移#缩放法则#TransformeraarXiv cs.LG@Hongwu Peng 等 6 人原文稍后读已读值得跟进有用关注 MoE模型
论文精选10:59量化超参数迁移与嵌入层学习率的重要性做 LLM 训练调参的团队会关心——嵌入层学习率是 μP 优势的关键,直接放大 SP 的嵌入层学习率就能获得类似效果,值得在实验中验证。#超参数迁移#嵌入层学习率#μP#AdamWaarXiv cs.AI@Dayal Singh Kalra, Maissam Barkeshli原文稍后读已读值得跟进有用关注 超参数迁移