论文09:46σTransfer:基于 μP 的先验精度零样本迁移方法这篇论文挺实用的:想给大模型做 Laplace 近似的话,小模型上调好精度直接搬到大模型,7B 模型最高能省 330 倍搜索量。#μP#Laplace近似#不确定性量化#贝叶斯深度学习aarXiv cs.LG@Richard Bergna 等 5 人原文稍后读已读值得跟进有用关注 μP
论文精选10:59量化超参数迁移与嵌入层学习率的重要性做 LLM 训练调参的团队会关心——嵌入层学习率是 μP 优势的关键,直接放大 SP 的嵌入层学习率就能获得类似效果,值得在实验中验证。#超参数迁移#嵌入层学习率#μP#AdamWaarXiv cs.AI@Dayal Singh Kalra, Maissam Barkeshli原文稍后读已读值得跟进有用关注 超参数迁移