10:07官方账号arXiv cs.LG@Nayeon Kim, Hojin Lee, Yunju Bak, Jaesun Park, Boseop Kim该研究提出一种计算高效的两步超参数迁移框架,用于为大型 MoE 模型估算最优学习率。首先,通过 MuP 适应和 Muon 优化器,证明了最优学习率在宽度缩放模型间可一致迁移。其次,通过建立预测性缩放定律,将小模型在有限预算下的最优值线性回归,成功外推至万亿 token 规模(R²=0.95)。该方法在 155B 总参数的 MoE 基础模型预训练中得到验证。论文Mixture-of-ExpertsMoE超参数推荐理由:研究人员提出了一种方法,能通过小模型实验,准确预测万亿 token 规模 MoE 模型的最优学习率,省去了大量计算成本。他们用 155B 参数的模型验证了方法的有效性。原文稍后读已读值得跟进有用关注 Mixture-of-Experts
10:16官方账号arXiv cs.LG@Viet-Hoang Tran, Vinh Khanh Bui, Tan Lai Ngoc, Nam Nguyen, Tuan Dam, Tan M. Nguyen该论文提出了一个统一框架,用于刻画现代神经网络架构(如使用GELU、SiLU、SwiGLU激活的前馈网络、具备正弦和旋转位置编码的多头注意力、以及多种门控设计的混合专家模型)中的梯度下降守恒定律。此前守恒定律仅在线性和ReLU网络中被理解。实验验证了所预测的不变量。论文GELUSiLUSwiGLU推荐理由:想知道GELU、多头注意力这些架构背后为什么有隐式偏好?这篇论文给出了严格的理论解释。原文稍后读已读值得跟进有用关注 GELU
11:10官方账号arXiv cs.AI@Hugo Daumain, Driss Matrouf, Khaled Khelif, Mickael Rouvier语音生成技术的进步使合成语音越来越自然,导致欺骗检测更加困难。本研究将自监督语音表示模型转换为混合专家(MoE)架构,替换编码器层的前馈块为多个专家网络,并通过层间门控机制控制专家激活。专家网络能捕获互补的声学模式,同时保留自监督预训练学到的表示。在14个欺骗数据集上的评估显示,宏等错误率(EER)从5.46%降至4.81%,相对提升11.9%。论文Self-Supervised Speech ModelMixture-of-ExpertsAnti-Spoofing推荐理由:MoE让反欺骗更强,EER降11.9%原文稍后读已读值得跟进有用关注 Self-Supervised Speech Model