10:47官方一手arXiv: DeepSeek@Zongfei Li精选一项新研究质疑稀疏MoE路由器中专家选择与输出加权是否应使用相同分数。在预训练的OLMoE-1B-7B上,仅改变集合内聚合方式,结构化oracle将全周期交叉熵提升0.0160±0.0039。研究者训练了301K参数的FDAA后处理头,在冻结主干、路由器和专家的情况下,将WikiText-103测试集Delta CE提升至-0.1523±0.0031。在DeepSeek-V2-Lite上复现固定调度审计,路由器Top1识别最佳选中专家的比例仅为12.5%和16.7%。结果表明专家选择与专家承诺应跨架构区分。论文MoEOLMoEDeepSeek-V2-Lite推荐理由:这篇论文用OLMoE和DeepSeek-V2-Lite实测证明,MoE路由的选专家和加权输出不该共用一套分数,FDAA方法能白捡性能提升,做MoE优化的值得看。原文稍后读已读值得跟进有用关注 MoE
09:53官方账号arXiv cs.LG@Tho Tran Huu, Huu-Tuan Nguyen, Thien-Hai Nguyen, Nhat-Tri Ho, Viet-Hoang Tran, Tho Quan, Tan Minh Nguyen稀疏混合专家(SMoE)架构通过Top-k专家选择实现条件路由,但这会导致映射不连续。论文将不连续性按阶数分类(由切换事件中并列专家数决定),并建立渐近体积估计:低阶不连续性占据主导,高阶体积趋于零。通过扩散过程建模输入随机扰动,证明路径几乎必然在有限时间内首次击中一阶不连续性。实验结果在语言和视觉任务上表明,提出的平滑机制不仅恢复连续性,还提升了经验性能。论文Sparse Mixture-of-ExpertsSMoEMoE推荐理由:这篇论文把SMoE的不连续性分析得清清楚楚,还附带了一个计算量很小的平滑方法,实验证明又能提高效果,值得一看。原文稍后读已读值得跟进有用关注 Sparse Mixture-of-Experts