10:47官方一手arXiv: DeepSeek@Zongfei Li精选一项新研究质疑稀疏MoE路由器中专家选择与输出加权是否应使用相同分数。在预训练的OLMoE-1B-7B上,仅改变集合内聚合方式,结构化oracle将全周期交叉熵提升0.0160±0.0039。研究者训练了301K参数的FDAA后处理头,在冻结主干、路由器和专家的情况下,将WikiText-103测试集Delta CE提升至-0.1523±0.0031。在DeepSeek-V2-Lite上复现固定调度审计,路由器Top1识别最佳选中专家的比例仅为12.5%和16.7%。结果表明专家选择与专家承诺应跨架构区分。论文MoEOLMoEDeepSeek-V2-Lite推荐理由:这篇论文用OLMoE和DeepSeek-V2-Lite实测证明,MoE路由的选专家和加权输出不该共用一套分数,FDAA方法能白捡性能提升,做MoE优化的值得看。原文稍后读已读值得跟进有用关注 MoE
09:53官方一手arXiv: DeepSeek@Huiyuan Tian, Bonan Xu, Shijian Li精选本研究提出专家子空间分离指数(ESSI)和匹配路由残差等方法,区分路由一致性、候选质量和上下文交互。在六种MoE架构中发现专家子空间高度重叠,但实际路由对token表征的解释优于匹配替代方案。在OLMoE、Mixtral和DeepSeek的39个阶乘单元中,选中专家在每个单元都比最强的未选中候选解释更多残差,但实际前缀在所有交互中均缩小该优势,所有95%置信区间低于零。尽管几何重叠,添加后续专家在39个冻结路由比较中改善24个单元的下一token预测,其余15个不显著,受控训练中三个种子均偏好Top-2优于Top-1。这一模式表明路由从共享几何邻域选择token相关专家,而多专家计算无需不相交线性覆盖即可保持效用。论文MoE稀疏混合专家OLMoE推荐理由:这篇论文把MoE路由的几何重叠和功能价值分开了,用了新指标ESSI和受控实验,结论很扎实,比单纯算相似度靠谱。原文稍后读已读值得跟进有用关注 MoE
10:54官方账号arXiv cs.LG@Martin Jaggi混合专家架构通过每个token激活少量专家来高效扩展大语言模型,但训练和推理时仍需加载全部专家参数。本研究提出Expert Tying方法,在保持独立层路由和注意力的前提下,将相邻Transformer层的专家参数共享。在OLMoE、Qwen3和DeepSeek-style MoE上的预训练实验显示,该方法可将内存占用减少近2倍,且困惑度和下游任务质量几乎不受影响。该方法利用了MoE路径中固有的参数冗余,实现了计算与内存的高效权衡。论文Expert TyingMoEOLMoE推荐理由:这个工作很实在:跨层共享专家参数让MoE模型内存减半,性能不掉,适合做模型压缩和高效训练的朋友看看。原文稍后读已读值得跟进有用关注 Expert Tying