09:53官方一手arXiv: DeepSeek@Huiyuan Tian, Bonan Xu, Shijian Li精选本研究提出专家子空间分离指数(ESSI)和匹配路由残差等方法,区分路由一致性、候选质量和上下文交互。在六种MoE架构中发现专家子空间高度重叠,但实际路由对token表征的解释优于匹配替代方案。在OLMoE、Mixtral和DeepSeek的39个阶乘单元中,选中专家在每个单元都比最强的未选中候选解释更多残差,但实际前缀在所有交互中均缩小该优势,所有95%置信区间低于零。尽管几何重叠,添加后续专家在39个冻结路由比较中改善24个单元的下一token预测,其余15个不显著,受控训练中三个种子均偏好Top-2优于Top-1。这一模式表明路由从共享几何邻域选择token相关专家,而多专家计算无需不相交线性覆盖即可保持效用。论文MoE稀疏混合专家OLMoE推荐理由:这篇论文把MoE路由的几何重叠和功能价值分开了,用了新指标ESSI和受控实验,结论很扎实,比单纯算相似度靠谱。原文稍后读已读值得跟进有用关注 MoE
11:57官方一手arXiv: DeepSeek@Loc Pham, Lang Hong Nguyet Anh, Thanh Le-Cong现有大模型在函数式编程语言(如Haskell、OCaml、Scala)上表现远逊于命令式语言。研究者发现,单独微调每种语言无法共享函数式抽象,而多语言混合微调又会导致跨语言干扰。为此,他们提出FPMoE,一个基于稀疏混合专家架构的轻量级开源代码生成模型,包含三个语言专用专家和一个共享专家,后者捕捉单子推理、类型导向编程等跨语言模式。在FPEval基准上,FPMoE仅用3B活跃参数就超越了微调基线,性能匹敌DeepSeek-Coder-6.7B、Qwen2.5-Coder-14B-Instruct等更大模型。论文函数式编程代码生成稀疏混合专家推荐理由:函数式编程开发者终于有了专属的代码生成模型——FPMoE用稀疏MoE解决了跨语言干扰和抽象丢失两大痛点,且3B参数就能达到14B模型的效果,值得Haskell/OCaml/Scala用户直接上手测试。原文稍后读已读值得跟进有用关注 函数式编程