Elastic Expert Routing:软化 MoE top-k 路由边界,提升 OLMoE 与 Qwen3 微调效果
一篇 MoE 训练论文:把固定 top-k 换成在 k 附近随机采样,Qwen3-30B-A3B 微调能多拿 2 分,推理成本不变。
一篇 MoE 训练论文:把固定 top-k 换成在 k 附近随机采样,Qwen3-30B-A3B 微调能多拿 2 分,推理成本不变。
这篇论文用OLMoE和DeepSeek-V2-Lite实测证明,MoE路由的选专家和加权输出不该共用一套分数,FDAA方法能白捡性能提升,做MoE优化的值得看。