12:00官方一手arXiv: DeepSeek@En-Ming Huang, An-Cheng Chang, Bai-Cheng Jeng, Shih-Hao Hung, H. T. Kung混合专家(MoE)推理中专家GEMM的形状随运行时路由分布变化,现有系统使用静态令牌数桶选择融合内核,忽略每专家路由分布。论文提出分布感知框架,结合Effective Experts指标与Dirichlet逆向建模生成可控路由分布,并开发DA-MoE运行时系统,可在GPU上根据路由直方图与离线调优分布匹配选择近最优融合内核,无需CPU-GPU同步。在HumanEval-X服务轨迹上,DA-MoE在DeepSeek-V3和Kimi K2上将几何平均融合MoE延迟分别提升1.16倍和1.29倍,峰值加速达1.40倍和1.56倍。论文DA-MoEDeepSeek-V3Kimi K2推荐理由:论文提出了DA-MoE,根据路由分布动态选最优内核,在DeepSeek-V3和Kimi K2上延迟最高降低56%,做MoE推理的同学可以关注这个优化思路。原文稍后读已读值得跟进有用关注 DA-MoE