AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

DA-MoE

共 1 条相关 AI 资讯
7月28日
12:00
12:00官方一手arXiv: DeepSeek@En-Ming Huang, An-Cheng Chang, Bai-Cheng Jeng, Shih-Hao Hung, H. T. Kung
混合专家(MoE)推理中专家GEMM的形状随运行时路由分布变化,现有系统使用静态令牌数桶选择融合内核,忽略每专家路由分布。论文提出分布感知框架,结合Effective Experts指标与Dirichlet逆向建模生成可控路由分布,并开发DA-MoE运行时系统,可在GPU上根据路由直方图与离线调优分布匹配选择近最优融合内核,无需CPU-GPU同步。在HumanEval-X服务轨迹上,DA-MoE在DeepSeek-V3和Kimi K2上将几何平均融合MoE延迟分别提升1.16倍和1.29倍,峰值加速达1.40倍和1.56倍。
论文DA-MoEDeepSeek-V3Kimi K2

推荐理由:论文提出了DA-MoE,根据路由分布动态选最优内核,在DeepSeek-V3和Kimi K2上延迟最高降低56%,做MoE推理的同学可以关注这个优化思路。
原文
精选全部日报登录