CascadeEP:异步专家执行解决 MoE 推理注意力不均衡问题
MoE 推理部署的人可以看看,DeepSeek-V4 和 GLM-5.3 上实测 TTFT 快了近一半,思路是让专家计算别干等慢副本。
MoE 推理部署的人可以看看,DeepSeek-V4 和 GLM-5.3 上实测 TTFT 快了近一半,思路是让专家计算别干等慢副本。
如果你在做MoE推理,TEMPO这个调度器在内存/算力瓶颈混合时能比常规方案快15.5%;不过DeepSeek-V3那种通信瓶颈场景它不灵。
Moonshot AI 开源了 MoonEP,一个专门加速 MoE 训练中专家并行通信的库,比现有方案更均衡高效,做分布式训练的同学可以试试。
做 MoE 系统优化或互联设计的工程师,这篇论文用实测数据推翻了行业两个核心假设,直接告诉你路由不均衡是模型固有、模拟测试不可信,看完能避免在错误方向上投入精力。