12:29官方一手arXiv: DeepSeek@Jie Li, Chenxin Jia, Jinliang Shen, Cunzhuang Liu, Ruiyi Ding, Jianwen Xian, Kang He, Chengru Song论文在专家并行MoE服务中发现,GPU吞吐量并不由token数或激活专家数单独决定:约156-168 token以下是显存权重流主导,以上则按128-tile对M维度取整。据此提出TEMPO调度器,将每批调度建模为固定费用makespan问题,在毫秒级求解;在8卡Testbed A上,相对最优固定基线最多提升15.5%,其余场景差距在1%以内。端到端测试中,Qwen3-235B吞吐提升4-6%、p99延迟降低约15.6%,DeepSeek-V3则未见收益。TEMPO论文强调这是阶段图预测的结果,并非普适胜利。论文TEMPOMoE专家并行推荐理由:如果你在做MoE推理,TEMPO这个调度器在内存/算力瓶颈混合时能比常规方案快15.5%;不过DeepSeek-V3那种通信瓶颈场景它不灵。原文稍后读已读值得跟进有用关注 TEMPO