12:32官方一手arXiv: DeepSeek@Dengke Han精选DraftExpert针对在端侧设备(CPU-GPU或Flash-NPU卸载)部署大型MoE语言模型时的延迟问题,提出了一种扩展感知的自推测解码框架。它通过自蒸馏从冻结目标MoE中为每层训练一个轻量级驻留加速器的草稿专家,推理时使用固定足迹的共享+top-1+草稿专家解码器,结合置信度扩展截断和目标专家预取。在DeepSeek-V2-Lite和Moonlight-16B-A3B上,解码吞吐量平均提升1.45倍,草稿接受率达到84%~87%,预取命中率86%~88%。论文DraftExpertMoE自推测解码推荐理由:论文提出DraftExpert,通过训练轻量草稿专家和预取机制,让端侧MoE模型推理速度提升1.45倍,适合关注边缘部署和推理加速的朋友。原文稍后读已读值得跟进有用关注 DraftExpert