AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

DraftExpert

共 1 条相关 AI 资讯
7月28日
12:32
12:32官方一手arXiv: DeepSeek@Dengke Han
精选
DraftExpert针对在端侧设备(CPU-GPU或Flash-NPU卸载)部署大型MoE语言模型时的延迟问题,提出了一种扩展感知的自推测解码框架。它通过自蒸馏从冻结目标MoE中为每层训练一个轻量级驻留加速器的草稿专家,推理时使用固定足迹的共享+top-1+草稿专家解码器,结合置信度扩展截断和目标专家预取。在DeepSeek-V2-Lite和Moonlight-16B-A3B上,解码吞吐量平均提升1.45倍,草稿接受率达到84%~87%,预取命中率86%~88%。
论文DraftExpertMoE自推测解码

推荐理由:论文提出DraftExpert,通过训练轻量草稿专家和预取机制,让端侧MoE模型推理速度提升1.45倍,适合关注边缘部署和推理加速的朋友。
原文
精选全部日报登录