11:54官方账号arXiv cs.LG@Alagappan Valliappan针对百万token上下文场景,论文指出原生MTP草稿头因全面注意力机制导致KV缓存读取随上下文线性增长,抵消了投机解码的加速优势。作者提出Windowed-MTP方法,仅对草稿注意力层应用StreamingLLM式滑动窗口加注意力汇聚,将草稿KV工作集限制为常数,在1M上下文中丢弃约99%的KV条目。在Qwen GDN-MoE 35B/122B和Mamba2-hybrid NoPE 120B三类架构、单GPU SGLang环境下,每步解码成本比原生MTP降低28%-44%,且不改变目标模型输出分布。该方法无需训练、即插即用,并可回收未读取的草稿KV(1M时占总KV的7.7%-11%)。论文Windowed-MTP投机解码KV缓存推荐理由:这篇论文解决了长上下文下投机解码的瓶颈,用滑动窗口草稿省掉99%的KV读取,实测速度提升近三成,而且不损失精度。搞大模型推理优化的值得看。原文稍后读已读值得跟进有用关注 Windowed-MTP