11:54官方账号arXiv cs.LG@Alagappan Valliappan针对百万token上下文场景,论文指出原生MTP草稿头因全面注意力机制导致KV缓存读取随上下文线性增长,抵消了投机解码的加速优势。作者提出Windowed-MTP方法,仅对草稿注意力层应用StreamingLLM式滑动窗口加注意力汇聚,将草稿KV工作集限制为常数,在1M上下文中丢弃约99%的KV条目。在Qwen GDN-MoE 35B/122B和Mamba2-hybrid NoPE 120B三类架构、单GPU SGLang环境下,每步解码成本比原生MTP降低28%-44%,且不改变目标模型输出分布。该方法无需训练、即插即用,并可回收未读取的草稿KV(1M时占总KV的7.7%-11%)。论文Windowed-MTP投机解码KV缓存推荐理由:这篇论文解决了长上下文下投机解码的瓶颈,用滑动窗口草稿省掉99%的KV读取,实测速度提升近三成,而且不损失精度。搞大模型推理优化的值得看。原文稍后读已读值得跟进有用关注 Windowed-MTP
16:13官方一手marktechpost@Asif RazzaqZyphra 发布了 Zamba2-VL 系列开源视觉语言模型,包含 1.2B、2.7B 和 7B 三个参数版本。该模型采用混合 Mamba2 状态空间和 Transformer 骨干架构,在 Apache 2.0 许可下发布。与同类 Transformer 视觉语言模型相比,Zamba2-VL 在保持竞争力的同时,将首 token 生成时间降低了约一个数量级。这标志着在高效视觉语言推理方面的重要进展,尤其适合对延迟敏感的应用场景。AI模型视觉语言模型Mamba2Transformer推荐理由:做视觉语言模型部署或实时推理的开发者,Zamba2-VL 的首 token 延迟优势能显著提升用户体验,值得直接尝试。原文稍后读已读值得跟进有用关注 视觉语言模型