论文中美对照11:54Windowed-MTP:消除百万token上下文中的全上下文草稿KV负担这篇论文解决了长上下文下投机解码的瓶颈,用滑动窗口草稿省掉99%的KV读取,实测速度提升近三成,而且不损失精度。搞大模型推理优化的值得看。#Windowed-MTP#投机解码#KV缓存#QwenaarXiv cs.LG@Alagappan Valliappan原文稍后读已读值得跟进有用关注 Windowed-MTP
模型官方一手16:13Zyphra 发布 Zamba2-VL:混合 Mamba2-Transformer 视觉语言模型,首 token 延迟降低约一个数量级做视觉语言模型部署或实时推理的开发者,Zamba2-VL 的首 token 延迟优势能显著提升用户体验,值得直接尝试。#视觉语言模型#Mamba2#Transformer#开源/仓库官方一手marktechpost@Asif Razzaq原文稍后读已读值得跟进有用关注 视觉语言模型