主要来源Tri Dao (FlashAttention)
查看原文事件专题 · 单一信源
重计算技巧使SSM的推测解码速度翻倍
在运行大规模上下文智能体时,Qwen 3.5和Nemotron Ultra等混合模型面临Gated-DeltaNet/Mamba状态的瓶颈。一个简单洞察是加载状态并计算但不存储,可使速度提升2倍。该重计算技巧最终解锁了状态空间模型(SSM)的推测解码(spec decoding)功能。
当前结论
不用存状态,算完就扔,SSM推理直接快一倍,Qwen 3.5和Nemotron Ultra用户试试这个技巧。
2 个信源47° AI 热度最后更新 2026/6/16 12:28:48
证据链
相关来源 1arXiv: DeepSeek
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。