主要来源arXiv cs.AI
查看原文事件专题 ·多源确认
LeapQuant:线性注意力的高效状态量化方法
LeapQuant是一种训练免费方法,能在8位递归状态量化下实现接近无损性能。该方法采用每窗口量化技术,通过在窗口末尾一次性量化状态来减少误差累积。同时,它保留状态中的最大异常值作为高精度补偿令牌,并在量化前平滑剩余残差。在Qwen、Kimi和GLM模型家族的实验中,LeapQuant在NVIDIA B200、RTX PRO 6000和RTX 5090 GPU上实现了2.05-3.70倍的内核级加速和1.47倍的端到端推理加速。
当前结论
研究人员提出LeapQuant,解决了线性注意力模型中状态量化的精度损失问题,在保持FP32基线精度的同时显著提升推理速度。
6 个信源58° AI 热度最后更新 2026/9/29 17:59:34
证据链
6 个信源冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。