主要来源arXiv cs.AI
查看原文事件专题 ·单一信源
CompKV:补偿感知的稀疏注意力框架,长上下文推理最高提速 6.85 倍
CompKV 是首个补偿感知的稀疏注意力框架,针对 KV cache 在长上下文推理中的内存瓶颈而设计。与先按注意力质量选 token 再做补偿的现有方法不同,CompKV 把 token 分块,优先选择若省略会带来最大补偿误差的部分。论文的理论分析指出块级均值补偿的残差由块注意力质量和块内 logit 方差共同决定,并给出了可部署的选择准则。在 RULER 和 LongBench-Pro 基准上,CompKV 优于所评估的稀疏基线,自注意力最高加速 6.85 倍。
当前结论
一篇新论文 CompKV,重新设计了稀疏注意力里的 token 选择逻辑,长上下文推理自注意力最高快 6.85 倍,做推理优化的可以看看。
2 个信源53° AI 热度最后更新 2026/9/22 12:11:19
证据链
2 个信源相关来源 1IT之家
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。