事件专题 · 官方一手

ATFlash:按 RoPE 波长分窗的注意力剪枝方法

ATFlash 提出按 RoPE 每个频率分量的波长设定注意力距离窗口,对 Qwen2.5-0.5B 和 Llama-3.2-3B 可剪掉 37%–48% 的 query-key 内积项。与滑窗不同,低频分量仍能访问所有 key,剪枝率与输入无关,闭式复杂度随序列长度 N 对数增长。在 LongBench-v2 上 top-1 匹配率保持 96%–98%,输出分布 KL 在 10^-3 nat 量级;RULER、OpenAI-MRCR、LongCodeQA、∞Bench 分数基本不变。移植到 FlashAttention-4 和 FlashInfer 后,RTX PRO 6000 上 Llama 推理最高提速 1.29 倍(128K),Qwen2.5-7B-1M 在 1M token 上下文剪掉 57% 内积项,端到端提速 1.31 倍。

当前结论

ATFlash 在 1M token 上下文把 Qwen2.5-7B 提速 1.31 倍,精度不掉,而且能直接叠加现有稀疏方法。

4 个信源63° AI 热度最后更新 2026/8/3 23:23:38

证据链

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情