主要来源arXiv: OpenAI
查看原文事件专题 · 官方一手
ATFlash:按 RoPE 波长分窗的注意力剪枝方法
ATFlash 提出按 RoPE 每个频率分量的波长设定注意力距离窗口,对 Qwen2.5-0.5B 和 Llama-3.2-3B 可剪掉 37%–48% 的 query-key 内积项。与滑窗不同,低频分量仍能访问所有 key,剪枝率与输入无关,闭式复杂度随序列长度 N 对数增长。在 LongBench-v2 上 top-1 匹配率保持 96%–98%,输出分布 KL 在 10^-3 nat 量级;RULER、OpenAI-MRCR、LongCodeQA、∞Bench 分数基本不变。移植到 FlashAttention-4 和 FlashInfer 后,RTX PRO 6000 上 Llama 推理最高提速 1.29 倍(128K),Qwen2.5-7B-1M 在 1M token 上下文剪掉 57% 内积项,端到端提速 1.31 倍。
当前结论
ATFlash 在 1M token 上下文把 Qwen2.5-7B 提速 1.31 倍,精度不掉,而且能直接叠加现有稀疏方法。
4 个信源63° AI 热度最后更新 2026/8/3 23:23:38
证据链
相关来源 1OpenAI
查看原文相关来源 2IT之家
查看原文相关来源 3量子位
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。