AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

ATFlash

共 1 条相关 AI 资讯
8月5日
09:56
09:56官方一手arXiv: OpenAI@Shun-ichiro Hayashi, Daichi Mukunoki, Tetsuya Hoshino, Takahiro Katagiri
ATFlash 提出按 RoPE 每个频率分量的波长设定注意力距离窗口,对 Qwen2.5-0.5B 和 Llama-3.2-3B 可剪掉 37%–48% 的 query-key 内积项。与滑窗不同,低频分量仍能访问所有 key,剪枝率与输入无关,闭式复杂度随序列长度 N 对数增长。在 LongBench-v2 上 top-1 匹配率保持 96%–98%,输出分布 KL 在 10^-3 nat 量级;RULER、OpenAI-MRCR、LongCodeQA、∞Bench 分数基本不变。移植到 FlashAttention-4 和 FlashInfer 后,RTX PRO 6000 上 Llama 推理最高提速 1.29 倍(128K),Qwen2.5-7B-1M 在 1M token 上下文剪掉 57% 内积项,端到端提速 1.31 倍。
论文ATFlashRoPEFlashAttention
事件专题

推荐理由:ATFlash 在 1M token 上下文把 Qwen2.5-7B 提速 1.31 倍,精度不掉,而且能直接叠加现有稀疏方法。
原文
精选全部日报登录