论文72°

腾讯混元提出 Stem 稀疏注意力算法,首字延迟降低 3.6 倍

精选理由

长文本推理的延迟痛点终于有了低成本解法——Stem 用 25% 算力实现近无损精度,做 LLM 推理优化的团队可以直接用开源代码实测,128K 上下文下首字延迟降低 3.6 倍的效果值得关注。

AI 摘要

腾讯混元团队提出 Stem 稀疏注意力算法,已被 ICML-26 收录。该算法通过 Token 位置衰减和输出感知度量两大创新,仅用 25% 算力即可逼近稠密注意力的精度。配套的 HPC 算子库将理论加速转化为实际性能,在 128K 上下文下首字延迟降低 3.6 倍。该方案为长文本推理场景提供了高效、低成本的注意力加速方案,相关论文和代码已开源。

原文 · IT之家

IT之家 6 月 5 日消息,腾讯混元今日宣布提出 Stem 稀疏注意力算法,已被机器学习顶会 ICML-26 收录。 官方表示,Stem 稀疏注意力算法从“因果信息流”重新审视块级稀疏,用 Token 位置衰减(TPD)和输出感知度量(OAM)两大创新, 仅用 25% 算力就逼近稠密注意力的精度 。配套的 HPC 算子库则将这份理论加速比真正转化为端到端的实测性能。 ▲ Stem 在 Hy3 preview(W8A8-FP8)上更贴近生产环境的真实落地数据 根据 Stem 算法 × HPC 算子的全栈加速方案,算法层面,Stem 通过 Token 位置衰减(TPD)和输出感知度量(OAM)实现 25% 预算下的近无损精度 ;算子层面,HPC 开源的 Stem+BSA 算子将稀疏收益转化为真实硬件加速, 128K 上下文下首字延迟降低 3.6 倍 。 ▲ 模型精度 IT之家附相关链接如下: Stem 论文链接 : https://arxiv.org/abs/2603.06274Stem 开源地址 : https://github.com/Tencent/AngelSlimHPC 算子开源地址 : https://github.com/Tencent/hpc-ops

腾讯混元提出 Stem 稀疏注意力算法,首字延迟降低 3.6 倍 · AI 热点