8月4日
12:10
12:10官方一手arXiv: DeepSeek@Wen Zan, Jiaqi Zhang, Jianchao Tan, Hong Liu, Cunguang Wang, Xiang Li, Duyue Ma, Guanyu Wu, Yifan Lu, Fengcun Li, Yerui Sun, Peng Pei, Yuchen Xie, Xunliang Cai
LongCat Sparse Attention(LSA)提出流式感知索引、跨层索引和分层索引三种策略,解决DeepSeek Sparse Attention的O(L^2)计算开销和内存访问不连续问题。LSA在69B-A3B到560B-A27B规模模型上,与全注意力性能持平。LSA支持原生训练最长100万token的上下文,并支撑LongCat-2.0(1.6T-A48B)的开发。团队开源了LongCat-Flash-Lite-Sparse(69B-A3B)。
推荐理由:DeepSeek稀疏注意力有个瓶颈,LongCat这套新方案用流式感知和跨层索引把它治了,跑长文本不慢,还开源了个69B模型,可以试试。
7月23日
11:22
11:22官方账号arXiv cs.AI@Mahdi Heidari, Mohammad Mahdi Rahimi, Jaekyun Moon
ELSAA提出一种结合稀疏和低秩分支的注意力近似方法,避免显式计算完整的N×N注意力矩阵。稀疏分支捕捉高相似度交互,低秩分支压缩全局信息,并通过分母感知融合项平衡两者。该方法旨在支持更长上下文训练,同时保留token级交互和上下文混合能力。在多个长序列基准上验证了其效率与效果。
推荐理由:这篇论文把稀疏和低秩两种思路拧在一起,解决Transformer的长序列瓶颈。不用算完整的注意力矩阵,就能同时抓住局部和全局信息。
7月13日
09:12
09:12官方一手arXiv: DeepSeek@Alexander Tian, Aditya Ghai, Sanjit Neelam, Zaal Vasania, Akshay Mishra
精选
COBS通过引入压缩的二阶统计量改进了DeepSeek Native Sparse Attention(NSA)的块选择策略。在32k RULER长上下文检索基准上,COBS将平均分从NSA基线的0.2999提升至0.8195,接近稠密注意力的0.9040,缩小了约86%的差距。其KV缓存读取流量仅为稠密注意力的1/15.15,比NSA基线高1.21倍。模型保持短上下文行为,并在位置负对数似然上低于稠密注意力。
推荐理由:COBS在NSA基础上加了个二阶统计量,长上下文检索分数从0.3拉到0.82,接近稠密注意力但省了十几倍带宽,很实用。
7月11日
09:43
09:43Fireworks AI@FireworksAI_HQ
精选74°
MiniMax AI发布M3内核,针对长上下文稀疏注意力中数据依赖块选择导致的内存访问瓶颈。M3采用KV-stationary设计,每个块仅读取一次。在B200 GPU上达到约980 TFLOP/s的算力。该方案有效提升长上下文推理效率。

推荐理由:MiniMax搞了个M3内核,KV-stationary让稀疏注意力在B200上跑到980 TFLOP/s,每个块只读一次,长上下文推理加速神器。
7月7日
7月6日
05:27
05:27官方一手marktechpost@Asif Razzaq
美团发布LongCat-2.0,总参数量1.6万亿,每个token激活约480亿参数。模型原生支持100万token上下文,采用LongCat稀疏注意力机制。训练与推理均在国内AI ASIC超算集群上完成。该模型开源,API已开放访问。
事件专题

推荐理由:美团开源了1.6T参数的LongCat-2.0,激活参数480亿,原生支持100万token上下文,国内ASIC集群跑出来的,值得关注。
6月19日
09:34
09:34官方一手arXiv: DeepSeek@Ruiyang Ma, Teng Ma, Junru Li, Hantian Zha, Xuchun Shang, Qingda Hu, Zheng Liu, Xinjun Yang, Tao Ma, Guojie Luo
精选71°
长上下文LLM推理的内存瓶颈日益突出。传统RDMA解耦内存池对于稀疏注意力模型效率低下,仍需完整获取KV缓存。SAC系统利用CXL的低延迟、缓存行粒度加载/存储语义,仅在推理时按需获取所需的top-k KV条目。在DeepSeek-V3.2上使用SGLang的评估显示,相比RDMA基线,SAC实现了2.1倍吞吐量提升、9.7倍TTFT降低和1.8倍TBT降低。
事件专题

推荐理由:长上下文推理,内存传输是瓶颈。新方案SAC用CXL按需取KV缓存,比RDMA吞吐量翻倍、延迟降到十分之一,做稀疏推理的值得一看。
6月12日
6月9日
10:32
10:32官方一手arXiv: DeepSeek@Yan Wang, Qifan Zhang, Jiachen Yu, Tian Liang, Dongyang Ma, Xiang Hu, Zibo Lin, Chunyang Li, Zhichao Wang, Jia Li, Yujiu Yang, Haitao Mi, Dong Yu
精选72°
FlashMemory-DeepSeek-V4 提出了一种名为 Lookahead Sparse Attention (LSA) 的新型推理范式,通过神经记忆索引器预测未来上下文需求,仅保留关键 KV 块在 GPU 内存中。该架构采用解耦训练策略,将索引器作为独立双编码器训练,无需加载主模型。在 LongBench-v2、LongMemEval 等长上下文评测中,LSA 将物理 KV 缓存压缩至全上下文基线的 13.5%,同时下游准确率平均提升 0.6%。在 50 万 token 极端长度下,物理 KV 缓存开销降低超过 90%,且不损害模型核心推理能力。
推荐理由:LSA 解决了超长上下文推理的 GPU 内存瓶颈,做长文档分析或大规模序列建模的团队可以直接参考其稀疏注意力方案,显著降低部署成本。
6月5日
20:42
20:42IT之家博客/媒体
72°
腾讯混元团队提出 Stem 稀疏注意力算法,已被 ICML-26 收录。该算法通过 Token 位置衰减和输出感知度量两大创新,仅用 25% 算力即可逼近稠密注意力的精度。配套的 HPC 算子库将理论加速转化为实际性能,在 128K 上下文下首字延迟降低 3.6 倍。该方案为长文本推理场景提供了高效、低成本的注意力加速方案,相关论文和代码已开源。

推荐理由:长文本推理的延迟痛点终于有了低成本解法——Stem 用 25% 算力实现近无损精度,做 LLM 推理优化的团队可以直接用开源代码实测,128K 上下文下首字延迟降低 3.6 倍的效果值得关注。
6月1日