8月18日
10:30
10:30官方账号arXiv cs.LG@Reza Bayat, Ali Behrouz, Vahab Mirrokni, Aaron Courville
Proteus提出增量记忆激活机制,随上下文增长逐步扩展记忆容量。该方法可嵌入SWLA、Comba、Titans、Hope-Attention等模型,无需额外成本。在长上下文检索和理解任务上持续提升,且优势随长度增加而扩大。
推荐理由:Proteus给长上下文模型加了个记忆开关,逐步解锁容量,让SWLA、Titans这些模型在长文本上表现更好,越长的上下文提升越明显。
8月15日
00:25
00:25官方账号阿里通义 Qwen@Alibaba_Qwen
精选
阿里云发布 Qwen3.8-Max,即 2.4T-A95B 架构。即日起可通过 DigitalOcean Serverless Inference 调用,运行在 NVIDIA HGX B300 GPU 上。模型支持 1M token 上下文,专为长时程编码任务设计。用户按 API 用量付费,无需自建基础设施。
事件专题

推荐理由:阿里云把Qwen3.8-Max放上DigitalOcean了,1M上下文,写长代码直接调,按量付费不用管服务器。
8月6日
8月4日
12:10
12:10官方一手arXiv: DeepSeek@Wen Zan, Jiaqi Zhang, Jianchao Tan, Hong Liu, Cunguang Wang, Xiang Li, Duyue Ma, Guanyu Wu, Yifan Lu, Fengcun Li, Yerui Sun, Peng Pei, Yuchen Xie, Xunliang Cai
LongCat Sparse Attention(LSA)提出流式感知索引、跨层索引和分层索引三种策略,解决DeepSeek Sparse Attention的O(L^2)计算开销和内存访问不连续问题。LSA在69B-A3B到560B-A27B规模模型上,与全注意力性能持平。LSA支持原生训练最长100万token的上下文,并支撑LongCat-2.0(1.6T-A48B)的开发。团队开源了LongCat-Flash-Lite-Sparse(69B-A3B)。
推荐理由:DeepSeek稀疏注意力有个瓶颈,LongCat这套新方案用流式感知和跨层索引把它治了,跑长文本不慢,还开源了个69B模型,可以试试。
12:10
12:10官方账号arXiv cs.LG@Zhichen Liu, Ruihan Sun, Hengjie Yang, Zipeng Wu, Zhaohan Chen, Xiaofan Zhang, Yang Xu
72°
LiveMem为预训练全注意力大语言模型引入独立于活动上下文的记忆状态,主注意力路径只保留有界KV窗口。在LongMemEval基准上,LiveMem在对比系统中取得领先总分。即使支持证据已从当前上下文移除,LiveMem仍能依据记忆状态正确作答。证据距离分析表明,有用信息可持久保留在活动窗口之外。
推荐理由:论文提出LiveMem,给LLM加了个永久记忆状态,上下文窗口再长也不怕忘事。在LongMemEval上跑分领先,值得一看。
8月3日
16:00
16:00官方一手pandaily@contact@pandaily.com (Pandaily)
79°
阿里巴巴发布Qwen3.8-Max正式版,参数量达2.4万亿。该模型支持1M上下文窗口,可执行长时间运行的智能体任务。官方称其编码与办公能力显著提升,跻身全球第一梯队。开源权重预计一周内公布,开发者可下载使用。

推荐理由:阿里发了Qwen3.8-Max,2.4T参数加1M上下文,做长任务Agent很强,而且下周就开源了,能直接玩。
7月23日
11:25
11:22
11:22官方账号arXiv cs.AI@Mahdi Heidari, Mohammad Mahdi Rahimi, Jaekyun Moon
ELSAA提出一种结合稀疏和低秩分支的注意力近似方法,避免显式计算完整的N×N注意力矩阵。稀疏分支捕捉高相似度交互,低秩分支压缩全局信息,并通过分母感知融合项平衡两者。该方法旨在支持更长上下文训练,同时保留token级交互和上下文混合能力。在多个长序列基准上验证了其效率与效果。
推荐理由:这篇论文把稀疏和低秩两种思路拧在一起,解决Transformer的长序列瓶颈。不用算完整的注意力矩阵,就能同时抓住局部和全局信息。
09:55
09:55官方一手arXiv: DeepSeek@Sungrae Park, Sanghoon Kim, Gyoungjin Gim, Jungho Cho, Hyunwoong Ko, Minbyul Jeong, Minjeong Kim, Keunwoo Choi, Chaehun Shin, Chanwoong Yoon, Dongjun Kim, Eunwon Kim, Gyungin Shin, Hyeonju Lee, Hyungkyu Kang, Inseo Song, Jisu Bae, Jiyoon Han, Jiyun Lee, Joonkee Kim, Junyeop Lee, Mikyoung Cha, Sangwon Yu, Sehwan Joo, Seokyoon Kang, Seonghoon Yang, Seung Shin, Seunghyun Lee, Seungseop Lim, Seungyoun Shin, Sukyung Lee, Taegyeong Eo, Taehwan Oh, Taewhoo Lee, Wonho Song, Wonjun Oh, Wonseok Hwang, Yunsu Kim, Yura Shim, Hwalsuk Lee, Sunghun Kim, Du-Seong Chang, Kyunghyun Cho, Seungju Han, Yejin Choi, Junsuk Choe, Hwaran Lee, Minjeong Ban, Yun Taewon, Hwanjun Song, Jae-Gil Lee, KyungTae Lim, Alice Oh
Solar Open 2 是一个 250B 参数(15B 激活)的混合专家(MoE)语言模型,上下文窗口达 1M token。它采用混合注意力机制,每 3 层线性注意力插入 1 层 softmax,无位置编码。训练上,从 Solar Open 1 初始化 5.69B 参数共享骨架,并通过质量与稀有度感知的数据筛选将 20T 语料缩减为 10T 以提升效率。通过多教师同策略蒸馏(MOPD)融合 12 个领域专家。在 MMLU-Pro、LiveCodeBench 和 APEX-Agents 上领先,韩语基准平均最高,Ko-GDPval 上以不到 1/6 参数量与 DeepSeek-V4-Pro (1.6T) 竞争。
事件专题

推荐理由:Solar Open 2 发了,250B MoE 模型,1M token 超长上下文,专门跑复杂智能体任务。MMLU-Pro 和 LiveCodeBench 都领先,韩语能力还特别强,比 DeepSeek-V4-Pro 小很多但性能接近。
7月18日
7月17日
16:25
09:22
09:22官方账号arXiv cs.LG@Changhai Zhou, Kieran Liu, Yuhua Zhou, Qian Qiao, Jun Gao, Harry Zhang, Irvine Lu, Nolan Ho, Lucian Li, Andrew Lei, Cleon Cheng, Steven Chiang, Yihang Zeng, Di Zhang, Rio Yang, Kaijie Chen, Andrew Chen, Pony Ma, Weizhong Zhang, Cheng Jin
LongStraw 是一种针对百万token级别强化学习后训练的架构感知执行栈,基于 GRPO 实现,在固定 GPU 预算下运行。它通过共享提示无自动求导评估、仅保留模型特定状态并逐次重放短响应分支,将实时训练图缩小以换取重放时间。在 8 块 H20 GPU 上,LongStraw 完成了 2.1M 位置的分组 Qwen 评分和响应反向传播;分组数从 2 增至 8 时,峰值显存仅增加 0.21 GB。在 32 块 H20 GPU 上,端到端执行路径验证了 GLM-5.2 全部 78 层的 2.1M token 提示处理能力。这些实验证明了执行容量,但完整训练正确性尚未全面验证。
推荐理由:LongStraw 能让你在固定 GPU 预算下做百万 token 级别的强化学习后训练,比现有 256K 的方法多处理 8 倍上下文,而且内存增长极低。
7月11日
09:43
09:43Fireworks AI@FireworksAI_HQ
精选74°
MiniMax AI发布M3内核,针对长上下文稀疏注意力中数据依赖块选择导致的内存访问瓶颈。M3采用KV-stationary设计,每个块仅读取一次。在B200 GPU上达到约980 TFLOP/s的算力。该方案有效提升长上下文推理效率。

推荐理由:MiniMax搞了个M3内核,KV-stationary让稀疏注意力在B200上跑到980 TFLOP/s,每个块只读一次,长上下文推理加速神器。
7月8日
12:19
12:19官方账号arXiv cs.AI@Anna Cordoba, Adam Puente Tercero, Nerea Angulo Hijo, Mar Linares Tercero, Julia Barrientos, Ainhoa Miranda, Jesus Olivera
DepthWeave-KV是一种跨层键值缓存压缩方法,通过共享低秩通道基分解相邻层状态,保留令牌特定残差。它使用令牌条件深度路由器为指令型和检索关键令牌分配更高重构秩,并通过注意力输出探头在线追踪误差自适应压缩。在LongBench等基准上,DepthWeave-KV实现近满缓存任务质量,压缩比达8.3倍,64K上下文速度72.8 tokens/s。
推荐理由:长上下文推理内存瓶颈有救了!DepthWeave-KV用跨层分解加自适应压缩,8.3倍KV缓存缩减,速度72.8 tokens/s,比其他方法效果更好。
10:31
10:31官方账号NVIDIA AI@NVIDIAAI
精选74°
NVIDIA 开源了 NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4 模型,总参数量 75.3B,激活参数 9.3B,采用 MoE 架构。该模型从 Nemotron-3-Super-120B 通过 Iterative Puzzle 框架压缩而来,支持 1M token 上下文长度。模型可运行在单张 GB10 显卡上。
事件专题

推荐理由:NVIDIA 刚开源的 75B MoE 模型,实际只激活 9.3B 参数,单卡就能跑百万 token 上下文,适合长文档或代码分析。
7月7日
22:15
11:21