17:45官方账号NVIDIA AI@NVIDIAAIApplied Compute 平台现已支持 NVIDIA 的 Nemotron 3.5 Lightning 进行训练和推理。该模型在 agentic coding benchmark 中,当并发和总 token 吞吐量扩展 16 倍时,解码吞吐量、首 token 时间和用户中位延迟保持不变。其 LatentMoE 和 Mamba 架构能以最小开销扩展稀疏性、上下文长度和批大小,显著提升后训练迭代吞吐量。AI产品Nemotron 3.5 LightningNVIDIAApplied Compute10 个信源在谈事件专题推荐理由:Applied Compute 支持 Nemotron 3.5 Lightning 了,并发翻 16 倍延迟不涨,训练迭代快多了。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
12:05官方账号arXiv cs.LG@Arslan Battalov, Karim Kramin, Alexander Markotenko, Sofia SinitsinaMuon是一种通过Newton-Schulz迭代在谱范数下做最速下降的优化器,此前证据几乎全部来自Transformer模型。这篇论文在Mamba-2 130M上对比了Muon与AdamW,只改变哪些权重组用Muon训练。结果显示只有输出投影用Muon时收益最明显,输入投影或两者都用效果更差。优势主要体现在token效率上,在两个语料和两个token预算下都成立,且超过计算最优训练点后依然持续。较低的条件数不能解释增益,因为条件数更低的输入投影反而没有帮助。论文MuonMamba优化器推荐理由:Muon优化器之前都在Transformer上测试,这篇论文把它用到Mamba-2 130M上,发现输出投影用Muon最划算,训练效率更高,值得看看。原文稍后读已读值得跟进有用关注 Muon
13:00向阳乔木@vista8Gated Delta Networks 是一种基于Mamba架构的新模型设计,被用于英伟达Nemotron、Kimi Delta Attention以及Qwen的最新模型中。这种混合架构通过融合注意力机制与状态空间模型,使得参数规模可达到万亿级别(T)的同时保持高推理质量。论文展示了其在长序列任务上的显著效率提升,相比纯Transformer架构可减少80%的计算开销。多款万亿参数模型已采用该架构,验证了其可扩展性。论文Gated Delta NetworksMambaNemotron推荐理由:这篇论文解释了为什么最近万亿参数模型(比如Nemotron、Kimi、Qwen)能又大又好——Gated Delta Networks混合了Mamba和注意力,效率翻倍还不掉精度。原文稍后读已读值得跟进有用关注 Gated Delta Networks
12:03官方账号arXiv cs.LG@Raktim Bhattacharya研究团队为Mamba等选择性状态空间模型开发了一种精确测量状态使用的工具,该工具基于对角状态矩阵将输出分解为每个模态贡献,并通过Gram张量计算任意子集剪枝的精确误差。在Mamba-1家族(130M至2.8B参数)上验证,与参考实现相对误差仅2.3×10⁻⁷;该工具预测一层剪枝误差的中位相对偏差为5×10⁻⁷(基于4,464个配置)。分析Mamba-1、已部署的7B Falcon-Mamba及Mamba-2发现,模型会随输入重新分配状态空间,哪些模态承载信号会随上下文迁移;基于输入调度的模态剪枝在各级别(130M至7B)均优于静态、Hankel及自适应排名,在半预算下匹配未剪枝模型性能。论文Mamba选择性状态空间模型模型剪枝推荐理由:这篇论文给出了一个能精确测量Mamba状态使用情况的工具,还发现模型会根据输入动态调整哪些状态起作用——基于这个发现做剪枝,效果比之前的方法好很多,7B模型上预算减半性能不变。原文稍后读已读值得跟进有用关注 Mamba
20:28官方账号Tri Dao (FlashAttention)@tri_dao精选在运行大规模上下文智能体时,Qwen 3.5和Nemotron Ultra等混合模型面临Gated-DeltaNet/Mamba状态的瓶颈。一个简单洞察是加载状态并计算但不存储,可使速度提升2倍。该重计算技巧最终解锁了状态空间模型(SSM)的推测解码(spec decoding)功能。技巧Qwen 3.5Nemotron UltraMamba1 个信源在谈事件专题推荐理由:不用存状态,算完就扔,SSM推理直接快一倍,Qwen 3.5和Nemotron Ultra用户试试这个技巧。原文稍后读已读值得跟进有用关注 Qwen 3.5
11:27官方账号arXiv cs.AI@Abhilash Durgam, Nyle Siddiqui, Jeffrey A. Chan-Santiago, Qiushi Fu, Elakkat D. Gireesh, Mubarak Shah精选CaMBRAIN 是首个基于 Mamba 的因果状态空间模型,专为脑电图(EEG)信号实时推理设计。现有深度学习模型依赖注意力机制,序列长度增加时计算量呈二次增长,且需滑动窗口处理,无法理解全局信号。CaMBRAIN 利用因果状态空间模型保持线性复杂度,并引入多阶段自监督训练,增强长程记忆能力。在三个 EEG 数据集上,CaMBRAIN 达到最先进性能,吞吐量比现有模型高 10 倍以上,首次实现变长 EEG 信号的连续推理。论文EEG状态空间模型Mamba推荐理由:做脑机接口或神经信号处理的团队终于有了能实时处理长序列 EEG 的工具——CaMBRAIN 解决了注意力机制的计算瓶颈,吞吐量提升 10 倍,做实时监测或临床诊断的开发者可以直接用。原文稍后读已读值得跟进有用关注 EEG
15:43官方一手marktechpost@Asif Razzaq精选70°NVIDIA 发布 Gated DeltaNet-2,一种线性注意力层,将 Delta 规则中的擦除和写入操作解耦为通道级擦除门 b_t 和写入门 w_t。在 1.3B 参数、100B FineWeb-Edu 令牌训练下,它在语言建模、常识推理和长上下文检索任务上超越 Mamba-2、Gated DeltaNet、KDA 和 Mamba-3。最大提升出现在 RULER S-NIAH 和多键针检索基准上。AI模型大模型推理模型Mamba4 个信源在谈事件专题推荐理由:NVIDIA 新线性注意力,解耦擦写门原文稍后读已读值得跟进有用关注 大模型
11:06官方账号arXiv cs.AI@Amir Mousavi, Mohammad Sadegh Sirjani, Erfan Nourbakhsh, Mimi Xie, Rocky Slavin, Leslie Neely, John Davis, John Quarles精选眼动追踪数据在实时认知负荷评估中面临两大挑战:眨眼和追踪失败导致的数据频繁缺失,以及长时程依赖的高效建模。MambaGaze框架通过显式缺失数据建模(XMD编码)和双向Mamba-2结构解决这些问题,在CLARE和CL-Drive数据集上分别达到76.8%和73.1%的准确率,超越CNN、Transformer等基线4-12个百分点。在NVIDIA Jetson边缘设备上实现43-68 FPS的实时推理,功耗低于7.5W,适合可穿戴认知负荷监测场景。该工作为安全关键应用(如驾驶员警觉监控、自动化驾驶舱辅助)提供了可行的AI方案。论文认知负荷评估眼动追踪Mamba推荐理由:眼动数据缺失是认知负荷评估的长期痛点,MambaGaze用双向Mamba显式建模缺失模式,做可穿戴AI或人机交互的团队可以直接参考其边缘部署方案。原文稍后读已读值得跟进有用关注 认知负荷评估