00:21官方一手marktechpost@Asif Razzaq精选78°Cartesia 发布了基于状态空间模型构建的流式 TTS 模型 Sonic-3.6。该模型在 Artificial Analysis 的 Provider Voice 榜单上以 1,283 Elo 排名第一。它还在 Controlled Voice 榜单上取得 1,123 Elo 的成绩,该基准将所有模型克隆到相同的 8 个参考音色上。Sonic-3.6 实现了低于 90ms 的首字音频生成时间。AI模型CartesiaSonic-3.6语音生成推荐理由:Cartesia 新出的 Sonic-3.6 语音模型延迟很低,还拿了两个第一。原文稍后读已读值得跟进有用关注 Cartesia
15:36官方账号arXiv cs.AI@Bo Zhao, Zheng Wu, Yiping Xie, Zitong YUCardiacMamba是一个融合RGB面部视频与射频(RF)心脏运动信号的rPPG框架,通过状态空间建模提升心率估计的公平性与鲁棒性。其引入时间差分Mamba模块(TDMM)增强RF信号细微变化,双向SSM交互机制对齐异构模态,通道级FFT(CFFT)优化频谱特征。在EquiPleth数据集上,CardiacMamba取得0.96 bpm MAE、3.06 bpm RMSE和0.97皮尔逊相关系数,将浅深肤色MAE差距降至0.26 bpm,并在RGB退化或RF缺失时保持稳健。论文CardiacMambarPPG心率估计推荐理由:想搞非接触心率监测的可以看看,它把RGB和射频信号融合,肤色偏见和光照干扰都压下去了,EquiPleth上误差不到1 bpm。原文稍后读已读值得跟进有用关注 CardiacMamba
12:05官方账号arXiv cs.LG@Arslan Battalov, Karim Kramin, Alexander Markotenko, Sofia SinitsinaMuon是一种通过Newton-Schulz迭代在谱范数下做最速下降的优化器,此前证据几乎全部来自Transformer模型。这篇论文在Mamba-2 130M上对比了Muon与AdamW,只改变哪些权重组用Muon训练。结果显示只有输出投影用Muon时收益最明显,输入投影或两者都用效果更差。优势主要体现在token效率上,在两个语料和两个token预算下都成立,且超过计算最优训练点后依然持续。较低的条件数不能解释增益,因为条件数更低的输入投影反而没有帮助。论文MuonMamba优化器推荐理由:Muon优化器之前都在Transformer上测试,这篇论文把它用到Mamba-2 130M上,发现输出投影用Muon最划算,训练效率更高,值得看看。原文稍后读已读值得跟进有用关注 Muon
12:03官方账号arXiv cs.LG@Anusha Madan Gopal, Aras Pirbadian, Kristofor D. Carlson, M Anthony Lewis, Jonathan Tapson精选论文提出PRECOG,把语料库离线预编码为SSM隐藏状态,查询时将最优状态直接注入,省去RAG的上下文重新读取。在带192KB隐藏状态的1.2B参数TENNs-LLM上,PRECOG将prefill延迟从约27秒降到6毫秒以下,约4500倍加速,并保持与上下文RAG相当的答案质量。配套的SMC用认知域聚类构建层级持久记忆,支持保真度/存储调节和O(1)会话初始化。该机制依赖SSM固定长度、与位置无关的循环状态,Transformer的KV缓存因位置纠缠且随上下文线性增长而无法实现。论文PRECOGTENNs-LLMRAG推荐理由:论文把RAG预填充从27秒压到6毫秒,1.2B模型在边缘也能交互式检索,Transformer做不了。原文稍后读已读值得跟进有用关注 PRECOG
00:03elvis@omarsar0精选HOLA论文提出为线性注意力添加海马体互补存储,保留delta-rule状态的压缩记忆并增加一个有限精确KV缓存,形成半参数测试时记忆。在340M参数、15B SlimPajama tokens训练下,WikiText困惑度从27.32降至22.92,低于全注意力Transformer++的26.88。在RULER needle recall测试中,HOLA在32k tokens(16倍训练长度)上保持稳健。论文HOLA线性注意力长程召回1 个信源在谈事件专题推荐理由:线性注意力一直有长程遗忘问题,HOLA用一个小缓存就解决了,在32k长度上效果惊人。原文稍后读已读值得跟进有用关注 HOLA
11:58官方账号arXiv cs.LG@Ramprasath Ganesaraja, Sahil Dilip Panse, Swathika NMamba-2 1.3B参数模型通过分组量化感知训练(QAT)从FP16教师蒸馏,仅消耗4 GPU小时(单H100)和102M tokens,将内存从2,687 MB压缩至744 MB(3.61倍)。零样本七任务平均准确率达48.1%,接近Bi-Mamba的48.4%(±0.9pp置信区间)。该方法无需从头训练150B tokens,使用预训练检查点即可。研究还发现零比例坍缩现象,即可学习量化尺度导致的不稳定性,这在从头训练中不会出现。后处理校正策略对SSM无效,因循环结构导致误差累积。论文Mamba-2Ternary Mamba量化感知训练推荐理由:把Mamba-2压缩到1比特权重不用花大钱从头训练,用预训练模型加少量微调就行,效果只差0.3%。原文稍后读已读值得跟进有用关注 Mamba-2
13:11官方账号arXiv cs.LG@Wayne King, Zeyue Xue, Yuxuan Bian, Jie Huang, Haoran Li, Yaowei Li, Yaofeng Su, Yuming Li, Haoyu Wang, Shiyi Zhang, Songchun Zhang, Yuwei Niu, Sihan Xu, Junhao Zhuang, Haoyang Huang, Nan DuanEcho-Memory 是一项针对动作条件世界模型中记忆机制的受控研究。这类模型根据首帧、文本提示和相机动作序列生成多段视频,但其主要失败点往往是记忆而非局部图像合成:当相机离开再返回时,场景或关键物体可能悄然改变。现有记忆设计难以比较,因为增益与骨干网络、训练、检索和评估差异纠缠不清。Echo-Memory 固定了动作到视频的接口,仅改变历史信息的存储和读取方式,在共享的视频扩散骨干、优化器、相机动作表示、采样器和评估流程下,比较了原始上下文、基于压缩的记忆、不同读取路径的空间摘要以及状态空间循环。研究通过三分支协议(回放质量、域内循环重访和开放域返回探测)评估记忆,发现回放保真度不足以作为记住世界的代理指标。主要结论包括:原始上下文是强大的容量基线,能显著提升开放域返回性能;紧凑性不能替代容量;块状状态空间循环是最强的开放域返回机制。论文世界模型记忆机制视频生成推荐理由:做视频生成或世界模型研究的团队,这篇论文帮你拆解了记忆机制中容量、压缩、读取和循环四个关键维度,看完能直接指导你的模型设计。原文稍后读已读值得跟进有用关注 世界模型
11:27官方账号arXiv cs.AI@Abhilash Durgam, Nyle Siddiqui, Jeffrey A. Chan-Santiago, Qiushi Fu, Elakkat D. Gireesh, Mubarak Shah精选CaMBRAIN 是首个基于 Mamba 的因果状态空间模型,专为脑电图(EEG)信号实时推理设计。现有深度学习模型依赖注意力机制,序列长度增加时计算量呈二次增长,且需滑动窗口处理,无法理解全局信号。CaMBRAIN 利用因果状态空间模型保持线性复杂度,并引入多阶段自监督训练,增强长程记忆能力。在三个 EEG 数据集上,CaMBRAIN 达到最先进性能,吞吐量比现有模型高 10 倍以上,首次实现变长 EEG 信号的连续推理。论文EEG状态空间模型Mamba推荐理由:做脑机接口或神经信号处理的团队终于有了能实时处理长序列 EEG 的工具——CaMBRAIN 解决了注意力机制的计算瓶颈,吞吐量提升 10 倍,做实时监测或临床诊断的开发者可以直接用。原文稍后读已读值得跟进有用关注 EEG
04:08elvis@omarsar0精选该论文提出一种睡眠压缩机制,让模型每N步进行离线递归处理将上下文写入持久快速权重,然后清除KV缓存。在细胞自动机、多跳图检索和数学推理任务上,该方法比纯Transformer和SSM-Attention混合模型效果更好,睡眠时间越长性能提升越大。这为长时智能体提供了替代方案,通过压缩和遗忘原始token来避免注意力二次计算开销。论文DAIR.AI智能体长上下文推荐理由:智能体睡一觉,推理更强原文稍后读已读值得跟进有用关注 DAIR.AI
11:44官方账号arXiv cs.AI@Sangyun Lee, Sean McLeish, Tom Goldstein, Giulia Fanti精选论文提出一种类似睡眠的记忆巩固机制,让 Transformer 模型在长上下文任务中表现更好。模型在推理过程中定期将近期上下文转换为持久化的快速权重,并清除键值缓存,类似生物体的睡眠过程。在睡眠阶段,模型对积累的上下文进行多次离线循环处理,通过局部学习规则更新状态空间模型(SSM)块中的快速权重。在合成任务(如元胞自动机、多跳图检索)和数学推理任务上,该方法显著优于普通 Transformer 和 SSM-注意力混合模型。增加睡眠时长 N 能持续提升性能,尤其在需要深层推理的样本上效果最明显。论文Transformer长上下文记忆巩固1 个信源在谈事件专题推荐理由:这项研究给长上下文推理带来了新思路——用类似睡眠的离线巩固机制解决注意力瓶颈,做长链推理或复杂数学问题的开发者值得关注,尤其适合处理超长上下文的场景。原文稍后读已读值得跟进有用关注 Transformer
13:26官方账号arXiv cs.LG@Hoang-Quan Nguyen, Sankalp Pandey, Khoa Luu精选长序列建模中,Transformer 的二次复杂度限制了其扩展性,而状态空间模型(SSM)虽线性高效,但记忆机制偏简单,难以捕捉复杂全局交互。研究者提出量子长注意力记忆(QLAM),将隐藏状态表示为量子态,通过参数化量子电路实现非经典全局更新,既保留 SSM 的循环线性结构,又利用量子叠加丰富记忆表示。QLAM 隐式捕获全局依赖,并通过查询相关测量提取任务信息。在 sMNIST、sFashion-MNIST 和 sCIFAR-10 等序列图像分类任务上,QLAM 一致优于循环基线和 Transformer 模型。这项工作首次将量子系统的叠加特性引入状态序列建模,为长上下文 AI 提供了新思路。论文量子机器学习长序列建模状态空间模型推荐理由:做长序列建模或量子机器学习的研究者值得关注——QLAM 用量子叠加解决了 SSM 记忆能力不足的问题,在标准基准上已跑赢 Transformer,建议点开看实现细节。原文稍后读已读值得跟进有用关注 量子机器学习
11:42官方账号arXiv cs.AI(学术论文)针对传统CNN和ViT在事件相机图像重建中的局限性(CNN缺乏全局相关性,ViT计算复杂度随分辨率平方增长),研究者提出EmambaIR框架。该框架融合跨模态Top-K稀疏注意力(TSAM)和门控状态空间模块(GSSM),在保持线性计算复杂度的同时捕捉全局依赖。在运动去模糊、去雨和HDR增强三个任务的6个数据集上,EmambaIR以更低内存和计算成本超越现有最先进方法。代码已开源。论文状态空间模型事件相机/图像重建视觉/生成推荐理由:该工作为状态空间模型在高分辨率事件相机图像重建中提供了高效可行的方案,有助于推动实时视觉系统与边缘计算部署。原文稍后读已读值得跟进有用关注 状态空间模型