全部 AI 动态 · AI 热点

6月17日

11:58

arXiv cs.LG@Ramprasath Ganesaraja, Sahil Dilip Panse, Swathika N

Mamba-2 1.3B参数模型通过分组量化感知训练（QAT）从FP16教师蒸馏，仅消耗4 GPU小时（单H100）和102M tokens，将内存从2,687 MB压缩至744 MB（3.61倍）。零样本七任务平均准确率达48.1%，接近Bi-Mamba的48.4%（±0.9pp置信区间）。该方法无需从头训练150B tokens，使用预训练检查点即可。研究还发现零比例坍缩现象，即可学习量化尺度导致的不稳定性，这在从头训练中不会出现。后处理校正策略对SSM无效，因循环结构导致误差累积。

论文 Mamba-2 Ternary Mamba 量化感知训练模型压缩状态空间模型

推荐理由：把Mamba-2压缩到1比特权重不用花大钱从头训练，用预训练模型加少量微调就行，效果只差0.3%。

原文

6月16日

20:46

AITOP6月16日 20:46

600亿美元买下Cursor，xAI终于拿到了编程工具，但真正值得跟踪的或许不是AI

6月12日

12:57

AITOP6月12日 12:57

Claude代码里藏了个20260612，18个月后的AI记忆革命已经开始倒计时

12:42

Sebastian Raschka@rasbt

精选

Nemotron 3 Ultra 是 NVIDIA 发布的新一代开源权重模型，延续了前代 Super 变体的 Mamba-2 注意力混合架构和 LatentMoE 设计，但规模更大。该模型在能力与效率之间取得了极佳平衡，性能表现令人印象深刻。开源权重意味着开发者可以自由下载、微调和部署，适合资源受限但追求高性能的场景。这一发布进一步丰富了开源大模型生态，为研究者和工程师提供了新的选择。

AI模型 Nemotron 3 Ultra Mamba-2 LatentMoE 开源/仓库 NVIDIA

推荐理由：NVIDIA 把 Mamba-2 混合架构和 LatentMoE 做到更大更强，追求高性价比模型的团队可以直接拿来用，省去从头训练的昂贵成本。

原文

6月11日

15:28

AITOP6月11日 15:28

1107 vs 303：谷歌悄悄开源了一个“拆打字机”的模型，把大模型速度翻了4倍

15:23

AITOP6月11日 15:23

DiffusionGemma颠覆文本生成？自回归模型的“统治”要结束了

15:07

AITOP6月11日 15:07

每秒1107个token，Google开源的扩散模型为什么能改变本地推理格局？

12:00

arXiv cs.LG@Anamaria-Roberta Hartl, Levente Zólyomi, David Stap, Pieter-Jan Hoedt, Niklas Schmidinger, Lukas Hauzenberger, Sebastian Böck, Günter Klambauer, Sepp Hochreiter

精选

该论文系统比较了三种主流子二次架构（xLSTM、Mamba-2、Gated DeltaNet）在复杂任务上的表现，包括代码模型预训练、大模型蒸馏和时序基础模型预训练。结果显示，xLSTM 在所有任务中综合性能最优，其优势源于更灵活稳定的门控机制带来的状态追踪与记忆累积能力。研究通过统一公式分析和合成任务验证，揭示了 xLSTM 在长程依赖建模上的核心机制。

论文 xLSTM Mamba-2 子二次架构序列建模代码预训练

推荐理由：做序列建模或基础模型预训练的团队，这篇论文帮你厘清了 xLSTM 相比 Mamba 等架构的实际优势，看完可以直接指导模型选型。

原文