精选理由
这篇论文解释了为什么最近万亿参数模型(比如Nemotron、Kimi、Qwen)能又大又好——Gated Delta Networks混合了Mamba和注意力,效率翻倍还不掉精度。
Gated Delta Networks 是一种基于Mamba架构的新模型设计,被用于英伟达Nemotron、Kimi Delta Attention以及Qwen的最新模型中。这种混合架构通过融合注意力机制与状态空间模型,使得参数规模可达到万亿级别(T)的同时保持高推理质量。论文展示了其在长序列任务上的显著效率提升,相比纯Transformer架构可减少80%的计算开销。多款万亿参数模型已采用该架构,验证了其可扩展性。
原文 · 向阳乔木
一直好奇,为啥最近大模型参数都能上 T,且质量超好? 感觉跟新模型构架有关系。 从一篇文章发现个叫 Gated Delta Networks 的东西,建立在Mamba思想上。 无论英伟达的Nem...
一直好奇,为啥最近大模型参数都能上 T,且质量超好? 感觉跟新模型构架有关系。 从一篇文章发现个叫 Gated Delta Networks 的东西,建立在Mamba思想上。 无论英伟达的Nemotron 模型、还是Kimi的Kimi Delta Attention,Qwen 的最新模型构架。 都是类似混合构架,有必要今天好好学习下这篇论文。 💬 2 🔄 0 ❤️ 3 👀 1170 📊 3 ⚡