主要来源NVIDIA AI
查看原文事件专题 · 多源确认
NVIDIA推出Nemotron-Labs-TwoTower:将30B模型拆二并行生成token
NVIDIA Research将30B参数的Nemotron-3-Nano-30B-A3B模型拆分为两半,一半维护上下文,一半生成token。该扩散语言模型仅复用预训练权重而非从头训练,在保持98.7%原始质量的同时实现了2.42倍的生成加速。这种方法将传统的自回归逐token生成改为并行写入,显著提升了推理效率。
当前结论
NVIDIA把30B模型劈成两半,并行写token,速度翻倍还保质量,不是新训模型是复用预训练,挺聪明的做法。
8 个信源78° AI 热度最后更新 2026/7/1 19:00:01
证据链
相关来源 1marktechpost
查看原文相关来源 2IT之家
查看原文相关来源 3vLLM
查看原文相关来源 4Jim Fan
查看原文相关来源 5LMSYS Org (SGLang)
查看原文相关来源 6AWS Machine Learning Blog
查看原文相关来源 7Decoder
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。