事件专题 · 官方一手

压缩混合MoE模型Nemotron-Labs-3-Puzzle-75B-A9B,吞吐量提升2.03倍

NVIDIA发布Nemotron-Labs-3-Puzzle-75B-A9B,这是Nemotron-3-Super的压缩变体。通过Iterative Puzzle方法,总参数从120.7B降至75.3B,活跃参数从12.8B降至9.3B。在单台8xB200节点上,它实现了2.03倍于Super的总吞吐量,每用户100 tok/s。在H100上,1M-token并发从1提升到8。

当前结论

NVIDIA把这个MoE模型压到75B,吞吐翻倍,用户延迟不变,适合降本增效。

11 个信源73° AI 热度最后更新 2026/7/9 08:47:37

证据链

相关来源 8AWS Machine Learning Blog
查看原文
相关来源 10Clement Delangue
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情