主要来源marktechpost
查看原文事件专题 ·官方一手
压缩混合MoE模型Nemotron-Labs-3-Puzzle-75B-A9B,吞吐量提升2.03倍
NVIDIA发布Nemotron-Labs-3-Puzzle-75B-A9B,这是Nemotron-3-Super的压缩变体。通过Iterative Puzzle方法,总参数从120.7B降至75.3B,活跃参数从12.8B降至9.3B。在单台8xB200节点上,它实现了2.03倍于Super的总吞吐量,每用户100 tok/s。在H100上,1M-token并发从1提升到8。
当前结论
NVIDIA把这个MoE模型压到75B,吞吐翻倍,用户延迟不变,适合降本增效。
11 个信源73° AI 热度最后更新 2026/7/9 08:47:37
证据链
11 个信源冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。