主要来源marktechpost
查看原文事件专题 · 官方一手
压缩混合MoE模型Nemotron-Labs-3-Puzzle-75B-A9B,吞吐量提升2.03倍
NVIDIA发布Nemotron-Labs-3-Puzzle-75B-A9B,这是Nemotron-3-Super的压缩变体。通过Iterative Puzzle方法,总参数从120.7B降至75.3B,活跃参数从12.8B降至9.3B。在单台8xB200节点上,它实现了2.03倍于Super的总吞吐量,每用户100 tok/s。在H100上,1M-token并发从1提升到8。
当前结论
NVIDIA把这个MoE模型压到75B,吞吐翻倍,用户延迟不变,适合降本增效。
11 个信源73° AI 热度最后更新 2026/7/9 08:47:37
证据链
相关来源 1elvis
查看原文相关来源 2NVIDIA AI
查看原文相关来源 3LangChain
查看原文相关来源 4Decoder
查看原文相关来源 5IT之家
查看原文相关来源 6Aravind Srinivas
查看原文相关来源 7arXiv cs.LG
查看原文相关来源 8AWS Machine Learning Blog
查看原文相关来源 9Harrison Chase
查看原文相关来源 10Clement Delangue
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。