事件专题 · 多源确认

NVIDIA压缩MoE模型Puzzle-75B-A9B,吞吐量翻倍可保持质量

NVIDIA发布论文,将混合MoE模型Nemotron-3-Super压缩为Puzzle-75B-A9B,活跃参数降至9B。在单个8xB200节点上,交互式服务器吞吐量约为原模型2倍。在H100 GPU上,1M token并发数从1请求提升至8。在推理、编程、长上下文和智能体基准上精度保持。该方法联合优化异构MoE剪枝、活跃参数预算和Mamba剪枝,结合蒸馏、强化学习、量化与多令牌预测头。

当前结论

英伟达把大MoE模型压到9B活跃参数,吞吐量翻倍,智能体应用部署成本大幅下降,适合模型高效推理场景。

11 个信源63° AI 热度最后更新 2026/7/7 17:20:02

证据链

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情