主要来源elvis
查看原文事件专题 · 多源确认
NVIDIA压缩MoE模型Puzzle-75B-A9B,吞吐量翻倍可保持质量
NVIDIA发布论文,将混合MoE模型Nemotron-3-Super压缩为Puzzle-75B-A9B,活跃参数降至9B。在单个8xB200节点上,交互式服务器吞吐量约为原模型2倍。在H100 GPU上,1M token并发数从1请求提升至8。在推理、编程、长上下文和智能体基准上精度保持。该方法联合优化异构MoE剪枝、活跃参数预算和Mamba剪枝,结合蒸馏、强化学习、量化与多令牌预测头。
当前结论
英伟达把大MoE模型压到9B活跃参数,吞吐量翻倍,智能体应用部署成本大幅下降,适合模型高效推理场景。
11 个信源63° AI 热度最后更新 2026/7/7 17:20:02
证据链
相关来源 1marktechpost
查看原文相关来源 2NVIDIA AI
查看原文相关来源 3LangChain
查看原文相关来源 4IT之家
查看原文相关来源 5Decoder
查看原文相关来源 6Aravind Srinivas
查看原文相关来源 7The Rundown AI
查看原文相关来源 8vLLM
查看原文相关来源 9pandaily
查看原文相关来源 10Harrison Chase
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。