puzzle·general

Puzzle

别名
首次出现
2026-05-23
最近出现
2026-07-30
累计提及
10
§ 01综述

Puzzle 是 NVIDIA 推出的 Nemotron-Labs-3-Puzzle-75B-A9B 压缩混合 MoE 语言模型,通过稀疏化和 MoE 架构在保持质量的前提下大幅提升吞吐量。该模型支持 1M 上下文长度,于 2026 年 7 月 9 日开源,旨在降低大模型部署成本。

Puzzle 近期进展

  • NVIDIA 开源 Nemotron Puzzle 75B MoE 模型,支持 1M 上下文 (2026-07-09) — NVIDIA 正式发布 Puzzle-75B-A9B 模型,采用混合专家架构,仅激活 9B 参数,但保持 75B 参数量级的性能。
  • 压缩混合 MoE 模型 Nemotron-Labs-3-Puzzle-75B-A9B,吞吐量提升 2.03 倍 — 在匹配用户吞吐量的条件下,Puzzle 模型实现 2.03 倍服务器吞吐量提升,大幅降低推理延迟。
  • NVIDIA 压缩 MoE 模型 Puzzle-75B-A9B,吞吐量翻倍可保持质量 — 独立评测显示,Puzzle 模型在 MMLU、GSM8K 等基准测试中表现与原始 75B 模型接近,无明显质量损失。
  • 当前焦点与观察点

    Puzzle 模型的核心创新在于将稠密大模型压缩为稀疏 MoE 架构,在降低计算量的同时保留知识容量。目前业界关注其能否成为边缘部署和低资源场景的实用方案。争议点在于 MoE 模型的负载均衡和显存占用问题,NVIDIA 通过对称路由和共享专家技术进行缓解。此外,开源细节和微调工具的完善程度将影响其生态发展。Puzzle 的命名暗示了“拼图”式组合优化,未来或与更多稀疏化技术结合。
    § 02相关报道03 条在档
    1. 01
      压缩混合MoE模型Nemotron-Labs-3-Puzzle-75B-A9B,吞吐量提升2.03倍
      marktechpost
    2. 02
      NVIDIA 开源 Nemotron Puzzle 75B MoE 模型,支持 1M 上下文
      NVIDIA AI
    3. 03
      NVIDIA压缩MoE模型Puzzle-75B-A9B,吞吐量翻倍可保持质量
      elvis
    § 03邻近话题

    本页综述由 AITOP 基于公开报道整理。原报道版权归各自来源所有。

    /topic/Puzzle