事件专题 · 多源确认

GoogleDeepMind 发布 DiffusionGemma:26B 扩散语言模型,vLLM 原生支持

GoogleDeepMind 推出了 DiffusionGemma,这是一个基于 Gemma4 架构的 26B 参数扩散语言模型(dLLM),并成为 vLLM 原生支持的首个扩散语言模型。与传统自回归模型逐个生成 token 不同,DiffusionGemma 能并行去噪 256 个 token 的块,在单张 H200(FP8)上以 batch size 1 实现超过 1200 输出 token/秒的吞吐量。该模型通过 vLLM 的 model runner v2 的 ModelState 和现有推测解码路径实现,对调度器和运行器改动极小。FP8 和 NVFP4 检查点已托管在 RedHat AI 中心,由 GoogleDeepMind、RedHat AI 和 NVIDIA AI 团队合作完成。这一进展标志着扩散模型在高效文本生成领域迈出重要一步。

当前结论

DiffusionGemma 用并行去噪替代逐 token 生成,大幅提升推理速度,做大规模文本生成或实时应用的团队可以直接在 vLLM 中体验,值得关注。

11 个信源73° AI 热度最后更新 2026/6/12 04:10:37

证据链

相关来源 3LMSYS Org (SGLang)
查看原文
相关来源 4karminski-牙医 (AI工具)
查看原文
相关来源 8Simon Willison’s Weblog
查看原文
相关来源 9Tri Dao (FlashAttention)
查看原文
相关来源 10Sebastian Raschka
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情