主要来源vLLM
查看原文事件专题 · 多源确认
GoogleDeepMind 发布 DiffusionGemma:26B 扩散语言模型,vLLM 原生支持
GoogleDeepMind 推出了 DiffusionGemma,这是一个基于 Gemma4 架构的 26B 参数扩散语言模型(dLLM),并成为 vLLM 原生支持的首个扩散语言模型。与传统自回归模型逐个生成 token 不同,DiffusionGemma 能并行去噪 256 个 token 的块,在单张 H200(FP8)上以 batch size 1 实现超过 1200 输出 token/秒的吞吐量。该模型通过 vLLM 的 model runner v2 的 ModelState 和现有推测解码路径实现,对调度器和运行器改动极小。FP8 和 NVFP4 检查点已托管在 RedHat AI 中心,由 GoogleDeepMind、RedHat AI 和 NVIDIA AI 团队合作完成。这一进展标志着扩散模型在高效文本生成领域迈出重要一步。
当前结论
DiffusionGemma 用并行去噪替代逐 token 生成,大幅提升推理速度,做大规模文本生成或实时应用的团队可以直接在 vLLM 中体验,值得关注。
11 个信源73° AI 热度最后更新 2026/6/12 04:10:37
证据链
相关来源 1NVIDIA AI
查看原文相关来源 2Decoder
查看原文相关来源 3LMSYS Org (SGLang)
查看原文相关来源 4karminski-牙医 (AI工具)
查看原文相关来源 5Sundar Pichai
查看原文相关来源 6Philipp Schmid
查看原文相关来源 7rohanpaul_ai
查看原文相关来源 8Simon Willison’s Weblog
查看原文相关来源 9Tri Dao (FlashAttention)
查看原文相关来源 10Sebastian Raschka
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。