事件专题 · 多源确认

Google 开源 DiffusionGemma:扩散架构模型,1000+ tokens/s

Google 开源了 DiffusionGemma,一种基于扩散架构的语言模型,区别于逐词生成的 Transformer,它能一次性生成 256 个 tokens 的整块文本,再通过多轮迭代逐步优化。在 H100 上推理速度可达 1000+ tokens/s,RTX 5090 上 700+ tokens/s,26B 参数模型仅需 18GB 显存。其生成过程类似写草稿后反复修改,能自动修正前文错误,提升输出质量。这一开源模型为需要高吞吐、长文本生成的场景提供了新选择。

当前结论

DiffusionGemma 解决了 Transformer 逐词生成速度慢、无法回头修改的痛点,做文本生成或长内容创作的开发者可以直接在消费级显卡上跑,体验 1000+ tokens/s 的生成速度。

7 个信源78° AI 热度最后更新 2026/6/11 02:34:08

证据链

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情