主要来源小互
查看原文事件专题 · 多源确认
Google 开源 DiffusionGemma:扩散架构模型,1000+ tokens/s
Google 开源了 DiffusionGemma,一种基于扩散架构的语言模型,区别于逐词生成的 Transformer,它能一次性生成 256 个 tokens 的整块文本,再通过多轮迭代逐步优化。在 H100 上推理速度可达 1000+ tokens/s,RTX 5090 上 700+ tokens/s,26B 参数模型仅需 18GB 显存。其生成过程类似写草稿后反复修改,能自动修正前文错误,提升输出质量。这一开源模型为需要高吞吐、长文本生成的场景提供了新选择。
当前结论
DiffusionGemma 解决了 Transformer 逐词生成速度慢、无法回头修改的痛点,做文本生成或长内容创作的开发者可以直接在消费级显卡上跑,体验 1000+ tokens/s 的生成速度。
7 个信源78° AI 热度最后更新 2026/6/11 02:34:08
证据链
相关来源 1rohanpaul_ai
查看原文相关来源 2NVIDIA AI
查看原文相关来源 3Decoder
查看原文相关来源 4IT之家
查看原文相关来源 5shao__meng
查看原文相关来源 6marktechpost
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。