Google 开源 DiffusionGemma:扩散架构模型,1000+ tokens/s

Google 开源其扩散架构模型:DiffusionGemma 区别于Transformers 模型像打字机一样逐词一个一个生成 DiffusionGemma 可一次性生成大段或者整篇内容,然后再...

精选理由

DiffusionGemma 解决了 Transformer 逐词生成速度慢、无法回头修改的痛点,做文本生成或长内容创作的开发者可以直接在消费级显卡上跑,体验 1000+ tokens/s 的生成速度。

AI 摘要

Google 开源了 DiffusionGemma,一种基于扩散架构的语言模型,区别于逐词生成的 Transformer,它能一次性生成 256 个 tokens 的整块文本,再通过多轮迭代逐步优化。在 H100 上推理速度可达 1000+ tokens/s,RTX 5090 上 700+ tokens/s,26B 参数模型仅需 18GB 显存。其生成过程类似写草稿后反复修改,能自动修正前文错误,提升输出质量。这一开源模型为需要高吞吐、长文本生成的场景提供了新选择。

原文 · 小互

Google 开源其扩散架构模型:DiffusionGemma 区别于Transformers 模型像打字机一样逐词一个一个生成 DiffusionGemma 可一次性生成大段或者整篇内容,然后再...

Google 开源其扩散架构模型:DiffusionGemma 区别于Transformers 模型像打字机一样逐词一个一个生成 DiffusionGemma 可一次性生成大段或者整篇内容,然后再逐步优化 大幅度提高生成的速度: 在H100 上可实现 1000+ tokens/s,RTX 5090 上 700+ tokens/s 26B,18GB 显存能跑 一次可同时生成 256 个 tokens 自己检查自己,写完还能改: 普通 AI 写完一个字就锁死了,不会回头改。就算第 10 个字写错了,到第 100 个字的时候它也改不了前面的。 DiffusionGemma 的生成过程本身就是多轮迭代,每一轮它会重新审视整块文本,发现哪里不对就改掉。就像写作文先打草稿,再通读一遍改错别字,再读一遍调语句,几轮下来质量就上去了。 Your browser does not support the video tag. 🔗 View on Twitter 💬 3 🔄 0 ❤️ 8 👀 701 📊 3 ⚡