主要来源rohanpaul_ai
查看原文事件专题 · 多源确认
DiffusionGemma 4倍速碾压 Gemma4:本地运行新范式
atomic[.]chat 在单块 H100(FP8)上对比了 DiffusionGemma(扩散文本模型)与 Gemma4 26B A4B(自回归模型)。DiffusionGemma 速度是 Gemma4 的 4 倍,改变了错误分布模式。自回归模型逐 token 生成,速度慢但精度高;扩散模型批量生成 token 再迭代修正,因此响应更快。这一对比展示了扩散模型在本地推理中的速度优势,可能改变未来本地 LLM 的部署选择。
当前结论
本地运行 LLM 的开发者终于有了速度新选择——DiffusionGemma 的 4 倍加速意味着更流畅的交互体验,用 atomic[.]chat 的团队可以直接在单卡上体验,值得一试。
11 个信源58° AI 热度最后更新 2026/6/12 01:59:20
证据链
相关来源 1IT之家
查看原文相关来源 2Philipp Schmid
查看原文相关来源 3Decoder
查看原文相关来源 4LMSYS Org (SGLang)
查看原文相关来源 5vLLM
查看原文相关来源 6Sundar Pichai
查看原文相关来源 7NVIDIA AI
查看原文相关来源 8小互
查看原文相关来源 9karminski-牙医 (AI工具)
查看原文相关来源 10marktechpost
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。