主要来源rohanpaul_ai
查看原文事件专题 · 多源确认
Google 发布 DiffusionGemma:26B MoE 开源模型,激活仅 3.8B,推理速度超快
Google 发布了 DiffusionGemma,一个基于扩散模型的 26B 参数 MoE 开源语言模型,激活参数仅 3.8B。该模型采用 Apache 2.0 许可证,量化后可在 18GB VRAM 内运行。其核心优势在于并行生成 256 个 token,推理速度比传统自回归模型快 4 倍,在 H100 上可达 1000+ tokens/s,在 RTX 5090 上可达 700+ tokens/s。这解决了本地大模型推理慢的痛点,尤其适合单用户场景。
当前结论
本地 LLM 用户终于等来速度突破——DiffusionGemma 的并行生成机制让推理快 4 倍,做本地部署或边缘计算的开发者可以直接在 18GB 显存下体验,值得一试。
7 个信源83° AI 热度最后更新 2026/6/10 18:00:29
证据链
相关来源 1NVIDIA AI
查看原文相关来源 2小互
查看原文相关来源 3Decoder
查看原文相关来源 4IT之家
查看原文相关来源 5shao__meng
查看原文相关来源 6marktechpost
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。