主要来源Google AI Developers
查看原文事件专题 · 多源确认
Google 发布 Gemma 4 QAT 检查点,本地运行大模型更高效
Google 发布了 Gemma 4 的量化感知训练(QAT)检查点,支持在消费级 GPU 和移动设备上本地运行模型,且质量损失极小。新特性包括 GGUF Q4_0 格式检查点,针对所有尺寸和 drafter 模型优化了本地性能;以及自定义移动端混合精度模式,将 Gemma 4 压缩至 1GB 以下,采用 2-bit 解码层、优化 KV 缓存和静态激活。通过在训练时模拟压缩而非事后量化,大幅降低内存占用并加速解码,同时保持推理质量。这为开发者提供了在边缘设备上部署强大 AI 模型的新选择。
当前结论
做本地 AI 部署或移动端推理的开发者,终于有了官方 QAT 方案——Gemma 4 压缩到 1GB 以下还能保持推理质量,建议直接下载检查点试试。
11 个信源72° AI 热度最后更新 2026/6/5 16:57:24
证据链
相关来源 1小互
查看原文相关来源 2ollama
查看原文相关来源 3Paul Couvert
查看原文相关来源 4rohanpaul_ai
查看原文相关来源 5Decoder
查看原文相关来源 6berryxia
查看原文相关来源 7marktechpost
查看原文相关来源 8Demis Hassabis
查看原文相关来源 9Sundar Pichai
查看原文相关来源 10Philipp Schmid
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。