主要来源rohanpaul_ai
查看原文事件专题 · 多源确认
Google 发布 Gemma 4 QAT 检查点,模型从 11.4GB 缩至 1.1GB
Google 发布了 Gemma 4 的 QAT(量化感知训练)检查点,将最小模型从 11.4GB 压缩至 1.1GB,纯文本版本仅 0.84GB。与传统的 PTQ(训练后量化)不同,QAT 在训练过程中模拟压缩,让模型学会在权重被压缩时保持推理质量。Google 还构建了针对移动端的格式,包括静态激活、通道级量化、目标 2 位量化和 KV 缓存优化,减少手机计算负担,延长长对话的内存使用。这使得 Gemma 4 更容易在手机和笔记本上运行,降低了部署门槛。
当前结论
QAT 解决了模型压缩后推理质量下降的痛点,做移动端 AI 部署的开发者可以直接用这些检查点,在手机上跑大模型不再吃内存。
8 个信源72° AI 热度最后更新 2026/6/6 00:26:02
证据链
相关来源 1Google AI Developers
查看原文相关来源 2Paul Couvert
查看原文相关来源 3ollama
查看原文相关来源 4marktechpost
查看原文相关来源 5Philipp Schmid
查看原文相关来源 6AI Breakfast
查看原文相关来源 7IT之家
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。