Google DeepMind 发布 Gemma 4 QAT 检查点:Q4_0 与全新移动格式,大幅降低端侧内存占用
Google DeepMind 推出 Gemma 4 的量化感知训练(QAT)检查点,包括 Q4_0 和专为移动设备设计的新格式。本文对比 BF16、Q4_0 QAT 和移动 QAT 三种格式的内存占用与质量保留,分析对中文开发者本地部署的影响。
一句话看懂
Google DeepMind 为 Gemma 4 系列发布 QAT 检查点,Q4_0 格式将 E2B 模型内存降至 3.2GB,全新移动格式进一步压缩至约 1GB,适合手机和消费级 GPU 本地运行。
详细发生了什么
Google DeepMind 在 2026 年 6 月 5 日发布了 Gemma 4 系列的量化感知训练(QAT)检查点,面向边缘设备和消费级 GPU 的本地部署。这是继 4 月 Gemma 4 发布和两天前 12B 模型之后的又一动作。
QAT 与标准训练后量化(PTQ)不同:PTQ 在训练完成后压缩模型,常导致质量下降;QAT 则在训练过程中模拟量化,让模型学会补偿精度损失。Google 声称其 QAT 结果质量高于标准 PTQ,但未公布 Gemma 4 QAT 的具体基准分数。作为参考,上一代 Gemma 3 QAT 在 llama.cpp 评估中将 Q4_0 的 perplexity 下降减少了 54%。
本次对比了 Gemma 4 E2B 和 E4B 三种格式:
- BF16(16-bit):质量基线,E2B 需 9.6 GB,E4B 需 15 GB。
- Q4_0 QAT(4-bit):通用本地格式,E2B 降至 3.2 GB,E4B 降至 5 GB,质量优于同尺寸 PTQ。
- 移动 QAT:专为移动硬件设计,E2B 约 1 GB,纯文本版(去掉音频和视觉编码器)低于 1 GB。
移动格式采用四项技术:静态激活(预计算缩放)、通道级量化、针对 token 生成层的 2-bit 量化、嵌入和 KV 缓存优化。核心推理层保持较高精度以保护能力。
权重已在 Hugging Face 发布,支持 llama.cpp、Ollama、LM Studio、vLLM、MLX 和 LiteRT-LM。
中文圈视角
对于中文开发者,这次发布意味着本地部署大模型的门槛进一步降低。
1. 硬件适配:Q4_0 QAT 的 3.2GB 内存需求,让 Gemma 4 E2B 可以在 4GB 显存的消费级 GPU(如 RTX 3050)上运行,甚至 Raspberry Pi 5 也能跑 INT4 版本。移动格式的 1GB 内存则让旗舰手机本地运行成为可能。
2. 国产平替对比:目前国内类似规模的模型如 DeepSeek-R1 蒸馏版、Qwen2.5 系列,也支持 4-bit 量化,但 Gemma 4 的移动格式专门优化了手机硬件(如静态激活、通道级量化),可能更适合移动端部署。不过,中文场景下 Gemma 4 的中文能力仍需实测,而 Qwen 等国产模型原生中文支持更好。
3. 应用场景:对中文用户,本地运行 Gemma 4 可用于离线写作助手、代码补全、翻译等。移动格式尤其适合手机上的 AI 助手,无需联网即可处理敏感数据。
4. 监管与合规:本地部署避免了数据出境问题,符合国内对数据安全的要求。但模型本身来自 Google,需注意内容安全审核。
盲点:中文社区目前较少讨论 QAT 相比 PTQ 在中文任务上的具体质量差异,以及移动格式在国产手机芯片(如骁龙、天玑、麒麟)上的实际性能。
几条值得记住的细节
- Q4_0 QAT 将 Gemma 4 E2B 内存从 9.6 GB 降至 3.2 GB,E4B 从 15 GB 降至 5 GB。
- 移动 QAT 格式将 E2B 压缩至约 1 GB,纯文本版(去掉 PLE)低于 1 GB。
- QAT 不改变模型大小,只提升同尺寸下的质量;内存削减主要来自移动格式的 2-bit 量化等技术。
- 权重已在 Hugging Face 发布,支持 llama.cpp、Ollama、LM Studio、vLLM、MLX 和 LiteRT-LM。
- Google 未公布 Gemma 4 QAT 的独立基准分数,质量声明需自行验证。
一句话总结
Gemma 4 QAT 让开发者能在手机和低端 GPU 上本地运行强大模型,中文用户可借此实现离线 AI 应用,但需实测中文能力。