Gemma 4 QAT模型:为移动和笔记本电脑效率优化压缩
摘要
谷歌发布采用量化感知训练(QAT)优化的Gemma 4模型,旨在提升移动和笔记本电脑部署的效率,将E2B模型的内存占用降至1GB,同时保持质量。
暂无内容
查看缓存全文
缓存时间: 2026/06/05 17:09
# Gemma 4 QAT 模型:针对移动和笔记本电脑效率优化模型压缩
来源:https://blog.google/innovation-and-ai/technology/developers-tools/quantization-aware-training-gemma-4/
您的浏览器不支持音频元素。
收听文章
此内容由 Google AI 生成。生成式 AI 为实验性技术。
[[duration]] 分钟
自两个月前发布 [Gemma 4](https://blog.google/innovation-and-ai/technology/developers-tools/gemma-4/) 以来,我们持续扩展其能力。首先,我们引入了[多令牌预测](https://blog.google/innovation-and-ai/technology/developers-tools/multi-token-prediction-gemma-4/) (MTP) 来加速推理,就在几天前,我们还发布了[一款 12B 模型](https://blog.google/innovation-and-ai/technology/developers-tools/introducing-gemma-4-12b/),以弥合 E4B 和 26B MOE 模型之间的差距。
今天,我们发布了通过量化感知训练 (QAT) 优化的新检查点,使 Gemma 4 更加高效,从而可以在本地边缘设备和消费级 GPU 上运行模型。
通过在训练期间模拟量化,QAT 在模型压缩时最大限度地减少质量损失。此版本包含流行的 Q4\_0 量化格式的 QAT 检查点,以及一种专门针对移动用例的新型量化格式。使用这种移动格式,我们将 Gemma 4 E2B 的内存占用减少到 1 GB。这些共同显著降低了内存需求,同时保留了您对 Gemma 4 所期待的能力和质量。
## **保持模型质量的同时缩小尺寸**
量化是一项关键技术,通过减少模型内存占用并同时加速解码速度,使其能够在消费级硬件上运行。然而,标准的后训练量化 (PTQ) 通常会导致性能下降。QAT 不是简单地在训练后量化模型,而是将量化过程直接集成到训练中。尽管 PTQ 在保持质量方面已经有效,但我们的 QAT 结果相比标准 PTQ 基线实现了更高的整体质量。
我们将此 QAT 方案应用于流行的 Q4\_0 格式,以最大化所有模型的性能。对于边缘模型 (E2B 和 E4B),我们重新思考了量化方法,采用了一种针对移动设备专门优化的量化方案。
## **节省 VRAM 和存储**
以下是加载模型所需的大致内存需求,指示所需 VRAM 的数量。
加载模型所需的大致内存需求,指示所需 VRAM 的数量。
## **在幕后优化移动设备**
标准压缩格式通常难以在移动处理器上高效运行。为了确保 Gemma 4 在移动设备上流畅运行,我们设计了一种针对边缘硬件定制的移动量化方案:
- **静态激活:** 通常,模型会浪费处理能力来实时计算数据缩放方式。我们在训练期间预先计算这些设置,从而减少移动芯片上的工作负载,加快响应速度。
- **通道级量化:** 我们将压缩数据的结构设计得符合移动加速器的设计方式。这使得手机能够原生执行计算,无需缓慢的变通方法。
- **针对性 2 比特量化:** 我们对模型中生成令牌的特定部分进行了重度压缩(至 2 比特),同时保持核心推理层的高精度。这节省了存储空间,同时不会降低模型智能。
- **嵌入和 KV 缓存优化:** 我们将压缩重点放在模型的词汇表及其短期记忆上。这大幅减少了活跃内存占用,让您可以进行长时间对话而不会耗尽空间。
由于我们的音频和视觉编码器在许多用例中并非必需,因此您可以通过仅部署所需的模态来进一步优化内存占用。例如,Gemma 4 E2B 纯文本模型(无逐层嵌入)需要小于 1 GB 的内存。
## **立即开始**
为了使这些模型能够轻松与您首选的工作流程配合使用,我们与生态系统中流行的开发者工具合作,从今天开始无缝支持 Gemma 4 QAT 检查点:
- **下载权重:** 立即在 Hugging Face 上获取 [Q4\_0](https://huggingface.co/collections/google/gemma-4-qat-q4-0) 和 [移动](https://huggingface.co/collections/google/gemma-4-qat-mobile) 模型权重。我们根据您的工作流程定制了格式:GGUF 格式可直接用于 llama.cpp,压缩张量则提供给 vLLM。对于其他情况,我们共享未量化的检查点,可转换并量化为支持 Q4\_0 的格式。
- **集成与学习:** 查阅我们的[文档](https://ai.google.dev/gemma/docs/core#qat),了解如何最佳部署 QAT 检查点。
- **在桌面尝试:** 使用 [llama.cpp](https://huggingface.co/collections/google/gemma-4-qat-q4-0)、[Ollama](https://ollama.com/library/gemma4) 和 [LM Studio](https://lmstudio.ai/models/gemma-4) 等用户友好界面,轻松在本地桌面上下载、管理和运行 Gemma 4 QAT 模型。
- **设备端部署:** 使用 Google 轻量级的 [LiteRT-LM](https://huggingface.co/collections/litert-community/gemma-family) 运行时进行优化的边缘部署,或通过 [Transformers.js](https://huggingface.co/collections/onnx-community/gemma-4-onnx) 直接在网页上运行模型。
- **使用您喜欢的开发工具:** 通过 [vLLM](https://huggingface.co/collections/google/gemma-4-qat-q4-0) 高效服务更大模型,使用 [MLX](https://huggingface.co/collections/mlx-community/gemma-4-qat) 针对 Apple Silicon 进行优化。使用 MTP QAT 检查点,在量化模型的同时保留 [MTP](https://blog.google/innovation-and-ai/technology/developers-tools/multi-token-prediction-gemma-4/) 的加速效果。直接使用 Hugging Face Transformers 和 [Unsloth](https://unsloth.ai/docs/models/gemma-4/qat) 微调权重。
我们非常期待看到您使用本地运行的 Gemma 4 构建出什么成果!
相似文章
google/gemma-4-12B-it-qat-q4_0-gguf
Google DeepMind 发布了 Gemma 4 模型,这些模型通过量化感知训练(QAT)进行了优化,并提供包括 GGUF 在内的多种格式,在降低内存需求的同时实现了高质量。
@_philschmid: 权重:https://huggingface.co/collections/google/gemma-4-qat-q4-0… 博客:https://blog.google/innovation-and-ai/techno…
Google 发布了 Gemma 4 模型,采用量化感知训练 (QAT) 并以 Q4_0 精度托管在 Hugging Face 上,提供从 5B 到 33B 参数的高效变体。
@_philschmid: 更多 Gemma 4!新的 QAT Gemma 4 检查点,性能相似,内存使用减少约 4 倍!它附带了一种新的移动…
新的 QAT Gemma 4 检查点提供相似的性能,内存使用减少约 4 倍,通过一种新的移动端量化格式,使 Gemma 4 E2B 的内存占用仅需 1GB。
Google 的量化感知训练 Gemma 检查点已在 HuggingFace 上发布,支持移动设备推理
Google 在 HuggingFace 上发布了经过量化感知训练的 Gemma 4 检查点,针对移动设备推理进行了优化,并提供 QAT Mobile 和 Q4_0 两种变体。
Gemma 4 QAT 确认即将发布!
一位 Google Gemma 团队成员证实,Gemma 4 QAT(量化感知训练)模型即将发布,建议用户等待后再测试自己的量化版本。