Gemma 3n 介绍:开发者指南
摘要
Google DeepMind 宣布全面发布 Gemma 3n,这是一款面向移动端的多模态 AI 模型,采用 MatFormer 架构,针对设备端效率进行了优化。此次发布包括 E2B 和 E4B 两种变体,它们内存占用低,同时在推理、编程和多语言任务中表现出色。
Gemma 3n 专为曾参与塑造 Gemma 的开发者社区而设计。
查看缓存全文
缓存时间:
2026/05/08 09:47
# 介绍 Gemma 3n:开发者指南
来源:https://developers.googleblog.com/en/introducing-gemma-3n-developer-guide/
Ian Ballantyne (https://developers.googleblog.com/en/search/?author=Ian+Ballantyne)
高级开发者关系工程师
Google DeepMind
首个 Gemma 模型 (https://blog.google/technology/developers/gemma-open-models/) 于去年初发布,此后已发展成一个蓬勃发展的 Gemmaverse (https://deepmind.google/models/gemma/gemmaverse/),累计下载量超过 1.6 亿次。这个生态系统包括我们家族中十多个专门模型,涵盖从安全保障到医疗应用等各个领域,而最令人鼓舞的是社区带来的无数创新。从如 Roboflow (https://deepmind.google/models/gemma/gemmaverse/roboflow/) 这样的创新者(他们构建企业级计算机视觉),到东京科学研究所 (https://deepmind.google/models/gemma/gemmaverse/gemma-2-llama-swallow/) 创建的高性能日语 Gemma 变体,你们的工作为我们指明了前进方向。
基于这一令人难以置信的势头,我们很高兴地宣布 Gemma 3n 的完整发布。上个月的预览 (https://developers.googleblog.com/en/introducing-gemma-3n/) 只是惊鸿一瞥,而今天则解锁了这一以移动端优先架构的全部力量。Gemma 3n 专为帮助塑造 Gemma 的开发者社区而设计。它得到了你喜爱的工具的支持,包括 Hugging Face Transformers、llama.cpp、Google AI Edge、Ollama、MLX 等,使你能够轻松地为特定设备端应用进行微调和部署。这篇文章是开发者的深度技术探讨:我们将探索 Gemma 3n 背后的一些创新,分享新的基准测试结果,并向你展示如何立即开始构建。
## Gemma 3n 有哪些新特性?
Gemma 3n 代表了设备端 AI 的重大进步,为边缘设备带来了强大的多模态能力,其性能以往只在去年的云端前沿模型中见过。
- **原生多模态:** Gemma 3n 原生支持图像、音频、视频和文本输入以及文本输出。
- **针对设备端优化:** 以高效为核心进行设计,Gemma 3n 模型提供两种基于**有效** (https://developers.googleblog.com/en/introducing-gemma-3n-developer-guide/) 参数的尺寸:E2B 和 E4B。虽然它们的原始参数量分别为 5B 和 8B,但架构创新使它们运行时内存占用与传统 2B 和 4B 模型相当,仅需低至 2GB(E2B)和 3GB(E4B)的内存。
- **突破性架构:** 在核心上,Gemma 3n 具有新颖的组件,例如用于计算灵活性的 MatFormer 架构、用于内存效率的每层嵌入(PLE)、用于架构效率的 LAuReL (https://arxiv.org/abs/2411.07501) 和 AltUp (https://arxiv.org/abs/2301.13310),以及针对设备端用例优化的新型音频和基于 MobileNet-V5 的视觉编码器。
- **更高质量:** Gemma 3n 在多语言(支持 140 种语言的文本理解和 35 种语言的多模态理解)、数学、编程和推理方面提供了质量改进。E4B 版本在 LMArena 得分超过 1300,使其成为首个在不到 100 亿参数规模下达到这一基准的模型。
LMArena 文本竞技场 Elo 得分排名:Gemini 1.5 Pro、Gemma 3n E4B、Llama 4 Maverick 17B 128E、GPT 4.1-nano 和 Phi-4
实现设备端性能的这一飞跃需要从头重新思考模型。基础就是 Gemma 3n 独特的移动端优先架构,而这一切都始于 MatFormer。
## MatFormer:一个模型,多种尺寸
Gemma 3n 的核心是 **MatFormer (https://arxiv.org/abs/2310.07707)**(**🪆 Matryoshka Transformer**)**架构**,这是一种为弹性推理构建的新型嵌套式 Transformer。可以把它想象成俄罗斯套娃:一个更大的模型包含了更小但功能完备的自身版本。这种方法将 Matryoshka 表示学习 (https://huggingface.co/papers/2205.13147) 的概念从仅嵌入扩展到所有 Transformer 组件。
Nano V3 中的 MatFormer
在 4B 有效参数(E4B)模型的 MatFormer 训练过程中,一个 2B 有效参数(E2B)子模型在其中同时得到优化,如上图所示。这为开发者提供了两种强大的能力和用例:
1. **预提取模型:** 你可以直接下载并使用主 E4B 模型以获得最高能力,或者使用我们已经为你提取的独立 E2B 子模型,它提供高达 2 倍的推理加速。
2. **通过 Mix-n-Match 实现自定义尺寸:** 为了更好地适应特定硬件限制,你可以使用我们称之为 Mix-n-Match 的方法,创建一系列介于 E2B 和 E4B 之间的自定义尺寸模型。该技术允许你精确地切片 E4B 模型的参数,主要通过调整每层前馈网络的隐藏维度(从 8192 到 16384)并选择性地跳过某些层。我们发布了 MatFormer Lab (https://goo.gle/gemma3n-matformer-lab),这是一个展示如何检索这些最优模型的工具,这些模型是通过在 MMLU 等基准上评估各种设置而确定的。
使用 Mix-n-Match 的自定义尺寸
不同模型尺寸(使用 Mix-n-Match)下预训练 Gemma 3n 检查点的 MMLU 得分
展望未来,MatFormer 架构也为 **弹性执行** 铺平了道路。虽然这不是今天发布实现的一部分,但该能力允许单个部署的 E4B 模型在运行时动态地在 E4B 和 E2B 推理路径之间切换,从而根据当前任务和设备负载实现性能和内存使用的实时优化。
## 每层嵌入(PLE):释放更多内存效率
Gemma 3n 模型采用了 **每层嵌入(Per-Layer Embeddings,PLE)**。这项创新专为设备端部署而设计,因为它显著提高了模型质量,而无需增加设备加速器(GPU/TPU)所需的高速内存占用。虽然 Gemma 3n E2B 和 E4B 模型的总参数量分别为 5B 和 8B,但 PLE 允许这些参数中的很大一部分(与每层相关联的嵌入)在 CPU 上高效加载和计算。这意味着只有核心 Transformer 权重(E2B 约为 2B,E4B 约为 4B)需要驻留在通常更受限的加速器内存(VRAM)中。
每层嵌入
借助每层嵌入,你可以在加速器中仅加载约 2B 参数的情况下使用 Gemma 3n E2B。
## KV 缓存共享:更快的长上下文处理
处理长输入(例如从音频和视频流中得到的序列)对于许多高级设备端多模态应用至关重要。Gemma 3n 引入了 KV 缓存共享,这是一项专门设计用于显著加速流式响应应用中首个令牌生成时间的特性。
KV 缓存共享优化了模型处理初始输入阶段(通常称为“预填充”阶段)的方式。来自局部和全局注意力的中间层的键和值被直接共享给所有顶层,相比 Gemma 3 4B,预填充性能提升了显著的 2 倍。这意味着模型能够比以前更快地吸收和理解长提示序列。
## 音频理解:引入语音转文本和翻译
Gemma 3n 使用基于通用语音模型(USM)(https://arxiv.org/abs/2303.01037) 的高级音频编码器。该编码器每 160 毫秒音频生成一个令牌(每秒约 6 个令牌),然后这些令牌作为输入集成到语言模型中,提供声音上下文的精细表示。这种集成的音频能力为设备端开发解锁了关键功能,包括:
- **自动语音识别(ASR):** 在设备上直接实现高质量的语音转文本转录。
- **自动语音翻译(AST):** 将口语语言翻译成另一种语言的文本。我们观察到在英语与西班牙语、法语、意大利语和葡萄牙语之间的翻译中,AST 结果特别强大,为针对这些语言应用的开发者提供了巨大潜力。
对于语音翻译等任务,利用链式思维提示可以显著增强结果。以下是一个示例:
``user 转录以下西班牙语音段,然后将其翻译成英语:model ``
纯文本 复制
在发布时,Gemma 3n 编码器被实现为处理长达 30 秒的音频片段。然而,这并非根本限制。底层音频编码器是一个流式编码器,通过额外长音频训练,能够处理任意长度的音频。后续实现将解锁低延迟、长流应用。
## MobileNet-V5:新的最先进视觉编码器
除了集成的音频能力外,Gemma 3n 还配备了一个新的、高效的视觉编码器 **MobileNet-V5-300M**,在边缘设备上的多模态任务中提供了最先进的性能。专为受限硬件上的灵活性和强大性能而设计,MobileNet-V5 为开发者提供了:
- **多种输入分辨率:** 原生支持 256x256、512x512 和 768x768 像素的分辨率,使你能够根据特定应用平衡性能和细节。
- **广泛的视觉理解:** 在广泛的多模态数据集上共同训练,擅长各种图像和视频理解任务。
- **高吞吐量:** 在 Google Pixel 上每秒处理高达 60 帧,实现实时、设备端视频分析和交互式体验。
这一性能水平是通过多项架构创新实现的,包括:
- 基于 MobileNet-V4 块(包括通用倒置瓶颈和 Mobile MQA)的高级基础。
- 显著扩展的架构,采用混合深度金字塔模型,其规模是最大 MobileNet-V4 变体的 10 倍。
- 新颖的多尺度融合 VLM 适配器,增强了令牌质量,提高了准确性和效率。
得益于新颖的架构设计和先进的蒸馏技术,MobileNet-V5-300M 大幅超越了 Gemma 3 中的基线 SoViT(使用 SigLip 训练,无蒸馏)。在 Google Pixel Edge TPU 上,它 **在量化情况下实现 13 倍加速(无量化时为 6.5 倍),所需参数减少 46%,内存占用减少 4 倍**,同时在视觉语言任务上提供了显著更高的准确性。
我们很高兴能分享更多关于该模型背后工作的内容。请关注我们即将发布的 MobileNet-V5 技术报告,其中将深入探讨模型架构、数据扩展策略和高级蒸馏技术。
## 第一天即可使用的生态系统
让 Gemma 3n 从发布第一天就易于访问一直是我们的优先事项。我们很自豪能与许多优秀的开源开发者合作,以确保在流行工具和平台上获得广泛支持,包括来自以下团队贡献:AMD、Axolotl、Docker (https://hub.docker.com/r/ai/gemma3n)、Hugging Face、llama.cpp、LMStudio、MLX、NVIDIA (https://developer.nvidia.com/blog/run-google-deepminds-gemma-3n-on-nvidia-jetson-and-rtx/)、Ollama、RedHat、SGLang、Unsloth 和 vLLM。
但这个生态系统仅仅是开始。这项技术的真正力量在于你将用它来构建什么。这就是为什么我们发布了 **Gemma 3n 影响力挑战赛** (https://www.kaggle.com/competitions/google-gemma-3n-hackathon)。你的使命:利用 Gemma 3n 独特的设备端、离线和多模态能力,为更美好的世界构建一款产品。总奖金 150,000 美元,我们期待看到一个引人入胜的视频故事和一个展示实际影响力的“惊叹”因素演示。
加入挑战赛 (https://www.kaggle.com/competitions/google-gemma-3n-hackathon),帮助我们构建更美好的未来。
## 立即开始使用 Gemma 3n
准备好探索今天 Gemma 3n 的潜力了吗?具体方法如下:
- **直接实验:** 使用 Google AI Studio (https://aistudio.google.com/prompts/new_chat?model=gemma-3n-e4b-it) 只需点击几下即可尝试 Gemma 3n。Gemma 模型也可以直接从 AI Studio 部署到 Cloud Run。
- **下载模型:** 在 Hugging Face (https://huggingface.co/collections/google/gemma-3n-685065323f5984ef315c93f4) 和 Kaggle (https://www.kaggle.com/models/google/gemma-3n) 上找到模型权重。
- **学习与集成:** 深入了解我们的 综合文档 (https://ai.google.dev/gemma/docs/gemma-3n),快速将 Gemma 集成到你的项目中,或从我们的推理和微调指南开始。
- **使用你喜爱的设备端 AI 工具进行构建:** Google AI Edge Gallery/LiteRT-LLM (https://github.com/google-ai-edge/gallery)、Ollama (https://ollama.com/library/gemma3n)、MLX (https://huggingface.co/collections/mlx-community/gemma-3n-685d6c8d02d7486c7e77a7dc)、llama.cpp (https://huggingface.co/collections/ggml-org/gemma-3n-685d6fc0843071be9e77b6f7)、Docker (https://hub.docker.com/r/ai/gemma3n)、transformers.js (https://huggingface.co/onnx-community/gemma-3n-E2B-it-ONNX) 等等。
- **使用你偏好的开发工具:** 利用你喜欢的工具和框架,包括 Hugging Face Transformers 和 TRL (https://huggingface.co/blog/gemma3n)、NVIDIA NeMo 框架 (https://github.com/NVIDIA-NeMo)、Unsloth (https://unsloth.ai/blog/gemma-3n) 和 LMStudio (https://lmstudio.ai/models/google/gemma-3n-e4b)。
- **以你的方式部署:** Gemma 3n 提供多种部署选项,包括 Google GenAI API (https://ai.google.dev/gemma/docs/core/gemma_on_gemini_api)、Vertex AI (https://console.cloud.google.com/vertex-ai/publishers/google/model-garden/gemma3n)、SGLang、vLLM 和 NVIDIA API 目录 (https://build.nvidia.com/google/gemma-3n-e4b-it)。
相似文章
Google DeepMind Blog
Google 推出 Gemma 3n 预览版,这是一个移动优先的开源 AI 模型,针对手机、平板电脑和笔记本电脑上的本地推理进行了优化。该模型采用与高通和联发科等硬件合作伙伴共同开发的新架构,利用分层嵌入等创新技术,在最少内存占用(2-3GB)的情况下实现快速性能,同时支持多模态功能。
Google DeepMind Blog
Google 推出了 Gemma 3,这是一套轻量级开源模型集合(1B、4B、12B、27B),设计用于在单个 GPU 或 TPU 上运行,支持 140+ 种语言、128k 上下文窗口和多模态功能。这些模型在保持高效性能的同时,性能超越了 Llama 3 和 DeepSeek-V3 等更大的竞品,适合边缘设备部署。
Hugging Face Blog
Google DeepMind 发布 Gemma 4,这是一系列前沿多模态模型,已在 Hugging Face 上以 Apache 2 协议开源,针对端侧部署进行了优化,并支持多种推理框架。
Google DeepMind Blog
Google 推出 Gemma 3 270M,这是一个拥有 2.7 亿参数的紧凑型模型,专为高效边缘设备 AI 设计,具有强大的指令遵循能力和极致的能效表现(在 Pixel 9 Pro 上进行 25 次对话仅消耗 0.75% 电量)。
Hugging Face Models Trending
Google DeepMind 发布了 Gemma 4 E4B 指令微调助手模型,该模型具备多模态能力、推理改进以及针对低延迟端侧应用优化的投机解码功能。