Gemma 4 技术报告
摘要
Gemma 4 引入了新一代开放权重、原生多模态语言模型,采用密集和混合专家架构,具备思考模式以进行高级推理,提高了效率并支持长上下文能力。
arXiv:2607.02770v1 公告类型:新
摘要:我们介绍了 Gemma 4,这是 Gemma 模型家族中新一代开放权重、原生多模态语言模型。旨在提升计算效率和推理能力,Gemma 4 模型套件采用密集和混合专家架构,参数量从 2.3B 到 31B 不等。除了为所有模型尺寸改进视觉和音频编码器外,我们还为 12B 模型提出了一种统一的、无编码器的架构,可直接处理原始音频和图像块。此外,我们整合了思考模式,使 Gemma 模型能够在响应之前生成推理痕迹。通过关键设计选择,我们提升了推理速度、内存和计算效率,以及长上下文能力。Gemma 4 在 STEM、多模态和长上下文基准测试中实现了性能飞跃,并在人类评估任务中与更大的前沿开放模型相媲美。
查看缓存全文
缓存时间: 2026/07/07 04:36
# Gemma 4 技术报告 来源:https://arxiv.org/html/2607.02770 \\authfootnotetext 1 完整作者列表请参见“贡献与致谢”部分。请将通信发送至 [email protected]。 ###### 摘要 我们推出 Gemma 4,这是 Gemma 模型家族中新一代具有开放权重、原生多模态能力的语言模型。Gemma 4 模型系列旨在提升计算效率和推理能力,包含密集型和混合专家(MoE)架构,参数规模从 2.3B 到 31B。除了为所有模型尺寸改进的视觉和音频编码器外,我们还为 12B 模型提出了一种统一的、无编码器的架构,该架构直接处理原始音频和图像块。此外,我们集成了一种思考模式,使 Gemma 模型能够在响应之前生成推理轨迹。通过关键的设计选择,我们提升了推理速度、内存和计算效率,以及长上下文能力。Gemma 4 在 STEM、多模态和长上下文基准测试中取得了飞跃性的性能提升,并在人类评分的任务中与更大规模的、前沿的开源模型相抗衡。 ## 1 引言 大型语言模型的快速发展推动了对具备强大多模态理解、推理能力和计算效率的开放权重模型的需求。在其前代产品(Gemma Team, [2024a, b, 2025a])的基础上,我们推出 Gemma 4,这是迄今为止 Gemma 模型家族中能力最强、效率最高的一代。Gemma 4 提供原生多模态架构,能够无缝处理文本、图像和音频,同时在高度复杂的推理任务上达到前沿水平。 Gemma 4 家族专为服务多种端侧硬件而构建。该模型系列包括密集型架构(参数规模 2.3B、4.5B、12B 和 31B)以及一个混合专家(Jacobs et al., [1991], MoE)变体,其激活参数为 3.8B,总参数为 26B。我们引入了多项架构和方法创新: - •思考模式,实现高级推理: 我们为 Gemma 4 模型引入了思考模式(OpenAI, [2024])。通过在响应之前输出推理轨迹,模型在数学和编码等推理密集型领域展现出更强的能力。 - •长上下文效率: 扩展上下文会导致 KV 缓存出现内存爆炸。我们保持了 5:1 的局部滑动窗口与全局自注意力比例(2.3B 模型为 4:1),并使用 pp-RoPE(Barbero et al., [2025])作为位置编码。结合 KV 缓存共享(Shazeer, [2019])以及在全局层中重用键作为值(Kayyam et al., [2026]),这些优化将全局 KV 缓存空间减少了高达 37.5%。 - •计算效率: 我们发布了一个自回归多 token 预测(MTP)起草器头(Li et al., [2024]),专为推测性解码(Leviathan et al., [2023])设计,以提升模型的解码速度。 - •内存效率: 我们提供了模型的量化版本,这些版本使用量化感知训练(Jacob et al., [2018], QAT)进行训练,以在最小化质量影响的前提下减少参数内存占用和延迟。 - •无编码器架构: Gemma 4 模型具有冻结的视觉和音频编码器。我们为 12B 模型引入了一种统一的无编码器架构,该架构将原始的 40ms 音频块和图像块投影到 LLM 嵌入空间,从而消除对独立编码器的需求并减少内存碎片化。 在这份技术报告中,我们概述了不同模型尺寸下的模型架构,以及 Gemma 4 的预训练和后训练配方。通过全面的基准测试和人类评估(如 Arena, Chiang et al., [2024]),我们证明 Gemma 4 在文本、图像和音频模态上的表现可与更大规模的前沿开源模型相媲美。我们以 Apache 2.0 许可证发布 Gemma 4 模型,赋能全球的开发者与研究人员基于这些能力进行构建、定制和扩展。 模型 | 音频编码器 | 视觉编码器 | 嵌入器 | 直和 (Einsums) | 起草器 (Drafter) -----|-----------|-----------|--------|----------------|-------------- E2B | 305M | 150M | 400M + 2,340M | 1,870M | 76M E4B | 305M | 150M | 670M + 2,820M | 3,940M | 77M 12B | - | - | 1,000M | 10,890M | 400M 26B-A4B* | - | 550M | 740M | 24,500M / 2,800M (激活) | 430M 31B | - | 550M | 1,410M | 29,290M | 500M 表 1:Gemma 4 模型的参数数量。我们使用的词汇表有 262k 个条目。标有星号的模型是一个 MoE,由其激活参数数量定义。注意,E2B 和 E4B 中的额外嵌入器参数是每层嵌入。 ## 2 模型架构 Gemma 4 模型遵循仅解码器 Transformer 架构(Vaswani et al., [2017])。我们的模型具有使用 RMSNorm(Zhang and Sennrich, [2019])的预归一化和后归一化,以及 QKNorm(Henry et al., [2020])。 密集型和 MoE:Gemma 4 模型系列包含密集型架构,有效参数为 2.3B(E2B)、有效 4.5B(E4B)、12B 和 31B,以及一个 MoE 模型,激活参数为 3.8B,总参数为 26B(26B-A4B)。E2B 和 E4B 使用如 Gemma 3n(Gemma Team, [2025b])中的每层嵌入,使其在 5B 和 8B 总参数中分别有效为 2.3B 和 4.5B。 分片 | TPU | #芯片 | 数据 | 序列 | 副本 ----|-----|-------|------|------|------ E2B | v6e | 4,096 | 16 | 8 | 32 E4B | v6e | 6,144 | 16 | 16 | 24 12B | v5p | 12,288 | 16 | 16 | 48 26B-A4B* | v6e | 6,144 | 16 | 16 | 24 31B | v6e | 10,240 | 16 | 16 | 40 表 2:预训练基础设施,通过数据、序列和副本进行分片。 长上下文效率:我们的局部到全局注意力比例模式遵循 Gemma Team [2025a],即 E2B 为 4 比 1 的局部注意力块,其余模型为 5 比 1。我们通过在全局注意力层中重用键作为值(E2B 和 E4B 除外)来提升内存效率,即 values=keys。我们使用 pp-RoPE(p=0.25)对全局注意力层进行位置编码,并在局部注意力层使用 RoPE,从而有效将全局 KV 缓存减少 37.5%。RoPE 频率在全局和局部注意力层分别设置为 1M 和 10k。最后,对于 E2B 和 E4B 模型,我们分别以 20/35 和 18/42 的比例共享 KV 缓存。 ### 2.1 视觉模态 E2B 和 E4B Gemma 模型配备 150M 视觉编码器,而更大的模型使用 550M 编码器(统一 12B 除外)。两者都是 Vision Transformers(Dosovitskiy et al., [2021], ViT),补丁大小为 16,其架构差异详见附录中的表 10。我们的视觉编码器支持可变宽高比(见图 2 和算法 1),并结合了轴向 2D-RoPE(Heo et al., [2024])和非因果注意力以及 2D 绝对位置嵌入。我们将最大 token 数量 N_max 限制为 70、140、280、560 和 1120(实现细节见算法 1)。 ### 2.2 音频模态 E2B 和 E4B Gemma 模型使用 305M 音频编码器,该编码器以 40ms 为块处理音频,输入为梅尔滤波器组特征。编码器架构基于 Universal Speech Model(Zhang et al., [2023], USM),由两个下采样卷积层和十二个 Conformer 层(Gulati et al., [2020])组成。虽然架构与 Gemma 3n 类似,但我们将参数数量减少了 55%(从 680M 降至 305M)。我们不使用向量量化;LLM 直接接收音频编码器产生的连续表示。与视觉编码器一样,我们在预训练期间保持权重冻结。 ### 2.3 无编码器架构 Gemma 4 12B 基于一种新的、统一的无编码器模型范式从头训练,用轻量级投影模块替换了独立的视觉和音频编码器。对于视觉模态,Gemma 4 12B 接收 48×48×3 RGB 补丁,但将 550M 视觉编码器替换为单个大型 matmul(35M 参数)。通过在补丁表示进入最终 LayerNorm 层(Ba et al., [2016])之前添加基于 2D 坐标的位置嵌入来保持空间感知。对于音频,完全舍弃了 305M 基于 USM 的 Conformer 编码器。原始音频在 16kHz 下被分割成 40ms 块,每个块产生 640 维向量。这些向量被直接投影到 LLM 嵌入空间。由于音频是时间序列,因此不需要额外位置编码。 模型 | bf16 | 量化 | KV 缓存 ----|-----|------|--------- E2B | 4.60 | 0.8† | +0.05 E4B | 9.0 | 2.3† | +0.14 12B | 24.0 | 7.65‡ | +0.28 26B-A4B* | 52.0 / 7.6 | 16.2/2.8‡ | +0.28 31B | 64.0 | 19.2‡ | +1.10 表 3:仅文本,原始检查点与量化检查点在权重和 int8 KV 缓存(+KV)在 32k 上下文大小下的吉字节内存占用比较。† 是移动端量化,‡ 是 Q4_0。 ### 2.4 预训练 我们遵循与 Gemma 3 类似的预训练方式。 训练数据。我们的预训练数据集是一个大规模、多样化的数据集,涵盖广泛的领域和模态,包括网页文档、代码、图像和音频(适用于 E2B、E4B 和 12B),截止日期为 2025 年 1 月。请参阅图 1 的说明。 图 1:自回归 MTP 起草器(右侧蓝色块)接收来自主模型(灰色块)的激活和 KV 缓存。 分词器。我们使用与 Gemini Team [2025] 相同的分词器,即 SentencePiece 分词器(Kudo and Richardson, [2018]),具有拆分数字、保留空白和字节级编码。词汇表有 262k 个条目。 过滤。我们对数据进行过滤,以去除基准测试中的污染,并降低产生不希望或不安全语句以及复述的风险。 排名 | 模型 | Elo | 95% CI | 开放类型 | #参数/#激活 -----|------|-----|--------|----------|--------------- 1 | Claude Fable 5 | 1508 | ±9 | 否 | - / - ... | ... | ... | ... | ... | ... 15 | GLM 5.1 | 1475 | ±6 | 是 | MoE 744B / 40B 25 | GLM 5.2 (Max) | 1471 | ±10 | 是 | MoE 744B / 40B 29 | MiMo V2.5 Pro | 1466 | ±5 | 是 | MoE 1T / 42B 34 | Kimi K2.6 | 1460 | ±5 | 是 | MoE 1T / 32B 36 | DeepSeek V4 Pro Thinking | 1458 | ±5 | 是 | MoE 1.6T / 49B 37 | GLM 5 | 1457 | ±5 | 是 | MoE 744B / 40B 38 | DeepSeek V4 Pro | 1456 | ±5 | 是 | MoE 1.6T / 49B 43 | Gemma 4 31B | 1451 | ±8 | 是 | Dense 31B 44 | Kimi K2.5 Thinking | 1450 | ±4 | 是 | MoE 1T / 32B 57 | Qwen 3.5 397B-A17B | 1444 | ±4 | 是 | MoE 397B / 17B 61 | Gemma 4 26B-A4B | 1438 | ±8 | 是 | MoE 26B / 4B 63 | DeepSeek V4 Flash Thinking | 1436 | ±5 | 是 | MoE 284B / 13B ... | ... | ... | ... | ... | ... 157 | Gemma 3 27B | 1366 | ±4 | 是 | Dense 27B 表 4:Arena Text(Chiang et al., [2024],截至 2026 年 6 月 19 日)上领先的开放权重模型。模型通过人类评估者的盲侧对侧评估进行评分,并基于 Elo 评分系统分配分数。顶级闭源模型(灰色)为比例参考。Gemma 模型可与规模大得多的模型抗衡,而 Gemma 4 31B 是该排行榜上领先的密集型开放模型。 ### 2.5 量化感知训练 我们随原始检查点一起提供不同格式的量化模型和编码器。基于最流行的开源量化推理引擎(如 llama.cpp)以及高效的硬件支持,我们专注于两组权重表示: - •移动端量化:每通道低位宽权重(int2 和 int4 混合)和激活量化(int8)。 - •Q4_0 量化:分块量化,通常称为 Q4_0。 在表 3 中,我们报告了在 32k token 序列下,原始模型和量化模型在有无 KV 缓存情况下的内存占用。此外,为了支持 fp16 下的稳定推理,我们在每个块引入了一个标量尺度,以限制激活范围使其适合 fp16。 Gemma 4 | | | | | | Gemma 3 --------|-------|-------|-------|-------|-------|------- 基准测试 | 31B | 26B-A4B | 12B | E4B | E2B | 27B 非思考模式 | | | | | | MMLU Pro | 85.2 | 82.6 | 77.2 | 69.4 | 60.0 | 67.6 AIME 2026 (无工具) | 89.2 | 88.3 | 77.5 | 42.5 | 37.5 | 20.8 LiveCodeBench v6 | 80.0 | 77.1 | 72.0 | 52.0 | 44.0 | 29.1 Codeforces Elo | 2150 | 1718 | 1659 | 940 | 633 | 110 SciCode | 43.0 | 40.0 | 38.0 | 24.0 | 21.0 | 21.0 GPQA Diamond | 84.3 | 82.3 | 78.8 | 58.6 | 43.4 | 42.4 Big Bench Extra Hard (微平均) | 74.4 | 64.8 | 53.0 | 33.1 | 21.9 | 19.3 HLE | 19.5 | 8.7 | 5.2 | - | - | - HLE 带搜索 | 26.5 | 17.2 | - | - | - | - IFBench | 76.0 | 72.0 | 74.0 | 44.0 | 38.0 | 32.0 IFEval | 98.9 | 98.5 | 97.2 | 96.7 | 94.6 | 90.4 MMMLU | 88.4 | 86.3 | 83.4 | 76.6 | 67.4 | 70.4 MRCR v2-8-needle, 128k | 66.4 | 44.1 | 43.4 | 25.4 | 19.1 | 13.5 Terminal Bench Hard | 36.0 | 14.0 | 18.0 | 8.0 | 3.0 | 4.0 Tau2 – 航空 | 75.0 | 76.0 | 75.0 | 52.0 | 31.0 | 39.0 Tau2 – 零售 | 86.4 | 85.5 | 77.6 | 67.1 | 34.6 | 6.6 Tau2 – 电信 | 69.3 | 43.0 | 54.4 | 18.4 | 19.7 | 3.1 表 5:Gemma 3 27B 与 Gemma 4 模型在不同基准测试上的性能比较。除非另有说明,所有模型均处于思考模式。 我们还将 QAT 应用于图像和音频编码器。在 150M 图像编码器上,将激活和权重量化到 8 位精度(W8A8)使得总前向传播内存占用减少了 2 倍(从 400 MB 降至 200 MB,包括端侧编译开销),并且在较新硬件上,相对于 Gemma 3n 的端侧延迟降低了 44%。在音频编码器上,我们进一步将激活精度降至 8 位,权重精度降至 {2,4,8} 位,因层级簇而异。总体而言,我们将磁盘占用减少了 78%,从 Gemma 3n 的 390 MB 降至本版本的 87 MB。 ### 2.6 多 Token 预测起草器 我们为模型训练了一个小型自回归 MTP 起草器头,用于推测性解码。在我们的 MTP 过程中,前一时刻模型的最后一层激活和 token 嵌入被馈送到 MTP 头。MTP 头使用一个独立的嵌入器和一个 4 层 Transformer 块顺序生成未来的 token,该块与主模型的 KV 进行交叉注意力(图 1),从而消除了 MTP 预填充的需要,并支持任意草稿长度。对于 E2B 和 E4B,Transformer 块的模型维度为 256,对于 26B-A4B 和 31B 为 1024,包含三个局部注意力和一个全局注意力层。 #### 高效 MTP 解码。 对于 E2B 和 E4B 起草器,我们通过将投影操作替换为对 token 簇的 top-k 操作,来减少解码开销。因此,最终矩阵乘法从 d × 262,000 减少到 d × 4096,同时保持相似的接受率。 ### 2.7 计算基础设施 我们使用 TPUv5p 和 TPUv6e 训练模型,详见表 2。每种模型配置都经过优化,以最小化训练步骤时间。对于较大的模型,我们利用 Slice-Granularity Elasticity(Gemini Team, [2025]),该技术允许在发生局部故障时使用更少的 TPU 芯片“分片”继续训练。这种重新配置将因中断造成的延迟从几分钟减少到几秒。优化器状态使用 ZeRO-3(Ren et al., [2021])的实现进行分片。对于多 Pod 训练,我们执行数据副本......
相似文章
Gemma 4 技术报告
Gemma 4 技术报告介绍了新一代开放权重、原生多模态语言模型,采用多样化的架构,推理能力增强,并在各项任务中性能提升。模型参数范围从 2.3B 到 31B,并具备生成推理轨迹的思考模式。
google/gemma-4-31B-it-assistant
Google DeepMind 发布了 Gemma 4,这是一个开源权重的多模态模型家族,支持文本、图像、视频和音频,具备增强的推理和编码能力,并通过多令牌预测(MTP)实现高达 2 倍的解码速度提升。
google/gemma-4-26B-A4B-it
Google DeepMind 发布 Gemma 4,一系列开放权重的多模态模型,参数量从2.3B到31B,支持文本、图像、视频和音频输入。模型具有256K上下文窗口,MoE和密集架构,增强的推理能力,并针对从移动设备到服务器的部署进行优化。
推出 Gemma 4 12B:一个统一的、无编码器的多模态模型
Google DeepMind 宣布推出 Gemma 4 12B,一种新颖的无编码器多模态 AI 模型,将视觉和音频直接集成到 LLM 主干中,在配备 16GB RAM 的笔记本电脑上提供高级推理和代理能力,以 Apache 2.0 许可证发布。
Gemma 4:同等参数规模下能力最强的开源模型
Google DeepMind 发布 Gemma 4,这是其迄今为止能力最强的开源模型系列,专为高级推理和智能体工作流设计,在多种参数规模下均实现了极高的智能密度。