Gemma 4 技术报告

Hugging Face Daily Papers 论文

摘要

Gemma 4 技术报告介绍了新一代开放权重、原生多模态语言模型,采用多样化的架构,推理能力增强,并在各项任务中性能提升。模型参数范围从 2.3B 到 31B,并具备生成推理轨迹的思考模式。

我们推出 Gemma 4,这是 Gemma 模型家族中新一代开放权重、原生多模态语言模型。为提升计算效率和推理能力,Gemma 4 模型套件包含密集和混合专家架构,参数范围从 2.3B 到 31B。除了为所有模型尺寸改进视觉和音频编码器外,我们还为 12B 模型提出了一种统一的、无编码器架构,该架构可接收原始音频和图像块。此外,我们集成了思考模式,使 Gemma 模型能够在响应前生成推理轨迹。我们通过关键设计选择提升了推理速度、内存和计算效率,以及长上下文能力。Gemma 4 在 STEM、多模态和长上下文基准测试中实现了性能飞跃,并在人工评估任务中与更大规模的前沿开放模型相媲美。
查看原文
查看缓存全文

缓存时间: 2026/07/09 07:55

论文页面 - Gemma 4 技术报告

来源: https://huggingface.co/papers/2607.02770 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

Gemma 4 引入了高效的多模态语言模型,具有多样化的架构、增强的推理能力,并提升了在各类任务上的表现。

我们推出 Gemma 4,这是 Gemma 模型家族中新一代开放权重、原生多模态的语言模型。Gemma 4 模型系列旨在提升计算效率和推理能力,包含稠密模型和混合专家架构,参数规模从 2.3B 到 31B 不等。除了针对所有模型尺寸改进的视觉和音频编码器外,我们还为 12B 模型提出了一种统一的无编码器架构,可直接处理原始音频和图像块。此外,我们集成了思考模式,使 Gemma 模型能够在响应之前生成推理轨迹。我们通过关键的设计选择,提升了推理速度、内存和计算效率,以及长上下文能力。Gemma 4 在 STEM、多模态和长上下文基准测试中实现了性能飞跃,并在人工评分的任务上超越了更大的前沿开放模型。

查看 arXiv 页面 查看 PDF 添加到收藏

在你的智能体中获取这篇论文:

hf papers read 2607\.02770

没有最新的 CLI? curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本篇论文的模型 0

暂无模型链接本篇论文

请在模型 README.md 中引用 arxiv.org/abs/2607.02770 以从此页面链接。

引用本篇论文的数据集 0

暂无数据集链接本篇论文

请在数据集 README.md 中引用 arxiv.org/abs/2607.02770 以从此页面链接。

引用本篇论文的 Space 0

暂无 Space 链接本篇论文

请在 Space README.md 中引用 arxiv.org/abs/2607.02770 以从此页面链接。

包含本篇论文的收藏 2

相似文章

Gemma 4 技术报告

arXiv cs.CL

Gemma 4 引入了新一代开放权重、原生多模态语言模型,采用密集和混合专家架构,具备思考模式以进行高级推理,提高了效率并支持长上下文能力。

google/gemma-4-26B-A4B-it

Hugging Face Models Trending

Google DeepMind 发布 Gemma 4,一系列开放权重的多模态模型,参数量从2.3B到31B,支持文本、图像、视频和音频输入。模型具有256K上下文窗口,MoE和密集架构,增强的推理能力,并针对从移动设备到服务器的部署进行优化。

google/gemma-4-31B-it-assistant

Hugging Face Models Trending

Google DeepMind 发布了 Gemma 4,这是一个开源权重的多模态模型家族,支持文本、图像、视频和音频,具备增强的推理和编码能力,并通过多令牌预测(MTP)实现高达 2 倍的解码速度提升。