Gemma 4:同等参数规模下能力最强的开源模型
摘要
Google DeepMind 发布 Gemma 4,这是其迄今为止能力最强的开源模型系列,专为高级推理和智能体工作流设计,在多种参数规模下均实现了极高的智能密度。
Gemma 4:我们迄今为止最智能的开源模型,专为高级推理和智能体工作流而打造。
查看缓存全文
缓存时间: 2026/05/08 09:09
# Gemma 4:逐字节计算,最强的开放模型
来源:https://blog.google/innovation-and-ai/technology/developers-tools/gemma-4/
Olivier Lacombe
产品管理总监,Google DeepMind
Gemma 4
您的浏览器不支持音频播放。
收听文章
此内容由 Google AI 生成。生成式 AI 为实验性功能。
[[duration]] 分钟
今天,我们正式推出 [Gemma 4](https://aistudio.google.com/prompts/new_chat?model=gemma-4-31b-it)——这是我们迄今为止最智能的开放模型。Gemma 4 专为高级推理和智能体(Agentic)工作流而打造,实现了前所未有的"单位参数智能密度"。这一突破建立在社区惊人的发展势头之上:自第一代发布以来,开发者下载 Gemma 的次数已超过 4 亿次,构建了一个拥有超过 10 万个变体的活跃 [Gemmaverse](https://deepmind.google/models/gemma/gemmaverse/)。我们认真倾听了创新者对于突破 AI 边界的需求,而 Gemma 4 就是我们的答案:以 [Apache 2.0 许可证](https://goo.gle/gemma-4-apache-2) 广泛提供的突破性能力。
截至 4 月 1 日 Arena.ai 聊天竞技场中开放模型的性能与规模对比。
Arena.ai 聊天竞技场中开放模型的性能与规模对比
Gemma 4 基于与 Gemini 3 同等水平的世界级研究和技术构建,是你可以在本地硬件上运行的最强模型家族。它们与我们的 Gemini 模型形成互补,为开发者提供业界最强大的开放与专有工具组合。
## 行业领先的能力与移动优先的 AI
我们发布了四种尺寸的 Gemma 4 模型:[Effective 2B (E2B)](https://huggingface.co/gg-hf-gg/gemma-4-E2B-it)、[Effective 4B (E4B)](https://huggingface.co/gg-hf-gg/gemma-4-E4B-it)、[26B 混合专家模型 (MoE)](https://huggingface.co/gg-hf-gg/gemma-4-26B-A4B-it) 和 [31B 稠密模型](https://huggingface.co/gg-hf-gg/gemma-4-31B-it)。整个家族不再局限于简单对话,而是能够处理复杂逻辑和智能体工作流。我们的大型模型在其尺寸级别上实现了最先进的性能,其中 31B 模型目前在业界标准的 [Arena AI 文本排行榜](https://arena.ai/leaderboard/text?license=open-source) 上位居全球开放模型第 3 名,26B 模型则位列第 6 名。在该榜单上,Gemma 4 的性能超越了比它大 20 倍的模型。对于开发者而言,这种全新的"单位参数智能密度"意味着用显著更少的硬件开销即可获得前沿级能力。
在边缘端,我们的 E2B 和 E4B 模型重新定义了设备端实用性,优先考虑多模态能力、低延迟处理和无缝生态系统集成,而非单纯的参数规模。
## 强大、易获取、开放
为了驱动下一代开创性研究和产品,我们对 Gemma 4 模型的尺寸进行了专门设计,使其能够高效运行和微调——从全球数十亿台 Android 设备,到笔记本 GPU,再到开发者工作站和加速器。
通过使用这些高度优化的模型,你可以对 Gemma 4 进行微调,在你的特定任务上实现最先进的性能。我们已经看到了这种方法带来的惊人成果;例如,INSAIT 打造了开创性的保加利亚语优先语言模型 [BgGPT](https://deepmind.google/models/gemma/gemmaverse/insait/),我们还与耶鲁大学合作开展 [Cell2Sentence-Scale](https://blog.google/innovation-and-ai/products/google-gemma-ai-cancer-therapy-discovery/) 项目以发现癌症治疗的新途径,这样的例子还有很多。
以下是 Gemma 4 成为我们最强大开放模型家族的原因:
- **高级推理:**具备多步规划和深度逻辑能力,Gemma 4 在数学和要求严格指令遵循的基准测试中表现出显著提升。
- **智能体工作流:**原生支持函数调用、结构化 JSON 输出和原生系统指令,使你能够构建可与不同工具和 API 交互并可靠执行工作流的自主智能体。
- **代码生成:**Gemma 4 支持高质量的离线代码生成,将你的工作站转变为本地优先的 AI 代码助手。
- **视觉与音频:**所有模型均可原生处理视频和图像,支持可变分辨率,在 OCR 和图表理解等视觉任务上表现出色。此外,E2B 和 E4B 模型还支持原生音频输入,用于语音识别和理解。
- **更长上下文:**无缝处理长文本内容。边缘模型具备 128K 上下文窗口,而大型模型提供高达 256K 的上下文窗口,让你可以在单个提示中传入整个代码库或长文档。
- **140+ 种语言:**原生训练于超过 140 种语言,Gemma 4 帮助开发者构建面向全球用户的高性能包容性应用。
## 适配多样化硬件的多功能模型
我们发布了针对特定硬件和使用场景量身定制的 Gemma 4 模型权重,确保你在任何需要的地方都能获得前沿级推理能力:
### 26B 和 31B 模型:前沿智能,离线运行于你的个人电脑
优化为在可获取硬件上为研究者和开发者提供最先进的推理能力,我们的未量化 bfloat16 权重可高效适配单张 80GB NVIDIA H100 GPU。对于本地部署,量化版本可在消费级 GPU 上原生运行,为你的 IDE、代码助手和智能体工作流提供动力。我们的 26B 混合专家模型(MoE)专注于延迟优化,推理时仅激活总计 3.8B 参数,实现极快的每秒生成 token 数;而 31B 稠密模型则最大化原始质量,为微调提供强大的基础。
这些模型针对大量不同的数据集和指标进行了评估,以覆盖文本生成的各个方面。更多基准测试请参见我们的[模型卡](https://ai.google.dev/gemma/docs/core/model_card_4)。
Gemma 4 表格
### E2B 和 E4B 模型:为移动和物联网设备带来全新智能水平
从头开始设计,追求极致的计算和内存效率,这些模型在推理时分别激活 20 亿和 40 亿的有效参数规模,以节省 RAM 和电池寿命。通过与 Google Pixel 团队以及 Qualcomm Technologies 和 MediaTek 等移动硬件领导者的紧密合作,这些多模态模型可在手机、Raspberry Pi 和 NVIDIA Jetson Orin Nano 等边缘设备上完全离线运行,实现近乎零延迟。Android 开发者现在就可以在 [AICore 开发者预览版](https://android-developers.googleblog.com/2026/03/AI-Core-Developer-Preview) 中 prototyp 智能体流程,以实现与 Gemini Nano 4 的前向兼容。
## 开源许可证
你们给了我们反馈,我们认真听取了。构建 AI 的未来需要协作的方式,我们相信要赋能开发者生态,不设限制性障碍。因此,Gemma 4 以商业友好的 [Apache 2.0 许可证](https://goo.gle/gemma-4-apache-2) 发布。
这一开源许可证为完全的开发者灵活性和数字主权奠定了基础;授予你对数据、基础设施和模型的完全控制权。它让你可以自由构建,并在任何环境中安全部署,无论是本地还是云端。
## 建立在信任与安全的基础之上
这些模型经历了与我们的专有模型同样严格的基础设施安全协议。选择 Gemma 4,企业和主权组织可以获得一个可信、透明的基座,在提供最先进能力的同时,满足最高的安全性和可靠性标准。
## 丰富的生态选择
- **秒级开始实验:**立即获取 Gemma 4 并开始构建。在 [Google AI Studio](https://aistudio.google.com/prompts/new_chat?model=gemma-4-31b-it)(31B 和 26B MoE)或 [Google AI Edge Gallery](https://developers.googleblog.com/bring-state-of-the-art-agentic-skills-to-the-edge-with-gemma-4/)(E4B 和 E2B)中探索 Gemma 4。对于 [Android 开发](http://android-developers.googleblog.com/2026/03/gemma-4-new-standard-for-local-agentic-intelligence.html),可用它在 [Android Studio](http://android-developers.googleblog.com/2026/04/android-studio-supports-gemma-4-local.html) 中驱动 Agent Mode,并使用 [ML Kit GenAI Prompt API](https://android-developers.googleblog.com/2026/03/AI-Core-Developer-Preview) 开始为 Android 构建生产级应用。
- **使用你喜欢的工具:**首发即支持 [Hugging Face](https://huggingface.co/blog/gemma4)(Transformers、TRL、Transformers.js、Candle)、[LiteRT-LM](https://ai.google.dev/edge/litert-lm/overview)、vLLM、llama.cpp、[MLX](https://huggingface.co/collections/mlx-community/gemma-4)、[Ollama](https://ollama.com/library/gemma4)、[NVIDIA NIM](https://build.nvidia.com/google/gemma-4-31b-it) 和 [NeMo](https://github.com/NVIDIA-NeMo/Automodel/tree/main/docs/guides/vlm/gemma4.md)、[LM Studio](https://lmstudio.ai/models/gemma-4)、[Unsloth](https://unsloth.ai/docs/models/gemma-4)、SGLang、[Cactus](https://docs.cactuscompute.com/latest/blog/gemma4/)、[Baseten](https://www.baseten.co/library/publisher/gemma/)、[Docker](https://hub.docker.com/r/ai/gemma4)、MaxText、Tunix、Keras,你可以灵活选择最适合项目的工具。
- **下载模型:**从 [Hugging Face](https://huggingface.co/collections/google/gemma-4)、[Kaggle](https://www.kaggle.com/models/google/gemma-4) 或 [Ollama](https://ollama.com/library/gemma4) 获取模型权重。
- **根据特定需求定制 Gemma 4:**使用你喜欢的平台进行训练和适配,如 Google Colab、[Vertex AI](https://console.cloud.google.com/vertex-ai/publishers/google/model-garden/gemma4),甚至你的游戏 GPU。
- **在 Google Cloud 上规模化生产:**虽然本地设备端推理非常适合离线使用,但 Google Cloud 消除了所有计算上限。通过 Vertex AI、[Cloud Run](https://codelabs.developers.google.com/codelabs/cloud-run/cloud-run-gpu-rtx-pro-6000-gemma4-vllm)、[GKE](https://docs.cloud.google.com/kubernetes-engine/docs/tutorials/serve-gemma-gpu-vllm)、主权云、TPU 加速推理以及针对受监管工作负载的最高合规保障来部署你的方案。了解更多关于在 Google Cloud 上起步的信息,请点击[此处](https://cloud.google.com/blog/products/ai-machine-learning/gemma-4-available-on-google-cloud)。
- **跨多个硬件平台加速 AI 开发:**Gemma 4 开箱即针对业界领先硬件进行了优化。在 NVIDIA AI 基础设施上体验极致性能,从 NVIDIA Jetson Orin Nano 到 Blackwell GPU;通过开源 ROCm™ 栈与 AMD GPU 集成;或在 Trillium 和 Ironwood TPU 上部署,实现大规模高效能。
- **为影响力而竞争:**加入 Kaggle 上的 [Gemma 4 Good Challenge](https://www.kaggle.com/competitions/gemma-4-good-hackathon),构建为世界带来有意义积极改变的产品。
相似文章
google/gemma-4-26B-A4B-it
Google DeepMind 发布 Gemma 4,一系列开放权重的多模态模型,参数量从2.3B到31B,支持文本、图像、视频和音频输入。模型具有256K上下文窗口,MoE和密集架构,增强的推理能力,并针对从移动设备到服务器的部署进行优化。
google/gemma-4-31B-it-assistant
Google DeepMind 发布了 Gemma 4,这是一个开源权重的多模态模型家族,支持文本、图像、视频和音频,具备增强的推理和编码能力,并通过多令牌预测(MTP)实现高达 2 倍的解码速度提升。
google/gemma-4-E4B-it-assistant
Google DeepMind 发布了 Gemma 4 E4B 指令微调助手模型,该模型具备多模态能力、推理改进以及针对低延迟端侧应用优化的投机解码功能。
Gemma 4 发布:前沿多模态智能,端侧可用
Google DeepMind 发布 Gemma 4,这是一系列前沿多模态模型,已在 Hugging Face 上以 Apache 2 协议开源,针对端侧部署进行了优化,并支持多种推理框架。
@aiDotEngineer:DeepMind 开源模型家族 Gemma https://youtube.com/watch?v=_gVFUEdhCyI… 在 Gemma 4 发布后首次公开演讲中…
Google DeepMind 的 Gemma 系列开源模型下载量已突破 5 亿次,被誉为“单位比特能力最高”的开源大语言模型。