google/gemma-4-26B-A4B-it

Hugging Face Models Trending 模型

摘要

Google DeepMind 发布 Gemma 4,一系列开放权重的多模态模型,参数量从2.3B到31B,支持文本、图像、视频和音频输入。模型具有256K上下文窗口,MoE和密集架构,增强的推理能力,并针对从移动设备到服务器的部署进行优化。

任务:图像-文本-文本 标签:transformers, safetensors, gemma4, 图像-文本-文本, 对话式, 许可证:apache-2.0, 评估结果, 端点兼容, 部署:azure, 区域:us
查看原文
查看缓存全文

缓存时间: 2026/04/20 14:45

google/gemma-4-26B-A4B-it · Hugging Face 来源:https://huggingface.co/google/gemma-4-26B-A4B-it Hugging Face (https://huggingface.co/collections/google/gemma-4)|GitHub (https://github.com/google-gemma)|发布博客 (https://blog.google/innovation-and-ai/technology/developers-tools/gemma-4/)|文档 (https://ai.google.dev/gemma/docs/core) 许可证:Apache 2.0 (https://ai.google.dev/gemma/docs/gemma_4_license)|作者:Google DeepMind (https://deepmind.google/models/gemma/) Gemma 是由 Google DeepMind 构建的开放模型系列。Gemma 4 模型是多模态的,能够处理文本和图像输入(小型模型支持音频)并生成文本输出。此版本包含预训练和指令调优两种变体的开放权重模型。Gemma 4 支持高达 256K 令牌的上下文窗口,并保持对 140 多种语言的多语言支持。Gemma 4 采用密集(Dense)和混合专家(MoE)两种架构,非常适合文本生成、编码和推理等任务。模型提供四种不同的尺寸:E2BE4B26B A4B31B。它们多样的尺寸使其能够部署在从高端手机到笔记本电脑和服务器的各种环境中,让更多人能够使用最先进的 AI。 Gemma 4 引入了关键的能力和架构进步: - 推理 – 系列中的所有模型都被设计为高能力的推理器,具有可配置的思维模式。 - 扩展的多模态能力 – 处理文本、支持可变长宽比和分辨率的图像(所有模型)、视频,以及音频(E2B 和 E4B 模型原生支持)。 - 多样化且高效的架构 – 提供不同尺寸的密集(Dense)和混合专家(MoE)变体,以便灵活部署。 - 针对端侧设备优化 – 较小的模型专为在笔记本电脑和移动设备上高效本地执行而设计。 - 更大的上下文窗口 – 小模型支持 128K 上下文窗口,而中等模型支持 256K。 - 增强的编码和代理能力 – 在编码基准测试中取得显著改进,同时支持原生函数调用,为高能力的自主代理提供动力。 - 原生系统提示支持 – Gemma 4 原生支持 system 角色,使对话更加结构化和可控。 ## https://huggingface.co/google/gemma-4-26B-A4B-it#models-overview模型概览 Gemma 4 模型旨在每个尺寸下提供前沿性能,目标部署场景涵盖从移动和边缘设备 (E2B, E4B) 到消费级 GPU 和工作站 (26B A4B, 31B)。它们非常适合推理、代理工作流、编码和多模态理解。这些模型采用混合注意力机制,将局部滑动窗口注意力与全局注意力交错结合,确保最后一层始终是全局的。这种混合设计提供了轻量级模型的处理速度和低内存占用,同时不牺牲复杂长上下文任务所需的深度感知。为了优化长上下文的内存使用,全局层采用了统一的键值对,并应用了比例 RoPE(p-RoPE)。 ### https://huggingface.co/google/gemma-4-26B-A4B-it#dense-models密集模型 属性E2BE4B31B 密集总参数量23亿有效(含嵌入层51亿)45亿有效(含嵌入层80亿)307亿层数354260滑动窗口512 令牌512 令牌1024 令牌上下文长度128K 令牌128K 令牌256K 令牌词表大小262K262K262K支持的模态文本、图像、音频文本、图像、音频文本、图像视觉编码器参数约1.5亿约1.5亿约5.5亿音频编码器参数约3亿约3亿*无音频 E2B 和 E4B 中的 “E” 代表 “有效” 参数。较小的模型采用逐层嵌入(PLE)技术,以最大化端侧部署中的参数效率。PLE 并非向模型添加更多层或参数,而是为每个解码器层提供其自身针对每个令牌的小型嵌入。这些嵌入表很大,但仅用于快速查找,这就是为什么有效参数计数远小于总数量的原因。 ### https://huggingface.co/google/gemma-4-26B-A4B-it#mixture-of-experts-moe-model混合专家模型 属性26B A4B MoE总参数量252亿活跃参数量38亿层数30滑动窗口1024 令牌上下文长度256K 令牌词表大小262K专家数量8 活跃 / 128 总数 + 1 共享支持的模态文本、图像视觉编码器参数约5.5亿 26B A4B 中的 “A” 代表 “活跃参数”,与模型包含的总参数数量相对。通过在推理过程中仅激活 40 亿参数子集,混合专家模型的运行速度远快于其 260 亿总参数量所暗示的性能。这使得它成为相比 310 亿参数的密集模型的快速推理绝佳选择,因为它的运行速度几乎与 40 亿参数模型一样快。 ## https://huggingface.co/google/gemma-4-26B-A4B-it#benchmark-results基准测试结果* 这些模型针对大量不同的数据集和指标进行了评估,涵盖了文本生成的各个方面。下表中标记的评估结果针对的是指令调优模型。 Gemma 4 31BGemma 4 26B A4BGemma 4 E4BGemma 4 E2BGemma 3 27B (无思考)MMLU Pro85.2%82.6%69.4%60.0%67.6%AIME 2026 无工具89.2%88.3%42.5%37.5%20.8%LiveCodeBench v680.0%77.1%52.0%44.0%29.1%Codeforces ELO21501718940633110GPQA Diamond84.3%82.3%58.6%43.4%42.4%Tau2 (3项平均)76.9%68.2%42.2%24.5%16.2%HLE 无工具19.5%8.7%—HLE 带搜索26.5%17.2%—BigBench 极难74.4%64.8%33.1%21.9%19.3%MMMLU88.4%86.3%76.6%67.4%70.7%视觉MMMU Pro76.9%73.8%52.6%44.2%49.7%OmniDocBench 1.5 (平均编辑距离,越低越好)0.1310.1490.1810.2900.365MATH-视觉85.6%82.4%59.5%52.4%46.0%MedXPertQA MM61.3%58.1%28.7%23.5%-音频CoVoST–35.5433.47-FLEURS (越低越好)–0.080.09-长上下文MRCR v2 8针 128k (平均)66.4%44.1%25.4%19.1%13.5% ## https://huggingface.co/google/gemma-4-26B-A4B-it#core-capabilities核心能力 Gemma 4 模型处理文本、视觉和音频领域的广泛任务。关键能力包括: - 思考 – 内置推理模式,让模型在回答前逐步思考。 - 长上下文 – 高达 128K 令牌 (E2B/E4B) 和 256K 令牌 (26B A4B/31B) 的上下文窗口。 - 图像理解 – 物体检测、文档/PDF 解析、屏幕和 UI 理解、图表理解、OCR(包括多语言)、手写识别和指向。图像可以以可变长宽比和分辨率进行处理。 - 视频理解 – 通过处理一系列帧来分析视频。 - 交错多模态输入 – 在单个提示中自由混合任何顺序的文本和图像。 - 函数调用 – 原生支持结构化工具使用,支持代理工作流。 - 编码 – 代码生成、补全和纠错。 - 多语言 – 开箱即用支持 35+ 种语言,预训练涵盖 140+ 种语言。 - 音频(仅限 E2B 和 E4B) – 跨多种语言的自动语音识别和语音到翻译文本的转换。 ## https://huggingface.co/google/gemma-4-26B-A4B-it#getting-started入门指南 您可以将所有 Gemma 4 模型与最新版本的 Transformers 一起使用。首先,在您的环境中安装必要的依赖项: pip install -U transformers torch accelerate 安装完成后,您可以使用以下代码加载模型: from transformers import AutoProcessor, AutoModelForCausalLM MODEL_ID = "google/gemma-4-26B-A4B-it" # 加载模型 processor = AutoProcessor.from_pretrained(MODEL_ID) model = AutoModelForCausalLM.from_pretrained( MODEL_ID, dtype="auto", device_map="auto" ) 模型加载后,您可以开始生成输出: # 提示 messages = [ {"role": "system", "content": "你是一个乐于助人的助手。"}, {"role": "user", "content": "写一个关于节省内存的短笑话。"}, ] # 处理输入 text = processor.apply_chat_template( messages, tokenize=False, add_generation_prompt=True, enable_thinking=False ) inputs = processor(text=text, return_tensors="pt").to(model.device) input_len = inputs["input_ids"].shape[-1] # 生成输出 outputs = model.generate(**inputs, max_new_tokens=1024) response = processor.decode(outputs[0][input_len:], skip_special_tokens=False) # 解析输出 processor.parse_response(response) 要启用推理功能,请设置 enable_thinking=True,然后 parse_response 函数将负责解析推理输出。 下面,您还会找到处理音频(仅限 E2B 和 E4B)、图像和视频以及文本的代码片段: 处理音频的代码您可以使用 AutoModelForMultimodalLM 代替 AutoModelForCausalLM 来处理音频。要使用它,请确保安装以下包: pip install -U transformers torch librosa accelerate 然后您可以使用以下代码加载模型: from transformers import AutoProcessor, AutoModelForMultimodalLM MODEL_ID = "google/gemma-4-E2B-it" # 加载模型 processor = AutoProcessor.from_pretrained(MODEL_ID) model = AutoModelForMultimodalLM.from_pretrained( MODEL_ID, dtype="auto", device_map="auto" ) 模型加载后,您可以直接在提示中引用音频 URL 来生成输出: # 提示 - 在文本前添加音频 messages = [ { "role": "user", "content": [ {"type": "audio", "audio": "https://raw.githubusercontent.com/google-gemma/cookbook/refs/heads/main/Demos/sample-data/journal1.wav"}, {"type": "text", "text": "用原始语言转录以下语音片段。请遵循以下格式化说明:\n* 只输出转录文本,不要换行。\n* 转录数字时,请写出数字,例如写 1.7 而不是一点七,写 3 而不是三。"}, ] } ] # 处理输入 inputs = processor.apply_chat_template( messages, tokenize=True, return_dict=True, return_tensors="pt", add_generation_prompt=True, ).to(model.device) input_len = inputs["input_ids"].shape[-1] # 生成输出 outputs = model.generate(**inputs, max_new_tokens=512) response = processor.decode(outputs[0][input_len:], skip_special_tokens=False) # 解析输出 processor.parse_response(response) 处理图像的代码您可以使用 AutoModelForMultimodalLM 代替 AutoModelForCausalLM 来处理图像。要使用它,请确保安装以下包: pip install -U transformers torch torchvision accelerate 然后您可以使用以下代码加载模型: from transformers import AutoProcessor, AutoModelForMultimodalLM MODEL_ID = "google/gemma-4-26B-A4B-it" # 加载模型 processor = AutoProcessor.from_pretrained(MODEL_ID) model = AutoModelForMultimodalLM.from_pretrained( MODEL_ID, dtype="auto", device_map="auto" ) 模型加载后,您可以直接在提示中引用图像 URL 来生成输出: # 提示 - 在文本前添加图像 messages = [ { "role": "user", "content": [ {"type": "image", "url": "https://raw.githubusercontent.com/google-gemma/cookbook/refs/heads/main/Demos/sample-data/GoldenGate.png"}, {"type": "text", "text": "这张图片展示了什么?"} ] } ] # 处理输入 inputs = processor.apply_chat_template( messages, tokenize=True, return_dict=True, return_tensors="pt", add_generation_prompt=True, ).to(model.device) input_len = inputs["input_ids"].shape[-1] # 生成输出 outputs = model.generate(**inputs, max_new_tokens=512) response = processor.decode(outputs[0][input_len:], skip_special_tokens=False) # 解析输出 processor.parse_response(response) 处理视频的代码您可以使用 AutoModelForMultimodalLM 代替 AutoModelForCausalLM 来处理视频。要使用它,请确保安装以下包: pip install -U transformers torch torchvision torchcodec librosa accelerate 然后您可以使用以下代码加载模型: from transformers import AutoProcessor, AutoModelForMultimodalLM MODEL_ID = "google/gemma-4-26B-A4B-it" # 加载模型 processor = AutoProcessor.from_pretrained(MODEL_ID) model = AutoModelForMultimodalLM.from_pretrained( MODEL_ID, dtype="auto", device_map="auto" ) 模型加载后,您可以直接在提示中引用视频 URL 来生成输出: # 提示 - 在文本前添加视频 messages = [ { 'role': 'user', 'content': [ {"type": "video", "video": "https://github.com/bebechien/gemma/raw/refs/heads/main/videos/ForBiggerBlazes.mp4"}, {'type': 'text', 'text': '描述这个视频。'} ] } ] # 处理输入 inputs = processor.apply_chat_template( messages, tokenize=True, return_dict=True, return_tensors="pt", add_generation_prompt=True, ).to(model.device) input_len = inputs["input_ids"].shape[-1] # 生成输出 outputs = model.generate(**inputs, max_new_tokens=512) response = processor.decode(outputs[0][input_len:], skip_special_tokens=False) # 解析输出 processor.parse_response(response) ## https://huggingface.co/google/gemma-4-26B-A4B-it#best-practices最佳实践 为获得最佳性能,请使用以下配置和最佳实践: ### https://huggingface.co/google/gemma-4-26B-A4B-it#1-sampling-parameters1. 采样参数 在所有用例中使用以下标准化采样配置: - temperature=1.0 - top_p=0.95 - top_k=64 ### https://huggingface.co/google/gemma-4-26B-A4B-it#2-thinking-mode-configuration2. 思考模式配置 与 Gemma 3 相比,这些模型使用了标准的 systemassistantuser 角色。为正确管理思考过程,请使用以下控制令牌: - 触发思考:通过在系统提示的开头包含 <|think|> 令牌来启用思考。要禁用思考,请移除该令牌。 - 标准生成:启用思考后,模型将使用以下结构输出其内部推理,随后是最终答案: <|channel|>thought\\n[内部推理] `` - 禁用思考行为:对于除 E2B 和 E4B 变体之外的所有模型,如果禁用思考,模型仍会生成标签,但思维块为空: <|channel|>thought\\n[最终答案] > 注意,许多库(如 Transformers 和 llama.cpp)会为您处理聊天模板的复杂性。 ### https://huggingface.co/google/gemma-4-26B-A4B-it#3-multi-turn-conversations3. 多轮对话 - 历史记录中不含思考内容: 在多轮对话中,历史模型输出应仅包含最终响应。来自之前模型轮次的思考不得在下一用户轮次开始前添加。 ### https://huggingface.co/google/gemma-4-26B-A4B-it#4-modality-order4. 模态顺序 - 为获得多模态输入的最佳性能,请将图像和/或音频内容置于提示中的文本之前。 ### https://huggingface.co/google/gemma-4-26B-A4B-it#5-variable-image-resolution5. 可变图像分辨率 除了可变长宽比之外,Gemma 4 还通过可配置的视觉令牌预算支持可变图像分辨率,该预算控制用于表示图像的令牌数量。较高的令牌预算可以保留更多视觉细节,但会增加计算成本;而较低预算可以在不需要细粒度理解的任务中实现更快的推理。 - 支持的令牌预算为:701402805601120。- 在分类、字幕生成或视频理解等任务中,使用较低的预算,这些任务中更快的推理和处理更多帧比细粒度细节更重要。 - 在类似 OCR、文档解析或读取小文本等任务中,使用较高的预算

相似文章

google/gemma-4-31B-it-assistant

Hugging Face Models Trending

Google DeepMind 发布了 Gemma 4,这是一个开源权重的多模态模型家族,支持文本、图像、视频和音频,具备增强的推理和编码能力,并通过多令牌预测(MTP)实现高达 2 倍的解码速度提升。

google/gemma-4-E4B-it-assistant

Hugging Face Models Trending

Google DeepMind 发布了 Gemma 4 E4B 指令微调助手模型,该模型具备多模态能力、推理改进以及针对低延迟端侧应用优化的投机解码功能。

推出 Gemma 3

Google DeepMind Blog

Google 推出了 Gemma 3,这是一套轻量级开源模型集合(1B、4B、12B、27B),设计用于在单个 GPU 或 TPU 上运行,支持 140+ 种语言、128k 上下文窗口和多模态功能。这些模型在保持高效性能的同时,性能超越了 Llama 3 和 DeepSeek-V3 等更大的竞品,适合边缘设备部署。