google/diffusiongemma-26B-A4B-it

Hugging Face Models Trending 模型

摘要

Google DeepMind 发布了 DiffusionGemma,这是一个 26B 参数的 Mixture-of-Experts 模型,使用离散扩散实现更快的文本生成,支持多模态输入和 256K token 上下文。

任务:image-text-to-text 标签:transformers, safetensors, diffusion_gemma, image-text-to-text, conversational, license:apache-2.0, endpoints_compatible, region:us
查看原文
查看缓存全文

缓存时间: 2026/06/10 18:11

google/diffusiongemma-26B-A4B-it · Hugging Face 来源:https://huggingface.co/google/diffusiongemma-26B-A4B-it Hugging Face (https://huggingface.co/google/diffusiongemma-26B-A4B-it)|GitHub (https://github.com/google-gemma)|发布博客 (https://blog.google/innovation-and-ai/technology/developers-tools/diffusion-gemma-faster-text-generation/)|文档 (https://ai.google.dev/gemma/docs/diffusiongemma) 许可证:Apache 2.0 (https://ai.google.dev/gemma/docs/gemma_4_license)|作者:Google DeepMind (https://deepmind.google/models/gemma/) DiffusionGemma 是由 Google DeepMind 构建的生成式模型。该模型基于 26B A4B 混合专家(MoE)Gemma 4 架构,通过离散扩散生成 token。这个开放权重模型是多模态的,能够处理文本、图像和视频输入,并生成文本输出。DiffusionGemma 建立在 MoE 基础之上,旨在提高生成速度(每秒 token 数),同时保持可在各种硬件环境中部署。 DiffusionGemma 基于 Gemma 4 的架构和能力进步进行构建,引入了几个核心特性: - 离散文本扩散 – 从逐个 token 的自回归转变为块自回归多画布采样。它通过并行迭代去噪 token 块(一个“画布”)来生成文本,显著提高解码速度。 - 多模态输入处理 – 处理交错的文本、图像(支持可变宽高比和分辨率)以及视频输入以生成文本输出。 - 编码器-解码器架构 – 利用自回归编码器处理和缓存提示上下文,并与解码器配对,解码器对生成画布应用双向注意力。 - 混合专家(MoE)效率 – 利用稀疏 MoE 设计(总共128个专家中激活8个)提供强大的推理能力,同时保持适合本地执行的低内存占用。 - 思考模式(推理) – 设计为高度能干的推理器,具有可配置的思考模式。 - 针对小批量推理进行优化 – 专为在单个高性能加速器上实现低延迟、高速生成而设计。 - 原生系统提示支持 – 与 Gemma 4 一样,支持更新 system 角色,实现更结构化和可控的对话。 ## https://huggingface.co/google/diffusiongemma-26B-A4B-it#model-overview模型概述 DiffusionGemma 旨在减少标准因果语言模型的顺序瓶颈。它采用专门针对推理速度优化的编码器-解码器架构。编码器以预填充模式运行,处理初始提示并生成 KV 缓存。解码器则利用双向注意力处理一个输入块(“画布”)的 token,通过交叉注意力访问缓存的上下文。在推理过程中,DiffusionGemma 利用多画布采样。该模型不是一次生成一个 token,而是使用扩散采样器迭代地去噪整个 token 块。一旦画布完全去噪,它会由编码器处理并附加到 KV 缓存中,之后模型生成下一个画布。这种块自回归方法有助于以更高的速度生成文本。 ### https://huggingface.co/google/diffusiongemma-26B-A4B-it#diffusiongemmaDiffusionGemma 总参数量25.2B活跃参数量3.8B层数30滑动窗口1024 tokens上下文长度最高 256K tokens画布长度256词汇量262K专家数量8 个活跃 / 128 个总计和 1 个共享支持模态文本,图像视觉编码器参数量~550M ## https://huggingface.co/google/diffusiongemma-26B-A4B-it#benchmark-results基准测试结果 这些模型针对大量不同的数据集和指标进行了评估,以涵盖文本生成的不同方面。表中标注的评估结果是针对指令微调模型,使用了推荐的熵界(EB)采样器(请参见下面的最佳实践)。 基准测试DiffusionGemma 26B A4BGemma 4 26B A4BMMLU Pro77.6%82.6%AIME 2026 no tools69.1%88.3%LiveCodeBench v669.1%77.1%Codeforces ELO14291718GPQA Diamond73.2%82.3%Tau2(3次平均)56.2%68.2%HLE no tools11.0%8.7%HLE with search11.9%17.2%BigBench Extra Hard47.6%64.8%MMMLU81.5%86.3%视觉MMMU Pro54.3%73.8%OmniDocBench 1.5(平均编辑距离,越低越好)0.3190.149MATH-Vision70.5%82.4%MedXPertQA MM49.0%58.1%长上下文MRCR v2 8 needle 128k(平均)32.0%44.1% ## https://huggingface.co/google/diffusiongemma-26B-A4B-it#core-capabilities核心能力 DiffusionGemma 处理文本和视觉领域的广泛任务。关键能力包括: - 高速生成通过扩散采样并行去噪 256 个 token,每次前向传播生成 15-20 个 token,实现低延迟,在低批量设置下(H100, FP8)解锁超过 1100 tokens/s 的每用户生成速度。 - 自适应推理时间计算更简单的提示和结构化任务(如代码)需要更少的去噪步骤,从而根据任务复杂度实现动态的 tokens/s 速度。 - 思考– 内置推理模式,让模型在回答前逐步思考。 - 长上下文– 上下文窗口最高可达 256K tokens。 - 图像理解– 目标检测,文档/PDF 解析,屏幕和 UI 理解,图表理解,OCR(包括多语言),手写识别和指代。图像可以以可变宽高比和分辨率处理。 - 视频理解– 通过处理帧序列分析和描述视频内容。 - 交错多模态输入– 在单个提示中混合图像、视频和文本,用于上下文密集的推理。 - 函数调用– 原生支持结构化工具使用,支持代理工作流。 - 编码与推理– 能进行代码生成、补全和逐步逻辑推理。 - 多语言– 开箱即用支持 35+ 种语言,预训练涵盖 140+ 种语言。 ## https://huggingface.co/google/diffusiongemma-26B-A4B-it#getting-started快速开始 您可以将所有 Gemma 4 模型与最新版本的 Transformers 一起使用。要开始,请在您的环境中安装必要的依赖项: pip install -U transformers torch accelerate 完成安装后,您可以使用以下代码加载模型: from transformers import DiffusionGemmaForBlockDiffusion, AutoProcessor MODEL_ID = "google/diffusiongemma-26B-A4B-it" # 加载模型 processor = AutoProcessor.from_pretrained(MODEL_ID) model = DiffusionGemmaForBlockDiffusion.from_pretrained( MODEL_ID, dtype="auto", device_map="auto", ) 加载模型后,您可以开始生成输出: # 提示 message = [ {"role": "user", "content": "为什么天空是蓝色的?"} ] # 处理输入 input_ids = processor.apply_chat_template( message, tokenize=True, add_generation_prompt=True, return_dict=True, return_tensors="pt" ).to(model.device) output = model.generate(**input_ids, max_new_tokens=512) # 解析输出 text = processor.decode(output[0], skip_special_tokens=False) ## https://huggingface.co/google/diffusiongemma-26B-A4B-it#best-practices最佳实践 为获得最佳性能,请使用以下配置和最佳实践: ### https://huggingface.co/google/diffusiongemma-26B-A4B-it#1-diffusion-sampling-settings1. 扩散采样设置 在所有用例中使用以下标准化采样配置: - 方法:使用熵界去噪和自适应停止的扩散采样。 - 采样配置:- 最大去噪步数 = 48 - 温度调度(用于 logit 塑形):从 0.8 → 0.4 线性衰减 - Token 选择:在每一步,采样器选择熵最低的 token,使得它们的互信息界保持在熵界 = 0.1 以下 - Token 重新加噪:采样器完全重新加噪未被选中的 token - 自适应停止:当且仅当以下两个条件同时满足时,采样提前终止:- 置信预测:画布上的平均模型熵低于熵阈值 = 0.005 - 稳定预测:在两个连续的去噪步骤中,最高概率 token 的预测保持不变 ### https://huggingface.co/google/diffusiongemma-26B-A4B-it#2-thinking-mode-configuration2. 思考模式配置 与 Gemma 4 模型类似,我们使用标准的 system、assistant 和 user 角色。要正确管理思考过程,请使用以下控制 token: - 触发思考:通过在系统提示开始时包含 <|think|> token 来启用思考。要禁用思考,请移除该 token(注意,仍可能会发出空的思考通道)。 - 标准生成:启用思考后,模型将使用以下结构输出其内部推理,后跟最终答案: <|channel|>thought\\n[内部推理]。 - **禁用思考行为**:如果禁用思考,模型仍会生成标签,但思考块为空: `<|channel|>thought\\n`**\[最终答案\]**。 > 请注意,许多库(如 transformers)会为您处理聊天模板的复杂性。 ### https://huggingface.co/google/diffusiongemma-26B-A4B-it#3-multi-turn-conversations3. 多轮对话 - 历史记录中不包含思考内容:在多轮对话中,历史的模型输出应仅包含最终回复。来自先前模型回合的思考不得在下一用户回合开始前添加。 ### https://huggingface.co/google/diffusiongemma-26B-A4B-it#4-modality-order4. 模态顺序 - 为获得多模态输入的最佳性能,请将图像内容置于提示中的文本之前。 ### https://huggingface.co/google/diffusiongemma-26B-A4B-it#5-variable-image-resolution5. 可变图像分辨率 除了可变宽高比,DiffusionGemma 通过可配置的视觉 token 预算支持可变图像分辨率,该预算控制用于表示图像的 token 数量。更高的 token 预算以增加计算为代价保留更多视觉细节,而较低的预算则能对不需要细粒度理解的任务实现更快的推理。 - 支持的 token 预算为:701402805601120。 - 对于分类、字幕生成或视频理解等任务,请使用较低预算,在这些任务中,更快的推理和处理更多帧比细粒度细节更重要。 - 对于 OCR、文档解析或读取小文本等任务,请使用较高预算。 ### https://huggingface.co/google/diffusiongemma-26B-A4B-it#6-video-length6. 视频长度 所有模型都支持图像输入,并可以将视频作为帧进行处理。假设图像以每秒一帧的速度处理,视频最长支持 60 秒。 ## https://huggingface.co/google/diffusiongemma-26B-A4B-it#model-data模型数据 ## https://huggingface.co/google/diffusiongemma-26B-A4B-it#data-used-for-model-training-and-how-the-data-was-processed用于模型训练的数据以及这些数据的处理方式。 ### https://huggingface.co/google/diffusiongemma-26B-A4B-it#training-dataset训练数据集 我们的预训练数据集是一个大规模、多样化的数据集合,涵盖了广泛的领域和模态,包括网络文档、代码、图像、音频,数据截止日期为 2025 年 1 月。以下是关键组成部分: - 网络文档:多样化的网络文本集合确保模型接触到广泛的语言风格、主题和词汇。训练数据集包含超过 140 种语言的内容。 - 代码:让模型接触代码有助于其学习编程语言的语法和模式,从而提高其生成代码和理解代码相关问题。 - 数学:在数学文本上进行训练有助于模型学习逻辑推理、符号表示和处理数学查询。 - 图像:广泛的图像使模型能够执行图像分析和视觉数据提取任务。 这些多样化数据源的组合对于训练一个强大的多模态模型至关重要,该模型能够处理各种不同的任务和数据格式。 ### https://huggingface.co/google/diffusiongemma-26B-A4B-it#data-preprocessing数据预处理 以下是应用于训练数据的关键数据清洗和过滤方法: - CSAM 过滤:在数据准备过程的多个阶段应用了严格的 CSAM(儿童性虐待材料)过滤,以确保排除有害和非法内容。 - 敏感数据过滤:作为确保 Gemma 预训练模型安全可靠的一部分,使用了自动化技术从训练集中过滤掉某些个人信息和其他敏感数据。 - 其他方法:根据我们的政策 (https://ai.google/static/documents/ai-responsibility-update-published-february-2025.pdf) 进行基于内容质量和安全性的过滤。 ## https://huggingface.co/google/diffusiongemma-26B-A4B-it#ethics-and-safety伦理与安全 ### https://huggingface.co/google/diffusiongemma-26B-A4B-it#as-open-models-become-central-to-enterprise-infrastructure-provenance-and-security-are-paramount-developed-by-google-deepmind-diffusiongemma- Undergoes-the-same-rigorous-safety-evaluations-as-our-proprietary-gemini-models随着开放模型成为企业基础设施的核心,来源和安全性至关重要。由 Google DeepMind 开发的 DiffusionGemma 经历了与我们专有的 Gemini 模型同样严格的安全评估。 ### https://huggingface.co/google/diffusiongemma-26B-A4B-it#evaluation-approach评估方法 DiffusionGemma 是与内部安全和负责任的人工智能团队合作开发的。进行了自动化和人工评估等一系列工作,以帮助提高模型的安全性。这些评估符合 Google 的人工智能原则 (https://ai.google/principles/) 以及安全政策,旨在防止我们的生成式人工智能模型生成有害内容,包括: - 与儿童性虐待材料和剥削相关的内容 - 危险内容(例如,宣传自杀,或指导可能导致现实世界伤害的活动) - 露骨色情内容 - 仇恨言论(例如,非人化受保护群体的成员) - 骚扰(例如,鼓励针对他人的暴力行为) ### https://huggingface.co/google/diffusiongemma-26B-A4B-it#evaluation-results评估结果 在安全测试的所有领域,我们看到与之前的 Gemma 模型相比,所有内容安全类别都有重大改进。总体而言,DiffusionGemma(与 Gemma 4 模型一样)在提高安全性方面显著优于 Gemma 3 和 3n 模型,同时保持了较低的不合理拒绝率。所有测试都是在有意不使用安全过滤器的情况下进行的,以评估模型的原始能力和基线行为。对于文本到文本和图像到文本,以及所有模型规模,该模型产生的政策违规最少,并且比之前的 Gemma 模型有显著改进。 ## https://huggingface.co/google/diffusiongemma-26B-A4B-it#usage-and-limitations使用与限制 这些模型具有某些用户应注意的限制。 ### https://huggingface.co/google/diffusiongemma-26B-A4B-it#intended-usage预期用途 多模态模型(能够处理视觉、语言和/或音频)在各行各业和领域有着广泛的应用。以下潜在用途列表并不详尽。此列表的目的是提供上下文

相似文章

DiffusionGemma

Simon Willison's Blog

Google 发布了 DiffusionGemma,这是一个采用 Apache 2 许可证的开源权重文本生成模型(总参数量 26B,活跃参数量 4B),通过 NVIDIA 的 NIM 云 API 展示了极高的推理速度。

DiffusionGemma:开发者指南 - Google Developers Blog

Reddit r/LocalLLaMA

DiffusionGemma 是 Google DeepMind 推出的全新实验模型,可在 256 令牌画布上实现并行生成,在 GPU 上令牌生成速度提升高达 4 倍。本开发者指南阐述了其架构、双向上下文,并提供了用于解决数独的微调配方。

DiffusionGemma: 文本生成速度提升4倍

Hacker News Top

Google推出DiffusionGemma,这是一个实验性的26B MoE开源模型,通过文本扩散技术,在GPU上实现高达4倍的文本生成速度提升,针对速度要求高的交互式本地工作流。