NVIDIA 加速 Google DeepMind 的 DiffusionGemma 以支持本地 AI
摘要
NVIDIA 优化了 Google DeepMind 的 DiffusionGemma——一个能并行生成 256 个令牌文本块的开放模型,在本地 RTX GPU、DGX Spark 和 DGX Station 系统上实现了高达 4 倍的性能提升。
<div id="bsf_rt_marker"></div><p>今天,Google DeepMind发布了DiffusionGemma——一款专为实现极致快速文本生成而构建的实验性开源模型。NVIDIA已优化DiffusionGemma,使其在NVIDIA GeForce RTX GPU、NVIDIA RTX PRO平台以及NVIDIA DGX Spark系统上运行得更快,覆盖从本地PC到云端的环境。</p>
<p>与逐字生成文本不同,DiffusionGemma并行生成多个词元,一次性输出整个文本块,为开发者、研究人员和AI爱好者日常运行的单用户工作负载开辟了低延迟的新前沿。</p>
<p>新模型的特点包括:</p>
<ul>
<li><b>并行生成:</b>DiffusionGemma每步去噪最多256个词元,而非逐个预测。</li>
<li><b>基于Gemma 4构建:</b>DiffusionGemma基于Gemma 4,这是一个260亿参数的混合专家模型,每步仅激活38亿参数,将扩散头与Google的Gemma 4架构配对。</li>
<li><b>最高4倍性能提升:</b>这一提升意味着在本地硬件上,通常停滞的单用户生成任务能够实现快速文本生成。</li>
<li><b>开放且本地运行:</b>DiffusionGemma采用宽松的Apache 2.0许可证开放权重,完全在RTX和DGX Spark上运行——无需云端,无每次生成费用——并在发布首日即获得Hugging Face Transformers、vLLM和Unsloth的支持。</li>
</ul>
<h2><strong>一种不同的文本生成方式</strong></h2>
<p>目前广泛使用的大语言模型几乎都是自回归的——即逐个词元生成文本,每个新词依赖于前一个词。这一顺序过程使得交互式AI看起来像是在逐字打字。</p>
<p>DiffusionGemma走了一条不同的路。它基于Gemma 4 26B混合专家架构构建,其生成文本的方式类似于扩散模型生成图像:从噪声开始,一次性完善整个文本块。每步并行去噪最多256个词元,而非发出单个词元并等待计算下一个。</p>
<p>结果是模型以块为单位思考,而非顺序执行。对于延迟敏感的单用户工作——例如交互式聊天、智能体循环或需要规划与执行的设备端助手——这种并行性转化为足够快的响应,跟得上开发者思考和迭代的节奏。</p>
<h2><b>DiffusionGemma在NVIDIA GPU上飞速运行</b></h2>
<p>逐个词元生成本质上是一个内存受限问题——传统大语言模型大部分时间都在等待内存带宽,而不是进行数学计算,导致大量算力被浪费。</p>
<p>扩散模型扭转了这一局面。将完整的256词元块并行拉过Transformer是一个计算密集型任务——这正是NVIDIA GPU的强项。NVIDIA Tensor Core加速密集的并行数学运算,而CUDA软件栈使得模型从第一天起就能高效运行,无需定制调优。简而言之,模型的设计直接发挥了GPU的优势。</p>
<p>数字也证明了这一点。DiffusionGemma在单个NVIDIA H100 Tensor Core GPU上实现1000词元/秒,在NVIDIA DGX Spark上实现150词元/秒,并在NVIDIA DGX Station上实现最快的本地推理——比同等规模的自回归模型在相同单用户场景下快约4倍。</p>
<p>这一优势贯穿NVIDIA全线产品,运行环境包括:</p>
<ul>
<li><b>本地运行于NVIDIA DGX Spark桌面个人AI超级计算机</b>——由NVIDIA GB10 Grace Blackwell超级芯片提供动力,配备128GB统一内存,预装NVIDIA AI软件栈,可用于原型开发、微调和完全本地化的智能体工作流。</li>
<li><b>在NVIDIA RTX PRO 6000工作站上</b>,为开发者、研究人员和AI专业人士提供充足资源,支持专业工作流中的低延迟本地生成和智能体循环。</li>
<li><b>在DGX Station上</b>,提供顶级的、高速的推理体验。</li>
</ul>
查看缓存全文
缓存时间: 2026/06/10 18:12
# NVIDIA 加速 Google DeepMind 的 DiffusionGemma,推动本地 AI 发展
来源:https://blogs.nvidia.com/blog/rtx-ai-garage-local-gemma-diffusion/
今日,Google DeepMind 发布了 DiffusionGemma——一款实验性开放模型,专为实现超快文本生成而设计。NVIDIA 已对 DiffusionGemma 进行优化,使其运行速度更快,覆盖 NVIDIA GeForce RTX GPU、NVIDIA RTX PRO 平台以及 NVIDIA DGX Spark 系统,从本地 PC 到云环境均可高效运行。
DiffusionGemma 并非逐字生成文本,而是并行生成多个单词,一次性输出整个文本块。这为开发者、研究人员和 AI 爱好者每天运行的单用户工作负载开辟了一个低延迟的新前沿。
该模型的特点包括:
- **并行生成:** DiffusionGemma 每步能去噪多达 256 个 token,而非逐个预测。
- **基于 Gemma 4:** DiffusionGemma 基于 Gemma 4 构建,这是一款 260 亿参数的混合专家模型,每步仅激活 38 亿参数,将扩散头与 Google 的 Gemma 4 架构相结合。
- **性能提升高达 4 倍:** 这种提升意味着在本地硬件上,通常因单用户生成而停滞的文本生成速度得以大幅加快。
- **开放且本地化:** DiffusionGemma 采用宽松的 Apache 2.0 许可证开放权重,完全在 RTX 和 DGX Spark 上本地运行——无需云端,无逐 token 成本——并在 Hugging Face Transformers (https://huggingface.co/nvidia/diffusiongemma-26B-A4B-it-NVFP4)、vLLM 和 Unsloth 中获得零日支持。
## **一种不同的文本生成方式**
当今广泛使用的几乎每一个大型语言模型 (LLM) 都是自回归的——这意味着它一次生成一个 token,每个新词依赖于前一个词。这种顺序处理过程使得交互式 AI 感觉像是在打字。
DiffusionGemma 则另辟蹊径。它基于 Gemma 4 26B 混合专家架构,像扩散模型生成图像那样生成文本:从噪声开始,一次性完善整个文本块。每一步并行去噪多达 256 个 token,而不是发射单个 token 并等待计算下一个。
结果是一个会按块思考而不是按顺序思考的模型。对于延迟敏感的单用户工作——如交互式聊天、智能体循环或设备端规划并行动的助手——这种并行性意味着响应速度快到足以跟上开发者的思考和迭代节奏。
## **DiffusionGemma 在 NVIDIA GPU 上飞速运行**
逐 token 生成本质上是一个内存受限的问题——传统 LLM 大部分时间都在等待内存带宽,而非进行计算,导致大量算力被浪费。
扩散模型颠覆了这一等式。将整个 256 token 块并行送入 transformer 是一个计算密集型工作负载——这正是 NVIDIA GPU 的强项。NVIDIA Tensor Core 加速了密集并行数学运算,而 CUDA 软件栈让模型从第一天起就能高效运行,无需定制调优。简而言之,模型的设计直接发挥了 GPU 的优势。
DiffusionGemma 在单个 NVIDIA H100 Tensor Core GPU 上可达到 1000 token/秒,在 NVIDIA DGX Spark 上为 150 token/秒,在 NVIDIA DGX Station 上实现最快的本地推理——比等效自回归模型在同一单用户场景下的运行速度大约快 4 倍。
这一优势贯穿 NVIDIA 全线产品,运行于:
- **本地 NVIDIA DGX Spark 桌面级个人 AI 超级计算机**——搭载 NVIDIA GB10 Grace Blackwell Superchip,配备 128GB 统一内存——预装 NVIDIA AI 软件栈,随时可用于原型开发、微调和完全本地的智能体工作流。
- **NVIDIA RTX PRO 6000 工作站**,为开发者、研究人员和 AI 专业人士提供充裕空间,将本地低延迟生成和智能体循环融入专业工作流程。
- **DGX Station**,提供一流的高速推理能力,支持高达 800 token/秒的低延迟文本生成和智能体循环,配备 748GB 一致性内存。
- **GeForce RTX GPU**,即将支持 llama.cpp。
开始测试和原型开发该模型的最快方式是通过 Hugging Face Transformers,它开箱即用即可在 GeForce RTX 5090 或 DGX Spark 上运行 DiffusionGemma。如需更高吞吐量的推理,vLLM 提供零日服务支持。
要将模型调整为特定任务或领域,可通过 Unsloth 和 NVIDIA NeMo 框架进行微调,并配有现成的 DGX Spark 剧本,可快速搭建本地环境。查看适用于 DGX Spark (https://build.nvidia.com/spark/vllm)、RTX PRO (https://build.nvidia.com/rtx/vllm) 和 DGX Station (https://build.nvidia.com/station/vllm) 的 vLLM 剧本。
在 Hugging Face 上试用 Diffusion Gemma,或通过 NVIDIA 托管的应用程序接口免费在 build.nvidia.com (https://build.nvidia.com/) 上进行测试。
阅读 NVIDIA 技术博客 (https://developer.nvidia.com/blog/?p=118305) 和 Google DeepMind 公告 (https://blog.google/innovation-and-ai/technology/developers-tools/diffusion-gemma-faster-text-generation/) 深入了解其架构和本地部署。
## **#ICYMI:RTX AI Garage 最新动态**
🎬 **NVIDIA 研究人员发布了 SANA-WM**,这是一款开源世界模型,能将单张图像和一条相机路径转换为长达一分钟、精确 6 自由度控制的 720p 视频。其精简版仅 26 亿参数,能在单个 NVIDIA GeForce RTX 5090 GPU 上,以 NVFP4 格式在 34 秒内生成完整的 60 秒剪辑——与同类开放模型相比,吞吐量提升高达 36 倍,且仅运行于一块 GPU。阅读论文。 (https://arxiv.org/pdf/2605.15178)
🛠️ **Windows 智能体构建工具包现已完整**——NVIDIA 与微软 (https://developer.nvidia.com/blog/build-personal-ai-agents-on-windows-pcs-with-new-tools-from-microsoft-and-nvidia/) 推出了原版 Windows 上的交钥匙智能体沙箱——Microsoft eXecution Containers 加上 NVIDIA OpenShell 运行时——同时智能体推理速度提升高达 2 倍,并原生支持 Hermes Agent。
**🤖****DGX Spark 从开箱到运行智能体只需几分钟**——流式 NVIDIA NemoClaw 安装让开发者快速拥有一个可运行的本地智能体,搭载 Qwen3.6-35B,在 vLLM 上运行速度提升高达 2.6 倍。而 NVIDIA Sync 中的新集群助手可将最多四台 DGX Spark 单元连接成一个 512GB 池——足以处理约 4000 亿参数的模型。
*在 Facebook (https://www.facebook.com/NVIDIARTXSpark/)、Instagram (https://www.instagram.com/nvidiartxspark)、TikTok (https://www.tiktok.com/@nvidiartxspark) 和 X (https://x.com/NVIDIARTXSpark) 上关注 RTX Spark——并订阅 RTX Spark 新闻通讯 (https://www.nvidia.com/en-us/ai-on-rtx/?modal=subscribe-ai) 以了解最新动态。*
*请参阅有关软件产品信息的通知 (https://www.nvidia.com/en-eu/about-nvidia/terms-of-service/)。*
相似文章
从 RTX 到 Spark:NVIDIA 加速 Gemma 4 赋能本地智能体 AI
NVIDIA 与谷歌合作优化 Gemma 4 模型,以实现在 RTX GPU、DGX Spark 和 Jetson 设备上的本地部署,从而支持高效的端侧智能体 AI,具备推理、编程、多模态能力以及 35 多种语言的支持。
谷歌最新DiffusionGemma开源AI模型速度提升4倍
谷歌发布了DiffusionGemma,这是一个实验性的开源文本生成扩散模型,相比自回归模型实现了4倍速度提升,并针对本地处理进行了优化。
DiffusionGemma: 文本生成速度提升4倍
Google推出DiffusionGemma,这是一个实验性的26B MoE开源模型,通过文本扩散技术,在GPU上实现高达4倍的文本生成速度提升,针对速度要求高的交互式本地工作流。
DiffusionGemma
Google 发布了 DiffusionGemma,这是一个采用 Apache 2 许可证的开源权重文本生成模型(总参数量 26B,活跃参数量 4B),通过 NVIDIA 的 NIM 云 API 展示了极高的推理速度。
DiffusionGemma:开发者指南 - Google Developers Blog
DiffusionGemma 是 Google DeepMind 推出的全新实验模型,可在 256 令牌画布上实现并行生成,在 GPU 上令牌生成速度提升高达 4 倍。本开发者指南阐述了其架构、双向上下文,并提供了用于解决数独的微调配方。