DiffusionGemma Technical Report
Summary
DiffusionGemma is an experimental open-weight language model that generates text via discrete diffusion rather than token-by-token decoding, enabling exceptionally high-speed generation.
View Cached Full Text
Cached at: 08/04/26, 07:37 AM
# DiffusionGemma Technical Report Source: [https://arxiv.org/abs/2608.00146](https://arxiv.org/abs/2608.00146) Authors:[DiffusionGemma Team](https://arxiv.org/search/cs?searchtype=author&query=DiffusionGemma+Team):[Adrien Ali Taïga](https://arxiv.org/search/cs?searchtype=author&query=Ta%C3%AFga,+A+A),[James Assiene](https://arxiv.org/search/cs?searchtype=author&query=Assiene,+J),[Daniele Calandriello](https://arxiv.org/search/cs?searchtype=author&query=Calandriello,+D),[Rahma Chaabouni](https://arxiv.org/search/cs?searchtype=author&query=Chaabouni,+R),[João Gante](https://arxiv.org/search/cs?searchtype=author&query=Gante,+J),[Tamara von Glehn](https://arxiv.org/search/cs?searchtype=author&query=von+Glehn,+T),[Nate Keating](https://arxiv.org/search/cs?searchtype=author&query=Keating,+N),[Chris Knutsen](https://arxiv.org/search/cs?searchtype=author&query=Knutsen,+C),[Martin Kukla](https://arxiv.org/search/cs?searchtype=author&query=Kukla,+M),[Tianlin Liu](https://arxiv.org/search/cs?searchtype=author&query=Liu,+T),[Ivan Lobov](https://arxiv.org/search/cs?searchtype=author&query=Lobov,+I),[Ofir Nabati](https://arxiv.org/search/cs?searchtype=author&query=Nabati,+O),[João Gabriel Oliveira](https://arxiv.org/search/cs?searchtype=author&query=Oliveira,+J+G),[Nicolas Perez\-Nieves](https://arxiv.org/search/cs?searchtype=author&query=Perez-Nieves,+N),[Nastasia Prutianova](https://arxiv.org/search/cs?searchtype=author&query=Prutianova,+N),[Bobak Shahriari](https://arxiv.org/search/cs?searchtype=author&query=Shahriari,+B),[Jean Tarbouriech](https://arxiv.org/search/cs?searchtype=author&query=Tarbouriech,+J),[Pavel Tyletski](https://arxiv.org/search/cs?searchtype=author&query=Tyletski,+P),[Çağlar Ünlü](https://arxiv.org/search/cs?searchtype=author&query=%C3%9Cnl%C3%BC,+%C3%87),[Cindy Wu](https://arxiv.org/search/cs?searchtype=author&query=Wu,+C),[Glenn Cameron](https://arxiv.org/search/cs?searchtype=author&query=Cameron,+G),[Jerome Connor](https://arxiv.org/search/cs?searchtype=author&query=Connor,+J),[Sertan Girgin](https://arxiv.org/search/cs?searchtype=author&query=Girgin,+S),[Maarten Grootendorst](https://arxiv.org/search/cs?searchtype=author&query=Grootendorst,+M),[Alon Levkovitch](https://arxiv.org/search/cs?searchtype=author&query=Levkovitch,+A),[Eliya Nachmani](https://arxiv.org/search/cs?searchtype=author&query=Nachmani,+E),[Omar Sanseviero](https://arxiv.org/search/cs?searchtype=author&query=Sanseviero,+O),[Piotr Stanczyk](https://arxiv.org/search/cs?searchtype=author&query=Stanczyk,+P),[Quentin Berthet](https://arxiv.org/search/cs?searchtype=author&query=Berthet,+Q),[Andrew Campbell](https://arxiv.org/search/cs?searchtype=author&query=Campbell,+A),[Clément Crepy](https://arxiv.org/search/cs?searchtype=author&query=Crepy,+C),[Valentin De Bortoli](https://arxiv.org/search/cs?searchtype=author&query=De+Bortoli,+V),[Arnaud Doucet](https://arxiv.org/search/cs?searchtype=author&query=Doucet,+A),[Romuald Elie](https://arxiv.org/search/cs?searchtype=author&query=Elie,+R),[Alexandre Galashov](https://arxiv.org/search/cs?searchtype=author&query=Galashov,+A),[Klaus Greff](https://arxiv.org/search/cs?searchtype=author&query=Greff,+K),[Alexis Jacq](https://arxiv.org/search/cs?searchtype=author&query=Jacq,+A),[David Ruhe](https://arxiv.org/search/cs?searchtype=author&query=Ruhe,+D),[Yu\-Han Wu](https://arxiv.org/search/cs?searchtype=author&query=Wu,+Y),[Sebastian Flennerhag](https://arxiv.org/search/cs?searchtype=author&query=Flennerhag,+S),[Brendan O'Donoghue](https://arxiv.org/search/cs?searchtype=author&query=O%27Donoghue,+B),[George Scrivener](https://arxiv.org/search/cs?searchtype=author&query=Scrivener,+G),[Shantanu Thakoor](https://arxiv.org/search/cs?searchtype=author&query=Thakoor,+S) [View PDF](https://arxiv.org/pdf/2608.00146) > Abstract:We introduce DiffusionGemma, an experimental open\-weight language model that uses discrete diffusion to generate text at exceptionally high speed\. Rather than decoding one token at a time, DiffusionGemma iteratively refines blocks of 256 tokens in parallel, avoiding the sequential decoding bottleneck of conventional autoregressive \(AR\) large language models\. Instead of training from scratch, we obtain DiffusionGemma by fine\-tuning the mixture\-of\-experts Gemma 4 model with 3\.8B activated and 25\.2B total parameters\. Our compute\-efficient two\-stage training pipeline uses fewer than 10% of the starting AR model's total training token budget\. The first stage uses supervised fine\-tuning to teach bidirectional denoising, while the second stage combines reinforcement learning with sampler distillation to jointly improve generation quality and inference efficiency\. DiffusionGemma establishes a new Pareto frontier for the trade\-off between generation speed and model capability\. Averaged across our full evaluation suite, it generates around 20 tokens per forward pass and achieves roughly 1,500 output tokens per second on a single NVIDIA H100 GPU, which is substantially faster than AR models even with state\-of\-the\-art speculative decoding\. DiffusionGemma also retains the starting model's support for thinking mode, multimodal inputs, and long contexts\. Despite diffusion fine\-tuning, it remains capable of AR generation with only minor performance degradation, suggesting a path toward hybrid diffusion\-AR decoding\. ## Submission history From: Jean Tarbouriech \[[view email](https://arxiv.org/show-email/788d4af8/2608.00146)\] **\[v1\]**Fri, 31 Jul 2026 16:11:46 UTC \(6,116 KB\)
Similar Articles
DiffusionGemma
Google released DiffusionGemma, an open-weight text generation model (26B parameters, 4B active) under Apache 2 license, demonstrating high inference speeds via NVIDIA's NIM cloud API.
DiffusionGemma: 4x Faster Text Generation
Google introduces DiffusionGemma, an experimental 26B MoE open model that achieves up to 4x faster text generation on GPUs using text diffusion, targeting speed-critical interactive local workflows.
@_philschmid: Gemma goes diffusion! DiffusionGemma with up to 1000+ tokens per second! - Built on Gemma 4 as a 26B MoE model. - 3.8B …
DiffusionGemma, a 26B MoE model based on Gemma 4, achieves over 1000 tokens per second using diffusion for text generation in 256-token blocks, fitting in 18GB VRAM with quantization, released under Apache 2.0.
DiffusionGemma: The Developer Guide- Google Developers Blog
DiffusionGemma is a new experimental model from Google DeepMind that uses parallel generation on a 256-token canvas, achieving up to 4x faster token generation on GPUs. This developer guide explains its architecture, bidirectional context, and includes a fine-tuning recipe for solving Sudoku.
Coding Diffusion Gemma from scratch
Tutorial on implementing a diffusion model based on Google's Gemma architecture from scratch.