迈向光速文本生成:Nemotron-Labs扩散语言模型
摘要
NVIDIA推出Nemotron-Labs Diffusion,这是一系列扩散语言模型,可并行生成文本并迭代优化,从而提供更快的生成速度并支持修订之前的令牌。
查看缓存全文
缓存时间: 2026/05/23 00:19
迈向光速文本生成:Nemotron-Labs扩散语言模型
来源:https://huggingface.co/blog/nvidia/nemotron-labs-diffusion
返回文章列表 (https://huggingface.co/blog)
- 模型、训练方案与技术报告的快速链接 (https://huggingface.co/blog/nvidia/nemotron-labs-diffusion#quick-links-to-the-models-training-recipe-and-technical-report)
- 同一模型支持三种生成模式 (https://huggingface.co/blog/nvidia/nemotron-labs-diffusion#three-generation-modes-in-one-model)
- 性能亮点 (https://huggingface.co/blog/nvidia/nemotron-labs-diffusion#performance-highlights)
- 我们如何训练 Nemotron-Labs Diffusion (https://huggingface.co/blog/nvidia/nemotron-labs-diffusion#how-we-trained-nemotron-labs-diffusion)
- 通过 SGLang 进行部署与推理 (https://huggingface.co/blog/nvidia/nemotron-labs-diffusion#deployment-and-inference-through-sglang)
- 立即上手 (https://huggingface.co/blog/nvidia/nemotron-labs-diffusion#get-started-today)
1-headline-final (https://cdn-uploads.huggingface.co/production/uploads/68fbf4dfb3a931deae49375f/qvMqz8ohVx7_5oGkjaCI-.gif)
大型语言模型(LLM)已成为代码生成、数学解题、文本摘要、文档理解及许多其他开发者工作流中的默认接口。然而,许多LLM依然采用相同的方式生成文本:一次生成一个 token,每个 token 依赖于它之前出现的 token。因此,这类模型被称为自回归模型,因为它们会消费自身生成的输出。
这种自回归方法取得了非凡的成功:训练稳定、服务简单,是现代语言建模进步的重要原因。但它也带来了硬性限制:每生成一个新 token,就需要一次完整的模型前向传递,并且所有权重必须在计算开始前从内存加载。对于构建延迟敏感型应用、使用较小批处理大小或试图更好地利用现代 GPU 的开发者来说,逐 token 生成可能会造成性能浪费,因为 GPU 的大部分时间花在了内存操作上,而非计算上。
此外,自回归模型一旦生成一个 token,就无法更改,它们本质上不具备修正之前 token 的能力。因此,错误可能会在生成过程中不断累积。
Nemotron-Labs Diffusion 开辟了一条新道路:扩散语言模型(DLM)通过并行生成多个 token,然后在多个步骤中逐步优化已生成的 token。这些模型不仅能更好地利用现代 GPU 的计算模型,带来显著的运行时性能优势,还能修正已生成的 token,使其更适合对现有文本进行改写以及应对“填空”任务。这种“生成并优化”的特性还提供了一种内置的方式来控制推理预算。通过减少优化步骤的数量,可以在运行时降低这些模型的计算需求。
https://huggingface.co/blog/nvidia/nemotron-labs-diffusion#quick-links-to-the-models-training-recipe-and-technical-report 模型、训练方案与技术报告的快速链接
Nemotron-Labs Diffusion 系列包括3B、8B和14B三种规模的文本模型,均采用商业友好的 NVIDIA Nemotron 开放模型许可证发布;此外还有一个8B规模的视觉语言模型(VLM),采用 NVIDIA 源代码许可证发布,提供广泛的研究灵活性。在整个系列中,NVIDIA 同时发布了基础模型和经过指令微调的对话变体。NVIDIA 还通过 NVIDIA Megatron Bridge 框架 (https://github.com/NVIDIA-NeMo/Megatron-Bridge/) 发布了训练这些模型的代码。
- HuggingFace 上的 NVIDIA Nemotron-Labs Diffusion 模型集合 (https://huggingface.co/collections/nvidia/nemotron-labs-diffusion)
- GitHub 上的训练方案和代码 (https://github.com/NVIDIA-NeMo/Megatron-Bridge/tree/main/examples/diffusion/recipes/nemotron_labs_diffusion)
- 技术报告 (http://bit.ly/Nemotron-Labs-Diffusion-Report)
https://huggingface.co/blog/nvidia/nemotron-labs-diffusion#three-generation-modes-in-one-model 同一模型支持三种生成模式
2-tri-mode-final (https://cdn-uploads.huggingface.co/production/uploads/68fbf4dfb3a931deae49375f/luIrivJsY3wcROc4UpJtl.gif)
Nemotron-Labs Diffusion 围绕一个简单的理念设计:自回归生成和扩散生成不应该是独立的模型族,而应是同一模型具备的能力。该模型支持三种生成模式:
自回归模式 像标准的从左到右 LLM 一样运行。这保持了开发者已经熟悉的生成工作流的兼容性。
扩散模式 逐块生成,在多个步骤中逐步生成 token。
自推测模式 使用扩散来草拟多个候选 token,然后使用自回归解码来验证它们。这结合了扩散式草拟的速度潜力与 AR 验证的可靠性。
这种灵活设计是满足速度和准确性的关键开发者接口特性,即使在工作负载批次大小不可预测或单查询(批次大小=1)的情况下也是如此。选择所需的推理模式几乎不需要修改应用层,因为它是一个部署时设置。因此,开发者可以无缝切换他们当前使用的模型,或使用 Nemotron-Labs Diffusion 的各种推理模式来实现超快生成速度。
https://huggingface.co/blog/nvidia/nemotron-labs-diffusion#performance-highlights 性能亮点
Screenshot from 2026-05-22 15-49-43 (https://cdn-uploads.huggingface.co/production/uploads/68fbf4dfb3a931deae49375f/42wkjDTLZp-bOgQT7r8sH.png)
Nemotron-Labs Diffusion 8B 的平均准确率比 Qwen3 8B 提高了1.2%。比较以“每次前向传递的 token 数”(TPF,一种独立于硬件衡量 token 解码效率的方式)衡量的推理速度,扩散模式达到 AR 模型的2.6倍 TPF,而自推测模式在线性自推测下进一步提高到6倍,在二次自推测下达到6.4倍,同时在评估任务中保持相当的准确率。
https://huggingface.co/blog/nvidia/nemotron-labs-diffusion#how-we-trained-nemotron-labs-diffusion 我们如何训练 Nemotron-Labs Diffusion
扩散语言模型多年来一直很有前景,但历史上存在实际障碍:准确率低于强大的 AR 模型,训练更加困难,以及与 KV 缓存的兼容性有限。
最近的研究改变了这一方向。Efficient-DLM (https://arxiv.org/abs/2512.14067) 表明,预训练的 AR 模型可以通过持续预训练并将注意力机制改为逐块方式,转换为扩散语言模型。这种设计有助于保持 AR 模型的能力,同时实现 KV 缓存友好的并行解码。
Nemotron-Labs Diffusion 基于相同的实用见解:为现有 AR 模型增加扩散能力。该模型通过联合 AR 和扩散目标进行训练,使其能够在保留初始 AR 训练所获知识的同时,通过扩散增加并行草拟能力。模型在来自 NVIDIA Nemotron 预训练数据集 (https://huggingface.co/collections/nvidia/nemotron-pre-training-datasets) 的1.3T token 上进行了预训练,并额外使用来自 NVIDIA Nemotron 后训练数据集 (https://huggingface.co/collections/nvidia/nemotron-post-training-v3) 的45B token 进行了监督微调阶段。
https://huggingface.co/blog/nvidia/nemotron-labs-diffusion#deployment-and-inference-through-sglang 通过 SGLang 进行部署与推理
Nemotron-Labs Diffusion 模型的部署很快将在 SGLang 的主分支中得到支持。在撰写本文时,推理支持可通过 GitHub 上的此 issue 请求 (https://github.com/sgl-project/sglang/pull/25803) 获取。
巧妙之处在于,集成使得你可以通过算法配置中的一行代码,以三种不同方式服务相同的检查点:
- 纯自回归 — 设置
ar_mode=true,模型像任何其他因果 LM 一样工作。适合作为准确性参考,或者只是想对照纯 AR 输出进行快速检查。 - 扩散模式(FastDiffuser) — 原始吞吐量的主角。模型通过迭代去噪一次填充一个32 token 的块,并使用置信度阈值决定每个步骤中哪些 token “足够好”可以提交。
- 自推测(LinearSpec) — 这是我们最喜欢的。同一模型双向草拟一个块,然后因果地验证它;任何匹配的前缀都会被提交。在温度0下,输出与 AR 无损,但在 B200 上对 speedbench 数据集达到约865 tok/s——大约是同一硬件上自回归基线的4倍。
https://huggingface.co/blog/nvidia/nemotron-labs-diffusion#get-started-today 立即上手
Nemotron-Labs Diffusion 将扩散式生成转变为开发者可以实际使用的形式:开放模型、熟悉的 AR 兼容性、扩散解码以及自推测加速,全部集成在一个模型族中。使用 Nemotron-Labs Diffusion,开发者获得了一种新的方式来草拟、优化、验证和加速文本生成,而无需修改他们的应用。
要开始使用,请探索 Nemotron-Labs Diffusion 模型族 (https://huggingface.co/collections/nvidia/nemotron-labs-diffusion),阅读技术报告 (http://bit.ly/Nemotron-Labs-Diffusion-Report),并尝试可用的训练方案 (https://github.com/NVIDIA-NeMo/Megatron-Bridge/tree/main/examples/diffusion/recipes/nemotron_labs_diffusion)。
相似文章
@NVIDIAAI: 大多数语言模型一次只生成一个token。我们刚刚发布了Nemotron-Labs-Diffusion,一个扩散语言模型系列…
NVIDIA发布了Nemotron-Labs-Diffusion,这是一个扩散语言模型系列,可以并行生成多个token,从而实现更快的推理和更好的GPU利用率,模型规模从3B到14B,包括视觉语言变体。
NVIDIA 发布了 Nemotron-TwoTower-30B-A3B-Base-BF16,这是一种基于 Nemotron 3 Nano 30B-A3B 主干构建的异常扩散型语言模型。
NVIDIA 发布了 Nemotron-TwoTower-30B-A3B-Base-BF16,这是一种基于扩散的语言模型,采用逐块自回归扩散方法,通过对令牌块进行迭代去噪来生成文本,实现了自回归基线 2.42 倍的生成吞吐量,同时保留了基准测试质量 98.7% 的水平。
@PavloMolchanov: 我们发布了Nemotron-Labs-Diffusion - 首个三模式语言模型系列(3B/8B/14B),可在自回归……之间切换
NVIDIA发布了Nemotron-Labs-Diffusion,这是首个三模式语言模型系列(3B/8B/14B),通过改变注意力模式在自回归、扩散和自推测解码之间切换,实现高达4倍的实际吞吐量。
Nemotron-Labs-Diffusion: 统一自回归、扩散与自推测解码的三模式语言模型
本文介绍了Nemotron-Labs-Diffusion,一种三模式语言模型,统一了自回归、扩散与自推测解码,与现有模型相比实现了更优的吞吐量和效率。
DiffusionGemma: 文本生成速度提升4倍
Google推出DiffusionGemma,这是一个实验性的26B MoE开源模型,通过文本扩散技术,在GPU上实现高达4倍的文本生成速度提升,针对速度要求高的交互式本地工作流。