Nemotron-Labs-Diffusion: 统一自回归、扩散与自推测解码的三模式语言模型
摘要
本文介绍了Nemotron-Labs-Diffusion,一种三模式语言模型,统一了自回归、扩散与自推测解码,与现有模型相比实现了更优的吞吐量和效率。
查看缓存全文
缓存时间: 2026/07/08 02:47
论文页面 - Nemotron-Labs-Diffusion:统一自回归、扩散与自推测解码的三模式语言模型
来源: https://huggingface.co/papers/2607.05722 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
Nemotron-Labs-Diffusion 是一种三模式语言模型,融合了自回归、扩散与自推测解码,相比现有模型实现了更优的吞吐量与效率。
我们提出 Nemotron-Labs-Diffusion,一种三模式语言模型(https://huggingface.co/papers?q=language%20model),它在单一架构内统一了自回归(AR)、扩散(diffusion)与自推测解码(https://huggingface.co/papers?q=self-speculation%20decoding)。通过联合 AR-扩散目标(https://huggingface.co/papers?q=joint%20AR-diffusion%20objective)训练,Nemotron-Labs-Diffusion 可切换模式,以在不同部署场景和并发水平下维持高吞吐量(https://huggingface.co/papers?q=throughput)。我们的研究表明:(1)AR 与扩散目标具有互补性:扩散有助于前瞻规划(https://huggingface.co/papers?q=lookahead%20planning),而 AR 提供从左到右的语言先验(https://huggingface.co/papers?q=linguistic%20priors)。(2)在自推测模式下,扩散负责草稿生成,AR 负责验证,在接收率与真实设备效率上均优于多 token 预测(https://huggingface.co/papers?q=multi-token%20prediction)(MTP)方法。(3)光速分析(https://huggingface.co/papers?q=speed-of-light%20analysis)进一步展示了扩散的长期潜力:在最优采样器下,每次前向传播可生成比自推测多 76.5% 的 token。通过扩展到 3B、8B 和 14B 参数规模,我们的 Nemotron-Labs-Diffusion 系列(包括基座、指令与视觉语言模型(https://huggingface.co/papers?q=language%20model))在准确率和速度上持续超越最先进的开源自回归与扩散语言模型。例如,Nemotron-Labs-Diffusion-8B 每次前向传播解码的 token 数量是 Qwen3-8B 的 6 倍,在准确率相当的情况下,使用 SGLang(https://huggingface.co/papers?q=SGLang)在 GB200 GPU(https://huggingface.co/papers?q=GB200%20GPU)上的 SPEED-Bench(https://huggingface.co/papers?q=SPEED-Bench)中实现了 4 倍的吞吐量提升。
查看 arXiv 页面(https://arxiv.org/abs/2607.05722)查看 PDF(https://arxiv.org/pdf/2607.05722)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.05722)
在您的 agent 中获取该论文:
hf papers read 2607\.05722
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
暂无模型关联本文
请在模型 README.md 中引用 arxiv.org/abs/2607.05722 以从本页链接。
引用本文的数据集0
暂无数据集关联本文
请在数据集 README.md 中引用 arxiv.org/abs/2607.05722 以从本页链接。
引用本文的 Space0
暂无 Space 关联本文
请在 Space README.md 中引用 arxiv.org/abs/2607.05722 以从本页链接。
包含本文的收藏集0
暂无包含本文的收藏集
请将本文添加至收藏集(https://huggingface.co/new-collection)以从本页链接。
相似文章
@PavloMolchanov: 我们发布了Nemotron-Labs-Diffusion - 首个三模式语言模型系列(3B/8B/14B),可在自回归……之间切换
NVIDIA发布了Nemotron-Labs-Diffusion,这是首个三模式语言模型系列(3B/8B/14B),通过改变注意力模式在自回归、扩散和自推测解码之间切换,实现高达4倍的实际吞吐量。
nvidia/Nemotron-Labs-Diffusion-14B
NVIDIA发布了Nemotron-Labs-Diffusion,这是一个三模式语言模型系列(3B、8B、14B),支持自回归(AR)、扩散和自推测解码,相比标准AR解码实现了2.7倍到4倍的加速。
Set Diffusion:在自回归与扩散之间插值令牌顺序以实现快速灵活的解码
Set Diffusion 引入了一类新的语言模型,通过在灵活位置、灵活长度的令牌集合上分解令牌生成,在自回归模型和扩散模型之间进行插值。这使得解码速度更快,令牌排序更灵活,在推理、摘要和无条件生成任务上实现了更好的速度-质量权衡。
来自NVIDIA的Nemotron-Labs-Diffusion
NVIDIA发布了Nemotron-Labs-Diffusion模型系列(3B至14B),该系列同时支持AR解码和扩散解码,并采用新颖的自推测机制,在多种硬件平台上相比标准AR和Eagle3方法实现了显著加速(最高达4倍)。
迈向光速文本生成:Nemotron-Labs扩散语言模型
NVIDIA推出Nemotron-Labs Diffusion,这是一系列扩散语言模型,可并行生成文本并迭代优化,从而提供更快的生成速度并支持修订之前的令牌。