Nemotron-Labs-Diffusion: 统一自回归、扩散与自推测解码的三模式语言模型

Hugging Face Daily Papers 论文

摘要

本文介绍了Nemotron-Labs-Diffusion,一种三模式语言模型,统一了自回归、扩散与自推测解码,与现有模型相比实现了更优的吞吐量和效率。

我们介绍了Nemotron-Labs-Diffusion,一种三模式语言模型(LM),在单一架构中统一了自回归(AR)、扩散和自推测解码。通过联合的AR-扩散目标进行训练,Nemotron-Labs-Diffusion可以切换模式以在多种部署场景和并发级别下保持高吞吐量。我们的研究表明:(1)AR和扩散目标是互补的:扩散改进了前瞻规划,而AR提供了从左到右的语言先验。(2)在自推测模式下,扩散负责草稿生成,AR负责验证,在接收率和实际设备效率上均优于多词元预测(MTP)方法。(3)进一步的光速分析揭示了扩散的长期潜力,在最优采样器下,每次前向传播的token数比自推测多出76.5%。在扩展到3B、8B和14B参数规模后,我们的Nemotron-Labs-Diffusion系列(包括基础版、指令版和视觉语言模型)在准确性和速度上均持续优于最先进的开源AR和扩散LM。例如,Nemotron-Labs-Diffusion-8B每次前向传播解码的token数是Qwen3-8B的6倍,同时准确性相当,在GB200 GPU上使用SGLang的SPEED-Bench测试中实现了4倍更高的吞吐量。
查看原文
查看缓存全文

缓存时间: 2026/07/08 02:47

论文页面 - Nemotron-Labs-Diffusion:统一自回归、扩散与自推测解码的三模式语言模型

来源: https://huggingface.co/papers/2607.05722 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

Nemotron-Labs-Diffusion 是一种三模式语言模型,融合了自回归、扩散与自推测解码,相比现有模型实现了更优的吞吐量与效率。

我们提出 Nemotron-Labs-Diffusion,一种三模式语言模型(https://huggingface.co/papers?q=language%20model),它在单一架构内统一了自回归(AR)、扩散(diffusion)与自推测解码(https://huggingface.co/papers?q=self-speculation%20decoding)。通过联合 AR-扩散目标(https://huggingface.co/papers?q=joint%20AR-diffusion%20objective)训练,Nemotron-Labs-Diffusion 可切换模式,以在不同部署场景和并发水平下维持高吞吐量(https://huggingface.co/papers?q=throughput)。我们的研究表明:(1)AR 与扩散目标具有互补性:扩散有助于前瞻规划(https://huggingface.co/papers?q=lookahead%20planning),而 AR 提供从左到右的语言先验(https://huggingface.co/papers?q=linguistic%20priors)。(2)在自推测模式下,扩散负责草稿生成,AR 负责验证,在接收率与真实设备效率上均优于多 token 预测(https://huggingface.co/papers?q=multi-token%20prediction)(MTP)方法。(3)光速分析(https://huggingface.co/papers?q=speed-of-light%20analysis)进一步展示了扩散的长期潜力:在最优采样器下,每次前向传播可生成比自推测多 76.5% 的 token。通过扩展到 3B、8B 和 14B 参数规模,我们的 Nemotron-Labs-Diffusion 系列(包括基座、指令与视觉语言模型(https://huggingface.co/papers?q=language%20model))在准确率和速度上持续超越最先进的开源自回归与扩散语言模型。例如,Nemotron-Labs-Diffusion-8B 每次前向传播解码的 token 数量是 Qwen3-8B 的 6 倍,在准确率相当的情况下,使用 SGLang(https://huggingface.co/papers?q=SGLang)在 GB200 GPU(https://huggingface.co/papers?q=GB200%20GPU)上的 SPEED-Bench(https://huggingface.co/papers?q=SPEED-Bench)中实现了 4 倍的吞吐量提升。

查看 arXiv 页面(https://arxiv.org/abs/2607.05722)查看 PDF(https://arxiv.org/pdf/2607.05722)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.05722)

在您的 agent 中获取该论文:

hf papers read 2607\.05722

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

暂无模型关联本文

请在模型 README.md 中引用 arxiv.org/abs/2607.05722 以从本页链接。

引用本文的数据集0

暂无数据集关联本文

请在数据集 README.md 中引用 arxiv.org/abs/2607.05722 以从本页链接。

引用本文的 Space0

暂无 Space 关联本文

请在 Space README.md 中引用 arxiv.org/abs/2607.05722 以从本页链接。

包含本文的收藏集0

暂无包含本文的收藏集

请将本文添加至收藏集(https://huggingface.co/new-collection)以从本页链接。

相似文章

nvidia/Nemotron-Labs-Diffusion-14B

Hugging Face Models Trending

NVIDIA发布了Nemotron-Labs-Diffusion,这是一个三模式语言模型系列(3B、8B、14B),支持自回归(AR)、扩散和自推测解码,相比标准AR解码实现了2.7倍到4倍的加速。

来自NVIDIA的Nemotron-Labs-Diffusion

Reddit r/LocalLLaMA

NVIDIA发布了Nemotron-Labs-Diffusion模型系列(3B至14B),该系列同时支持AR解码和扩散解码,并采用新颖的自推测机制,在多种硬件平台上相比标准AR和Eagle3方法实现了显著加速(最高达4倍)。