来自NVIDIA的Nemotron-Labs-Diffusion
摘要
NVIDIA发布了Nemotron-Labs-Diffusion模型系列(3B至14B),该系列同时支持AR解码和扩散解码,并采用新颖的自推测机制,在多种硬件平台上相比标准AR和Eagle3方法实现了显著加速(最高达4倍)。
模型概述 Nemotron-Labs-Diffusion是一种三模式语言模型,通过在推理时简单地切换同一模型的注意力模式,同时支持AR解码和基于扩散的并行解码。这两种模式的协同作用实现了第三种模式——自推测:同一模型利用共享KV缓存执行基于扩散的并行草稿和AR验证,从而实现高接受长度和解码效率。仅通过更改注意力模式即可实现无缝模式切换,使单个模型在不同部署场景的不同并发级别下都能实现高效率。
https://preview.redd.it/mwyq7b7hx42h1.png?width=3915&format=png&auto=webp&s=744bd87267338a6236269a8d915b185cff8a82d2
# 亮点
* 先进的SOTA 3B、8B、14B密集型语言模型系列(包含基础、指令和视觉语言变体),支持AR、扩散和自推测,重点关注解码效率。
* 生成过程从内存密集型转向计算密集型。模型权重仅加载一次,并在生成过程中重复用于计算多个token。
* 自推测使用扩散进行草稿、AR进行验证,为MTP方法提供了更强的替代方案:
* 在SGLang中,与Qwen3-8B-Eagle3相比,接受长度提高3倍,速度提升2.2倍。
* 与Qwen3-8B(无MTP)相比,每次前向传播的token数增加5.9倍,且精度相同。
* 跨平台的实际设备加速:
* DGX Spark(8B,并发1):使用w4a16,112 tok/sec对比AR的41.8 tok/sec,速度提升2.7倍。
* GB200(8B,并发1):850 tok/sec对比AR的253 tok/sec和Eagle3的360 tok/sec,速度提升3.3倍。自定义CUDA内核进一步提升至1015 tok/sec(4倍)。
* 扩散速度极限分析表明,通过更好的采样,单用户吞吐量可进一步翻倍(相比当前最佳)——未来研究方向。
[https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-VLM-8B](https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-VLM-8B)
[https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-14B-Base](https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-14B-Base)
[https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-14B](https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-14B)
[https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-8B-Base](https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-8B-Base)
[https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-8B](https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-8B)
[https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-3B-Base](https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-3B-Base)
[https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-3B](https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-3B)
#
相似文章
nvidia/Nemotron-Labs-Diffusion-14B
NVIDIA发布了Nemotron-Labs-Diffusion,这是一个三模式语言模型系列(3B、8B、14B),支持自回归(AR)、扩散和自推测解码,相比标准AR解码实现了2.7倍到4倍的加速。
@PavloMolchanov: 我们发布了Nemotron-Labs-Diffusion - 首个三模式语言模型系列(3B/8B/14B),可在自回归……之间切换
NVIDIA发布了Nemotron-Labs-Diffusion,这是首个三模式语言模型系列(3B/8B/14B),通过改变注意力模式在自回归、扩散和自推测解码之间切换,实现高达4倍的实际吞吐量。
Nemotron-Labs-Diffusion: 统一自回归、扩散与自推测解码的三模式语言模型
本文介绍了Nemotron-Labs-Diffusion,一种三模式语言模型,统一了自回归、扩散与自推测解码,与现有模型相比实现了更优的吞吐量和效率。
NVIDIA 发布了 Nemotron-TwoTower-30B-A3B-Base-BF16,这是一种基于 Nemotron 3 Nano 30B-A3B 主干构建的异常扩散型语言模型。
NVIDIA 发布了 Nemotron-TwoTower-30B-A3B-Base-BF16,这是一种基于扩散的语言模型,采用逐块自回归扩散方法,通过对令牌块进行迭代去噪来生成文本,实现了自回归基线 2.42 倍的生成吞吐量,同时保留了基准测试质量 98.7% 的水平。
迈向光速文本生成:Nemotron-Labs扩散语言模型
NVIDIA推出Nemotron-Labs Diffusion,这是一系列扩散语言模型,可并行生成文本并迭代优化,从而提供更快的生成速度并支持修订之前的令牌。