来自NVIDIA的Nemotron-Labs-Diffusion

Reddit r/LocalLLaMA 模型

摘要

NVIDIA发布了Nemotron-Labs-Diffusion模型系列(3B至14B),该系列同时支持AR解码和扩散解码,并采用新颖的自推测机制,在多种硬件平台上相比标准AR和Eagle3方法实现了显著加速(最高达4倍)。

模型概述 Nemotron-Labs-Diffusion是一种三模式语言模型,通过在推理时简单地切换同一模型的注意力模式,同时支持AR解码和基于扩散的并行解码。这两种模式的协同作用实现了第三种模式——自推测:同一模型利用共享KV缓存执行基于扩散的并行草稿和AR验证,从而实现高接受长度和解码效率。仅通过更改注意力模式即可实现无缝模式切换,使单个模型在不同部署场景的不同并发级别下都能实现高效率。 https://preview.redd.it/mwyq7b7hx42h1.png?width=3915&format=png&auto=webp&s=744bd87267338a6236269a8d915b185cff8a82d2 # 亮点 * 先进的SOTA 3B、8B、14B密集型语言模型系列(包含基础、指令和视觉语言变体),支持AR、扩散和自推测,重点关注解码效率。 * 生成过程从内存密集型转向计算密集型。模型权重仅加载一次,并在生成过程中重复用于计算多个token。 * 自推测使用扩散进行草稿、AR进行验证,为MTP方法提供了更强的替代方案: * 在SGLang中,与Qwen3-8B-Eagle3相比,接受长度提高3倍,速度提升2.2倍。 * 与Qwen3-8B(无MTP)相比,每次前向传播的token数增加5.9倍,且精度相同。 * 跨平台的实际设备加速: * DGX Spark(8B,并发1):使用w4a16,112 tok/sec对比AR的41.8 tok/sec,速度提升2.7倍。 * GB200(8B,并发1):850 tok/sec对比AR的253 tok/sec和Eagle3的360 tok/sec,速度提升3.3倍。自定义CUDA内核进一步提升至1015 tok/sec(4倍)。 * 扩散速度极限分析表明,通过更好的采样,单用户吞吐量可进一步翻倍(相比当前最佳)——未来研究方向。 [https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-VLM-8B](https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-VLM-8B) [https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-14B-Base](https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-14B-Base) [https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-14B](https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-14B) [https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-8B-Base](https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-8B-Base) [https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-8B](https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-8B) [https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-3B-Base](https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-3B-Base) [https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-3B](https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-3B) #
查看原文

相似文章

nvidia/Nemotron-Labs-Diffusion-14B

Hugging Face Models Trending

NVIDIA发布了Nemotron-Labs-Diffusion,这是一个三模式语言模型系列(3B、8B、14B),支持自回归(AR)、扩散和自推测解码,相比标准AR解码实现了2.7倍到4倍的加速。