@PavloMolchanov: 我们发布了Nemotron-Labs-Diffusion - 首个三模式语言模型系列(3B/8B/14B),可在自回归……之间切换
摘要
NVIDIA发布了Nemotron-Labs-Diffusion,这是首个三模式语言模型系列(3B/8B/14B),通过改变注意力模式在自回归、扩散和自推测解码之间切换,实现高达4倍的实际吞吐量。
查看缓存全文
缓存时间: 2026/05/20 02:25
我们正在发布 Nemotron-Labs-Diffusion——首个 Tri-mode LM 家族(3B/8B/14B),仅需更改注意力模式/掩码,即可在自回归、扩散和自推测解码之间切换。
一个模型,三种解码模式。无需额外的草稿模型。无需架构更改。只需在不同并发级别上实现显著更好的效率。
单用户实际吞吐量提升高达 4 倍。
HF 集合:https://huggingface.co/collections/nvidia/nemotron-labs-diffusion…,开放许可 项目页面:https://research.nvidia.com/publication/2026-05_nemotron-labs-diffusion-tri-mode-language-model-unifying-autoregressive… 技术报告:http://bit.ly/Nemotron-Labs-Diffusion-Report…
详情如下
Nemotron-Labs-Diffusion - 一个 NVIDIA 集合
来源:https://huggingface.co/collections/nvidia/nemotron-labs-diffusion 约 8 小时前更新
内部扩散模型集合
- — #### nvidia/Nemotron-Labs-Diffusion-8B 文本生成• 8B• 约 8 小时前更新 • 12.5k • 5 (https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-8B)
- — #### nvidia/Nemotron-Labs-Diffusion-VLM-8B 图像文本到文本• 9B• 约 8 小时前更新 • 1 • 4 (https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-VLM-8B)
- — #### nvidia/Nemotron-Labs-Diffusion-14B 文本生成• 14B• 约 8 小时前更新 • 11 • 14 (https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-14B)
- — #### nvidia/Nemotron-Labs-Diffusion-3B 文本生成• 4B• 约 8 小时前更新 • 10.6k • 6 (https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-3B)
- — #### nvidia/Nemotron-Labs-Diffusion-14B-Base 文本生成• 14B• 约 8 小时前更新 • 160 • 1 (https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-14B-Base)
- — #### nvidia/Nemotron-Labs-Diffusion-8B-Base 文本生成• 8B• 约 8 小时前更新 • 170k (https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-8B-Base)
- — #### nvidia/Nemotron-Labs-Diffusion-3B-Base 文本生成• 4B• 约 8 小时前更新 • 12.5k • 2 (https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-3B-Base)
相似文章
nvidia/Nemotron-Labs-Diffusion-14B
NVIDIA发布了Nemotron-Labs-Diffusion,这是一个三模式语言模型系列(3B、8B、14B),支持自回归(AR)、扩散和自推测解码,相比标准AR解码实现了2.7倍到4倍的加速。
Nemotron-Labs-Diffusion: 统一自回归、扩散与自推测解码的三模式语言模型
本文介绍了Nemotron-Labs-Diffusion,一种三模式语言模型,统一了自回归、扩散与自推测解码,与现有模型相比实现了更优的吞吐量和效率。
来自NVIDIA的Nemotron-Labs-Diffusion
NVIDIA发布了Nemotron-Labs-Diffusion模型系列(3B至14B),该系列同时支持AR解码和扩散解码,并采用新颖的自推测机制,在多种硬件平台上相比标准AR和Eagle3方法实现了显著加速(最高达4倍)。
NVIDIA 发布了 Nemotron-TwoTower-30B-A3B-Base-BF16,这是一种基于 Nemotron 3 Nano 30B-A3B 主干构建的异常扩散型语言模型。
NVIDIA 发布了 Nemotron-TwoTower-30B-A3B-Base-BF16,这是一种基于扩散的语言模型,采用逐块自回归扩散方法,通过对令牌块进行迭代去噪来生成文本,实现了自回归基线 2.42 倍的生成吞吐量,同时保留了基准测试质量 98.7% 的水平。
@NVIDIAAI: 大多数语言模型一次只生成一个token。我们刚刚发布了Nemotron-Labs-Diffusion,一个扩散语言模型系列…
NVIDIA发布了Nemotron-Labs-Diffusion,这是一个扩散语言模型系列,可以并行生成多个token,从而实现更快的推理和更好的GPU利用率,模型规模从3B到14B,包括视觉语言变体。