@PavloMolchanov: 我们发布了Nemotron-Labs-Diffusion - 首个三模式语言模型系列(3B/8B/14B),可在自回归……之间切换

X AI KOLs Following 模型

摘要

NVIDIA发布了Nemotron-Labs-Diffusion,这是首个三模式语言模型系列(3B/8B/14B),通过改变注意力模式在自回归、扩散和自推测解码之间切换,实现高达4倍的实际吞吐量。

我们发布了Nemotron-Labs-Diffusion - 首个三模式语言模型系列(3B/8B/14B),只需改变注意力模式/掩码,即可在自回归、扩散和自推测解码之间切换。 一个模型,三种解码模式。无需额外的草稿模型,无需改变架构,在不同并发级别上实现显著更高的效率。 单用户实际吞吐量最高提升4倍。 HF 集合:https://huggingface.co/collections/nvidia/nemotron-labs-diffusion…,开放许可 项目页面:https://research.nvidia.com/publication/2026-05_nemotron-labs-diffusion-tri-mode-language-model-unifying-autoregressive… 技术报告:http://bit.ly/Nemotron-Labs-Diffusion-Report… 详情如下
查看原文
查看缓存全文

缓存时间: 2026/05/20 02:25

我们正在发布 Nemotron-Labs-Diffusion——首个 Tri-mode LM 家族(3B/8B/14B),仅需更改注意力模式/掩码,即可在自回归、扩散和自推测解码之间切换。

一个模型,三种解码模式。无需额外的草稿模型。无需架构更改。只需在不同并发级别上实现显著更好的效率。

单用户实际吞吐量提升高达 4 倍。

HF 集合:https://huggingface.co/collections/nvidia/nemotron-labs-diffusion…,开放许可 项目页面:https://research.nvidia.com/publication/2026-05_nemotron-labs-diffusion-tri-mode-language-model-unifying-autoregressive… 技术报告:http://bit.ly/Nemotron-Labs-Diffusion-Report…

详情如下


Nemotron-Labs-Diffusion - 一个 NVIDIA 集合

来源:https://huggingface.co/collections/nvidia/nemotron-labs-diffusion 约 8 小时前更新

内部扩散模型集合

  • — #### nvidia/Nemotron-Labs-Diffusion-8B 文本生成• 8B• 约 8 小时前更新 • 12.5k • 5 (https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-8B)
  • — #### nvidia/Nemotron-Labs-Diffusion-VLM-8B 图像文本到文本• 9B• 约 8 小时前更新 • 1 • 4 (https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-VLM-8B)
  • — #### nvidia/Nemotron-Labs-Diffusion-14B 文本生成• 14B• 约 8 小时前更新 • 11 • 14 (https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-14B)
  • — #### nvidia/Nemotron-Labs-Diffusion-3B 文本生成• 4B• 约 8 小时前更新 • 10.6k • 6 (https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-3B)
  • — #### nvidia/Nemotron-Labs-Diffusion-14B-Base 文本生成• 14B• 约 8 小时前更新 • 160 • 1 (https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-14B-Base)
  • — #### nvidia/Nemotron-Labs-Diffusion-8B-Base 文本生成• 8B• 约 8 小时前更新 • 170k (https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-8B-Base)
  • — #### nvidia/Nemotron-Labs-Diffusion-3B-Base 文本生成• 4B• 约 8 小时前更新 • 12.5k • 2 (https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-3B-Base)

相似文章

nvidia/Nemotron-Labs-Diffusion-14B

Hugging Face Models Trending

NVIDIA发布了Nemotron-Labs-Diffusion,这是一个三模式语言模型系列(3B、8B、14B),支持自回归(AR)、扩散和自推测解码,相比标准AR解码实现了2.7倍到4倍的加速。

来自NVIDIA的Nemotron-Labs-Diffusion

Reddit r/LocalLLaMA

NVIDIA发布了Nemotron-Labs-Diffusion模型系列(3B至14B),该系列同时支持AR解码和扩散解码,并采用新颖的自推测机制,在多种硬件平台上相比标准AR和Eagle3方法实现了显著加速(最高达4倍)。