@natolambert: 很高兴看到 @NVIDIAAI 发布了他们的 MOPD 专家模型。这使得该领域的研究变得更加容易访问(尽管…

X AI KOLs Following 模型

摘要

英伟达发布了其针对 MOPD 的专家模型,并通过专为竞赛编程和代码推理设计的 NVIDIA-Nemotron-Labs-Teacher-Competition-Coding 模型,使人工智能研究更加易于访问。

很高兴看到 @NVIDIAAI 发布了他们的 MOPD 专家模型。这使得该领域的研究变得更加容易访问(尽管这些模型对大多数研究者来说都很庞大)。 https://t.co/LocLnse6HO
查看原文
查看缓存全文

缓存时间: 2026/08/17 04:15

很高兴看到 @NVIDIAAI 发布了他们的 MOPD 专家模型。这让该领域的研究变得更加容易(尽管对大多数研究者来说这些模型仍然很大)。https://t.co/LocLnse6HO


nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding · Hugging Face

来源: https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding

https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding#nvidia-nemotron-labs-teacher-competition-coding

NVIDIA-Nemotron-Labs-Teacher-Competition-Coding

  • 论文 (https://research.nvidia.com/labs/nemotron/files/NVIDIA-Nemotron-3-Ultra-Technical-Report.pdf)
  • 预训练数据集 (https://huggingface.co/collections/nvidia/nemotron-pre-training-datasets)
  • 后训练数据集 (https://huggingface.co/collections/nvidia/nemotron-post-training-v3)
  • 主页 (https://developer.nvidia.com/nemotron)
  • Discord (https://discord.gg/9xpKQtVvrk)
  • 许可证 (https://openmdw.ai/license/1-1/)

https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding#model-summary

模型摘要

项目详情
总参数量5500亿 (550亿激活参数)
架构LatentMoE - Mamba-2 + MoE + 注意力混合架构,并采用多Token预测 (MTP)
上下文长度最高可达100万Token
最低GPU要求4x GB200, 4x B200, 4x GB300, 4x B300, 8x H100
支持语言英语、法语、西班牙语、意大利语、德语、日语、印地语、韩语、巴西葡萄牙语和中文
最佳适用场景竞赛编程、算法问题求解和代码推理;生成经过验证的编码解决方案和推理轨迹;作为蒸馏教师模型
推理模式可通过聊天模板配置开启/关闭 (enable_thinking=True/False)
许可证OpenMDW 许可协议 1.1 版 (https://raw.githubusercontent.com/OpenMDW/OpenMDW/refs/heads/main/1.1/LICENSE.OpenMDW-1.1)
发布日期2026年8月
快速入门点击此处!

https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding#model-overview

模型概述

模型开发者: NVIDIA Corporation
模型开发周期: 2025年12月 - 2026年5月
数据时效性:

  • 后训练数据的截止日期为2026年5月。
  • 预训练数据的截止日期为2025年9月。

https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding#what-is-nemotron

什么是 Nemotron?

NVIDIA Nemotron™ 是一个开源模型家族,提供开放的权重、训练数据和配方,为构建专业化的 AI 智能体提供领先的效率和准确性。

https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding#description

描述

NVIDIA-Nemotron-Labs-Teacher-Competition-Coding 是 Nemotron 3 Ultra 家族中由 NVIDIA 训练的专用编程模型。它通过在经过后训练的 Nemotron 3 Ultra 学生模型 (https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16) 基础上,应用额外的编程专项监督微调和强化学习训练而成,使其在竞赛编程任务中具备强大的算法推理和解决方案生成能力。

在整个训练配方中,它是超过十个领域专家教师模型之一,为多教师在策略蒸馏(MOPD)提供训练信号,该阶段用于产出最终的 Nemotron 3 Ultra。它作为一个独立的检查点发布,因为它本身就是一个强大的编程模型,在竞赛编程基准测试中取得了领先结果。

与该家族中的其他模型一样,它通过首先生成推理轨迹,然后给出最终响应来回应用户的查询和任务。模型的推理能力可通过聊天模板中的一个标志进行配置。

该模型采用了混合潜在专家混合(LatentMoE)架构,使用交错的 Mamba-2 和 MoE 层,以及选定的注意力层。与 Super 模型一样,Ultra 模型也集成了多Token预测(MTP)层,以实现更快的文本生成和更高的质量,并且它使用NVFP4预训练配方进行训练,以最大化计算效率。

该模型拥有550亿激活参数总共5500亿参数。支持的语言包括:英语、法语、西班牙语、意大利语、德语、日语、韩语、印地语、巴西葡萄牙语和中文。

此模型已准备好用于商业和非商业用途。

https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding#licenseTerms-of-use

许可证/使用条款

下载条款约束: 使用此模型受OpenMDW-1.1模型许可协议 (https://openmdw.ai/license/1-1/) 管理。

https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding#deployment-geography-global

部署地域: 全球

https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding#use-case

使用场景

NVIDIA-Nemotron-Labs-Teacher-Competition-Coding 是一个专用编程模型,旨在用于英语、代码和受支持的多语言环境。其主要角色是作为 Nemotron 3 Ultra 配方中多教师在策略蒸馏(MOPD)的领域专家教师。它的发布旨在让开发者和研究人员可以将其用于竞赛编程、算法问题求解、生成经过验证的代码解决方案和推理轨迹,以及在其自己的蒸馏和数据生成流程中作为教师或评估器。它非常适合为困难的算法问题生成经过执行验证的解决方案。

https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding#release-date

发布日期

Hugging Face - 2026年8月14日,通过 Hugging Face (https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding) 发布。

https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding#references

参考资料

  • NVIDIA Nemotron 3 模型系列 (Hugging Face) (https://huggingface.co/collections/nvidia/nvidia-nemotron-v3)
  • NVIDIA Nemotron 3 Ultra 技术报告 (https://research.nvidia.com/labs/nemotron/files/NVIDIA-Nemotron-3-Ultra-Technical-Report.pdf)

https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding#model-architecture

模型架构

  • 架构类型: Mamba2-Transformer 混合潜在专家混合(LatentMoE),带有多Token预测(MTP)
  • 网络架构: Nemotron 混合潜在专家混合(LatentMoE)
  • 模型参数数量: 总计5500亿 / 激活550亿

https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding#model-design

模型设计

该模型采用了**潜在专家混合(LatentMoE)**架构,将 Token 投影到一个更小的潜在维度进行专家路由和计算,从而提高了每字节的准确性。Ultra 模型使用 NVFP4 配方进行预训练——共享了 Nemotron 3 家族开创的量化感知预训练方法。大多数线性层使用 NVFP4 进行权重、激活和梯度计算,而某些选定层(包括潜在投影、MTP 层、QKV/注意力投影和嵌入层)则保持 BF16 或 MXFP8 以确保训练稳定性。

该模型包含**多Token预测(MTP)**层,采用跨预测头共享权重的设计。这提高了训练信号的质量,通过原生的推测解码实现了更快的推理,并且与独立训练的偏移头相比,在更长的推测长度下支持更稳定的自回归草稿生成。

https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding#training-methodology

训练方法

第一阶段:预训练

  • NVIDIA-Nemotron-3-Ultra-550B-A55B-Base-BF16 (https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-Base-BF16) 模型使用爬取的合成代码、数学、科学和通用知识数据进行了大约 20 万亿 Token 的预训练。训练利用了 NVFP4 配方以提高效率。所有数据集均在本文档的 训练和评估数据集 部分披露。预训练语料库的大部分内容在 Nemotron-预训练-数据集 集合中发布。
  • 预训练所用软件:Megatron-LM (https://github.com/NVIDIA/Megatron-LM)

第二阶段:监督微调

  • 模型在合成代码、数学、科学、工具调用、指令遵循、结构化输出和通用知识数据上进行了进一步微调。此阶段包含了旨在支持长程检索和多文档聚合的数据。所有数据集均在本文档的 训练和评估数据集 部分披露。微调语料库的大部分内容在 Nemotron-后训练-v3 集合中发布。Data Designer (https://github.com/NVIDIA-NeMo/DataDesigner) 是用于准备这些语料库的库之一。

第三阶段:强化学习

  • 该模型使用异步 GRPO(群组相对策略优化)在数学、代码、科学、指令遵循、多步骤工具使用、多轮对话和结构化输出环境中进行了多环境强化学习。它采用了一个异步 RL 架构,将训练与推理完全解耦在不同的 GPU 设备上,利用在飞权重更新和 MTP 来加速滚动生成。对话质量通过 RLHF 进一步优化。所有数据集均在本文档的 训练和评估数据集 部分披露。RL 环境和数据集作为 NeMo Gym (https://github.com/NVIDIA-NeMo/Gym) 的一部分发布。
  • 强化学习所用软件:NeMo RL (https://github.com/NVIDIA-NeMo/RL), NeMo Gym (https://github.com/NVIDIA-NeMo/Gym)

第四阶段:多领域在策略蒸馏(MOPD)

  • 基于第三阶段产出的经过后训练的学生模型,该模型经历了一轮额外的编程专项化训练,以创建一个领域专家教师。首先,在一个大型的、混合了生成的、经过执行验证的解决方案和推理轨迹(主要是竞赛编程,包括思维链和与代码执行结合的工具推理)的数据集上进行监督微调阶段训练,同时包含相当比例的算法和数学问题求解,以及较小比例的通用领域数据。这些轨迹主要由强大的教师模型生成,并通过自动化验证(编译和测试执行)和基于模型的评判进行过滤,仅保留高质量、可验证的样本。随后的强化学习阶段——使用与基础 RLVR 阶段相同的设置——在竞赛编程健身环境(gym environments)中使用基于编译器和测试的验证作为奖励信号。

所得模型是超过十个领域专家教师之一,为多教师在策略蒸馏(MOPD)提供训练信号,该阶段用于训练最终的 Nemotron 3 Ultra。MOPD 使用这些强大的教师模型来指导学生模型在其自身生成的尝试(在策略滚动)上的训练,从而使学生的行为更好地与推理时其实际产生的行为保持一致,并带来比纯粹的离策略蒸馏更强的增益。端到端的训练配方可在 NVIDIA Nemotron 开发者仓库 (https://github.com/NVIDIA-NeMo/Nemotron) 中找到。

评估结果可以使用 NeMo 评估器 SDK (https://github.com/NVIDIA-NeMo/Evaluator) 进行复现。Data Designer (https://github.com/NVIDIA-NeMo/DataDesigner) 是用于准备预训练和后训练数据集的库之一。有关数据集和合成数据生成方法的更多详细信息,请参阅技术报告 NVIDIA Nemotron 3 Ultra 技术报告

https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding#input

输入

  • 输入类型: 文本
  • 输入格式: 字符串
  • 输入参数: 一维(1D):序列
  • 其他输入相关属性: 最大上下文长度最高可达100万Token。支持的语言包括:英语、法语、西班牙语、意大利语、德语、日语、印地语、韩语、巴西葡萄牙语和中文。

https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding#output

输出

  • 输出类型: 文本
  • 输出格式: 字符串
  • 输出参数: 一维(1D):序列
  • 其他输出相关属性: 最大上下文长度最高可达100万Token。

我们的 AI 模型专为在 NVIDIA GPU 加速系统上运行而设计和优化。通过利用 NVIDIA 的硬件(例如 GPU 核心)和软件框架(例如 CUDA 库),该模型实现了比仅 CPU 解决方案更快的训练和推理时间。

https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding#software-integration

软件集成

  • 运行时引擎: NeMo 26.04.01
  • 支持的硬件微架构兼容性: NVIDIA Ampere - A100; NVIDIA Blackwell; NVIDIA Hopper - H100-80GB
  • 操作系统: Linux

将基础模型和微调模型集成到 AI 系统中,需要使用特定用例数据进行额外测试,以确保安全部署和有效部署。遵循 V 模型方法论,在部署前,单元和系统级别的迭代测试和验证对于降低风险、满足技术和功能要求以及确保符合安全和道德标准至关重要。

https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding#model-versions

模型版本

  • v1.0 - Ultra 竞赛编程教师 GA

https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding#quick-start-guide

快速入门指南

Ultra NVFP4 检查点是一个为在最新硬件上实现最大吞吐量而量化的前沿规模模型。最低推荐硬件配置为:

  • 单节点: 4× B200(适合 NVFP4 权重加上 KV 缓存,并留有余量)
  • 多节点: ≥4 GPU(跨 GB200 / GB300)

以下所有部署代码片段默认使用 8000 端口,并启用分块预填充、NVFP4 KV 缓存和 MTP(5 个推测 Token)。

https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding#multi-node-setup-with-ray-recommended-for-multi-node-deployments

使用 Ray 的多节点设置(推荐用于多节点部署)

多节点部署的推荐多处理后端是 Ray v2。以下是启动 Ray 集群的模板:

# 设置头节点的 IP 地址
export RAY_HEAD_IP=
export RAY_PORT=6379
export RAY_ADDRESS=${RAY_HEAD_IP}:${RAY_PORT}

# 启动 Ray 头节点 (vLLM/SGLang 将在此节点上运行)
ray start --head --node-ip-address=${RAY_HEAD_IP} --port=${RAY_PORT}

# 启动 Ray 工作节点
ray start --address=${RAY_HEAD_IP}:${RAY_PORT} --block

# 验证 Ray 集群是否就绪
ray status --address=${RAY_HEAD_IP}:${RAY_PORT}

注意: 需要安装 ray[cgraph]uv pip install "ray[cgraph]"

https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding#vllm

vLLM

推荐容器: vllm/vllm-openai:v0.22.0

有关更详细的信息…

相似文章

@NVIDIAAI: 不客气

X AI KOLs Timeline

NVIDIA AI 发布了一个75B的MoE模型(9.3B活跃),该模型使用Iterative Puzzle框架从Nemotron-3-Super-120B压缩而来,支持100万token上下文。