@natolambert: 很高兴看到 @NVIDIAAI 发布了他们的 MOPD 专家模型。这使得该领域的研究变得更加容易访问(尽管…
摘要
英伟达发布了其针对 MOPD 的专家模型,并通过专为竞赛编程和代码推理设计的 NVIDIA-Nemotron-Labs-Teacher-Competition-Coding 模型,使人工智能研究更加易于访问。
查看缓存全文
缓存时间: 2026/08/17 04:15
很高兴看到 @NVIDIAAI 发布了他们的 MOPD 专家模型。这让该领域的研究变得更加容易(尽管对大多数研究者来说这些模型仍然很大)。https://t.co/LocLnse6HO
nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding · Hugging Face
来源: https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding
https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding#nvidia-nemotron-labs-teacher-competition-coding
NVIDIA-Nemotron-Labs-Teacher-Competition-Coding
- 论文 (https://research.nvidia.com/labs/nemotron/files/NVIDIA-Nemotron-3-Ultra-Technical-Report.pdf)
- 预训练数据集 (https://huggingface.co/collections/nvidia/nemotron-pre-training-datasets)
- 后训练数据集 (https://huggingface.co/collections/nvidia/nemotron-post-training-v3)
- 主页 (https://developer.nvidia.com/nemotron)
- Discord (https://discord.gg/9xpKQtVvrk)
- 许可证 (https://openmdw.ai/license/1-1/)
https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding#model-summary
模型摘要
| 项目 | 详情 |
|---|---|
| 总参数量 | 5500亿 (550亿激活参数) |
| 架构 | LatentMoE - Mamba-2 + MoE + 注意力混合架构,并采用多Token预测 (MTP) |
| 上下文长度 | 最高可达100万Token |
| 最低GPU要求 | 4x GB200, 4x B200, 4x GB300, 4x B300, 8x H100 |
| 支持语言 | 英语、法语、西班牙语、意大利语、德语、日语、印地语、韩语、巴西葡萄牙语和中文 |
| 最佳适用场景 | 竞赛编程、算法问题求解和代码推理;生成经过验证的编码解决方案和推理轨迹;作为蒸馏教师模型 |
| 推理模式 | 可通过聊天模板配置开启/关闭 (enable_thinking=True/False) |
| 许可证 | OpenMDW 许可协议 1.1 版 (https://raw.githubusercontent.com/OpenMDW/OpenMDW/refs/heads/main/1.1/LICENSE.OpenMDW-1.1) |
| 发布日期 | 2026年8月 |
| 快速入门 | 点击此处! |
https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding#model-overview
模型概述
模型开发者: NVIDIA Corporation
模型开发周期: 2025年12月 - 2026年5月
数据时效性:
- 后训练数据的截止日期为2026年5月。
- 预训练数据的截止日期为2025年9月。
https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding#what-is-nemotron
什么是 Nemotron?
NVIDIA Nemotron™ 是一个开源模型家族,提供开放的权重、训练数据和配方,为构建专业化的 AI 智能体提供领先的效率和准确性。
https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding#description
描述
NVIDIA-Nemotron-Labs-Teacher-Competition-Coding 是 Nemotron 3 Ultra 家族中由 NVIDIA 训练的专用编程模型。它通过在经过后训练的 Nemotron 3 Ultra 学生模型 (https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16) 基础上,应用额外的编程专项监督微调和强化学习训练而成,使其在竞赛编程任务中具备强大的算法推理和解决方案生成能力。
在整个训练配方中,它是超过十个领域专家教师模型之一,为多教师在策略蒸馏(MOPD)提供训练信号,该阶段用于产出最终的 Nemotron 3 Ultra。它作为一个独立的检查点发布,因为它本身就是一个强大的编程模型,在竞赛编程基准测试中取得了领先结果。
与该家族中的其他模型一样,它通过首先生成推理轨迹,然后给出最终响应来回应用户的查询和任务。模型的推理能力可通过聊天模板中的一个标志进行配置。
该模型采用了混合潜在专家混合(LatentMoE)架构,使用交错的 Mamba-2 和 MoE 层,以及选定的注意力层。与 Super 模型一样,Ultra 模型也集成了多Token预测(MTP)层,以实现更快的文本生成和更高的质量,并且它使用NVFP4预训练配方进行训练,以最大化计算效率。
该模型拥有550亿激活参数和总共5500亿参数。支持的语言包括:英语、法语、西班牙语、意大利语、德语、日语、韩语、印地语、巴西葡萄牙语和中文。
此模型已准备好用于商业和非商业用途。
https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding#licenseTerms-of-use
许可证/使用条款
下载条款约束: 使用此模型受OpenMDW-1.1模型许可协议 (https://openmdw.ai/license/1-1/) 管理。
https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding#deployment-geography-global
部署地域: 全球
https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding#use-case
使用场景
NVIDIA-Nemotron-Labs-Teacher-Competition-Coding 是一个专用编程模型,旨在用于英语、代码和受支持的多语言环境。其主要角色是作为 Nemotron 3 Ultra 配方中多教师在策略蒸馏(MOPD)的领域专家教师。它的发布旨在让开发者和研究人员可以将其用于竞赛编程、算法问题求解、生成经过验证的代码解决方案和推理轨迹,以及在其自己的蒸馏和数据生成流程中作为教师或评估器。它非常适合为困难的算法问题生成经过执行验证的解决方案。
https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding#release-date
发布日期
Hugging Face - 2026年8月14日,通过 Hugging Face (https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding) 发布。
https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding#references
参考资料
- NVIDIA Nemotron 3 模型系列 (Hugging Face) (https://huggingface.co/collections/nvidia/nvidia-nemotron-v3)
- NVIDIA Nemotron 3 Ultra 技术报告 (https://research.nvidia.com/labs/nemotron/files/NVIDIA-Nemotron-3-Ultra-Technical-Report.pdf)
https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding#model-architecture
模型架构
- 架构类型: Mamba2-Transformer 混合潜在专家混合(LatentMoE),带有多Token预测(MTP)
- 网络架构: Nemotron 混合潜在专家混合(LatentMoE)
- 模型参数数量: 总计5500亿 / 激活550亿
https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding#model-design
模型设计
该模型采用了**潜在专家混合(LatentMoE)**架构,将 Token 投影到一个更小的潜在维度进行专家路由和计算,从而提高了每字节的准确性。Ultra 模型使用 NVFP4 配方进行预训练——共享了 Nemotron 3 家族开创的量化感知预训练方法。大多数线性层使用 NVFP4 进行权重、激活和梯度计算,而某些选定层(包括潜在投影、MTP 层、QKV/注意力投影和嵌入层)则保持 BF16 或 MXFP8 以确保训练稳定性。
该模型包含**多Token预测(MTP)**层,采用跨预测头共享权重的设计。这提高了训练信号的质量,通过原生的推测解码实现了更快的推理,并且与独立训练的偏移头相比,在更长的推测长度下支持更稳定的自回归草稿生成。
https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding#training-methodology
训练方法
第一阶段:预训练
- NVIDIA-Nemotron-3-Ultra-550B-A55B-Base-BF16 (https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-Base-BF16) 模型使用爬取的合成代码、数学、科学和通用知识数据进行了大约 20 万亿 Token 的预训练。训练利用了 NVFP4 配方以提高效率。所有数据集均在本文档的 训练和评估数据集 部分披露。预训练语料库的大部分内容在 Nemotron-预训练-数据集 集合中发布。
- 预训练所用软件:Megatron-LM (https://github.com/NVIDIA/Megatron-LM)
第二阶段:监督微调
- 模型在合成代码、数学、科学、工具调用、指令遵循、结构化输出和通用知识数据上进行了进一步微调。此阶段包含了旨在支持长程检索和多文档聚合的数据。所有数据集均在本文档的 训练和评估数据集 部分披露。微调语料库的大部分内容在 Nemotron-后训练-v3 集合中发布。Data Designer (https://github.com/NVIDIA-NeMo/DataDesigner) 是用于准备这些语料库的库之一。
第三阶段:强化学习
- 该模型使用异步 GRPO(群组相对策略优化)在数学、代码、科学、指令遵循、多步骤工具使用、多轮对话和结构化输出环境中进行了多环境强化学习。它采用了一个异步 RL 架构,将训练与推理完全解耦在不同的 GPU 设备上,利用在飞权重更新和 MTP 来加速滚动生成。对话质量通过 RLHF 进一步优化。所有数据集均在本文档的 训练和评估数据集 部分披露。RL 环境和数据集作为 NeMo Gym (https://github.com/NVIDIA-NeMo/Gym) 的一部分发布。
- 强化学习所用软件:NeMo RL (https://github.com/NVIDIA-NeMo/RL), NeMo Gym (https://github.com/NVIDIA-NeMo/Gym)
第四阶段:多领域在策略蒸馏(MOPD)
- 基于第三阶段产出的经过后训练的学生模型,该模型经历了一轮额外的编程专项化训练,以创建一个领域专家教师。首先,在一个大型的、混合了生成的、经过执行验证的解决方案和推理轨迹(主要是竞赛编程,包括思维链和与代码执行结合的工具推理)的数据集上进行监督微调阶段训练,同时包含相当比例的算法和数学问题求解,以及较小比例的通用领域数据。这些轨迹主要由强大的教师模型生成,并通过自动化验证(编译和测试执行)和基于模型的评判进行过滤,仅保留高质量、可验证的样本。随后的强化学习阶段——使用与基础 RLVR 阶段相同的设置——在竞赛编程健身环境(gym environments)中使用基于编译器和测试的验证作为奖励信号。
所得模型是超过十个领域专家教师之一,为多教师在策略蒸馏(MOPD)提供训练信号,该阶段用于训练最终的 Nemotron 3 Ultra。MOPD 使用这些强大的教师模型来指导学生模型在其自身生成的尝试(在策略滚动)上的训练,从而使学生的行为更好地与推理时其实际产生的行为保持一致,并带来比纯粹的离策略蒸馏更强的增益。端到端的训练配方可在 NVIDIA Nemotron 开发者仓库 (https://github.com/NVIDIA-NeMo/Nemotron) 中找到。
评估结果可以使用 NeMo 评估器 SDK (https://github.com/NVIDIA-NeMo/Evaluator) 进行复现。Data Designer (https://github.com/NVIDIA-NeMo/DataDesigner) 是用于准备预训练和后训练数据集的库之一。有关数据集和合成数据生成方法的更多详细信息,请参阅技术报告 NVIDIA Nemotron 3 Ultra 技术报告。
https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding#input
输入
- 输入类型: 文本
- 输入格式: 字符串
- 输入参数: 一维(1D):序列
- 其他输入相关属性: 最大上下文长度最高可达100万Token。支持的语言包括:英语、法语、西班牙语、意大利语、德语、日语、印地语、韩语、巴西葡萄牙语和中文。
https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding#output
输出
- 输出类型: 文本
- 输出格式: 字符串
- 输出参数: 一维(1D):序列
- 其他输出相关属性: 最大上下文长度最高可达100万Token。
我们的 AI 模型专为在 NVIDIA GPU 加速系统上运行而设计和优化。通过利用 NVIDIA 的硬件(例如 GPU 核心)和软件框架(例如 CUDA 库),该模型实现了比仅 CPU 解决方案更快的训练和推理时间。
https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding#software-integration
软件集成
- 运行时引擎: NeMo 26.04.01
- 支持的硬件微架构兼容性: NVIDIA Ampere - A100; NVIDIA Blackwell; NVIDIA Hopper - H100-80GB
- 操作系统: Linux
将基础模型和微调模型集成到 AI 系统中,需要使用特定用例数据进行额外测试,以确保安全部署和有效部署。遵循 V 模型方法论,在部署前,单元和系统级别的迭代测试和验证对于降低风险、满足技术和功能要求以及确保符合安全和道德标准至关重要。
https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding#model-versions
模型版本
- v1.0 - Ultra 竞赛编程教师 GA
https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding#quick-start-guide
快速入门指南
Ultra NVFP4 检查点是一个为在最新硬件上实现最大吞吐量而量化的前沿规模模型。最低推荐硬件配置为:
- 单节点: 4× B200(适合 NVFP4 权重加上 KV 缓存,并留有余量)
- 多节点: ≥4 GPU(跨 GB200 / GB300)
以下所有部署代码片段默认使用 8000 端口,并启用分块预填充、NVFP4 KV 缓存和 MTP(5 个推测 Token)。
https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding#multi-node-setup-with-ray-recommended-for-multi-node-deployments
使用 Ray 的多节点设置(推荐用于多节点部署)
多节点部署的推荐多处理后端是 Ray v2。以下是启动 Ray 集群的模板:
# 设置头节点的 IP 地址
export RAY_HEAD_IP=
export RAY_PORT=6379
export RAY_ADDRESS=${RAY_HEAD_IP}:${RAY_PORT}
# 启动 Ray 头节点 (vLLM/SGLang 将在此节点上运行)
ray start --head --node-ip-address=${RAY_HEAD_IP} --port=${RAY_PORT}
# 启动 Ray 工作节点
ray start --address=${RAY_HEAD_IP}:${RAY_PORT} --block
# 验证 Ray 集群是否就绪
ray status --address=${RAY_HEAD_IP}:${RAY_PORT}
注意: 需要安装 ray[cgraph]:uv pip install "ray[cgraph]"
https://huggingface.co/nvidia/NVIDIA-Nemotron-Labs-Teacher-Competition-Coding#vllm
vLLM
推荐容器: vllm/vllm-openai:v0.22.0
有关更详细的信息…
相似文章
@NVIDIAAI: 不客气
NVIDIA AI 发布了一个75B的MoE模型(9.3B活跃),该模型使用Iterative Puzzle框架从Nemotron-3-Super-120B压缩而来,支持100万token上下文。
@llm_wizard: 顺便说一下,我们直接发布了构建Nemotron模型所需的一切,包括配方和流水线。https://…
NVIDIA发布了Nemotron仓库,其中包含开放的训练配方、流水线和模型权重,用于他们的Nemotron模型,包括新的Nemotron 3 Ultra和Nemotron 3 Nano Omni,支持智能体AI和多模态能力。
@dhruvtwt_:怎么没人聊这事?@nvidia 正免费提供约 80 款 AI 模型的托管 API
Nvidia 低调开放约 80 款免费托管 AI 模型 API,包括 MiniMax M2.7、GLM 5.1、Kimi 2.5、DeepSeek 3.2、GPT-OSS-120B 等,可直接接入 OpenClaude、Zed IDE 等主流开发工具。
Nvidia的Nemotron系列是最开源的一系列模型。我发现:- 基准测试要求 - 所有GitHub仓库 - 所有数据 - 权重 而且它们表现很好,实际上非常独特。他们发布NVFP4基准测试,结果仅差1% https://t.co/dQ2PwarUfO
Nvidia的Nemotron系列AI模型完全开源,包含基准测试、GitHub仓库、数据和权重,性能上与NVFP4基准测试仅差1%。
NVIDIA Nemotron 3.5 Lightning and NeMo Switchyard Deliver Faster, Smarter, More Efficient Agentic AI
NVIDIA announced Nemotron 3.5 Lightning, a 30B mixture-of-experts open model optimized for high-volume agentic AI workloads, alongside NeMo Switchyard, an open-source library for intelligent model routing across heterogeneous model ecosystems.