@cwolferesearch: 开放技术报告/成果非常有价值。我目前正在阅读所有Nemotron的技术报告,它们…

X AI KOLs Timeline 模型

摘要

NVIDIA推出了Llama-Nemotron,这是一个开放的推理模型系列(Nano 8B、Super 49B、Ultra 253B),它们与DeepSeek-R1竞争,具有卓越的推理效率、动态推理切换和开放的后训练数据集。

开放技术报告/成果非常有价值。我目前正在阅读所有Nemotron的技术报告,它们绝对是宝藏(而且在很多情况下还公开了代码/数据)。没有更好的学习方式: - https://arxiv.org/abs/2505.00949 - https://arxiv.org/abs/2508.14444 - https://arxiv.org/abs/2512.20856 - https://arxiv.org/abs/2606.15007 - https://arxiv.org/abs/2512.13607 - https://arxiv.org/abs/2603.19220
查看原文
查看缓存全文

缓存时间: 2026/07/12 18:59

开放技术报告/工具有巨大的价值。我目前正在通读所有 Nemotron 的技术报告,它们简直是宝藏(而且在很多情况下,相关的代码和数据也是开放的)。没有比这更好的学习方式了:- https://arxiv.org/abs/2505.00949 - https://arxiv.org/abs/2508.14444 - https://arxiv.org/abs/2512.20856 - https://arxiv.org/abs/2606.15007 - https://arxiv.org/abs/2512.13607 - https://arxiv.org/abs/2603.19220 — # Llama-Nemotron:高效推理模型 来源:https://arxiv.org/html/2505.00949 ###### 摘要 摘要 我们推出了 Llama-Nemotron 系列模型,这是一个开放的异构推理模型家族,提供卓越的推理能力、推理效率,并采用开源许可证,可用于企业场景。该系列包含三个规格:Nano(8B)、Super(49B)和 Ultra(253B)。其性能可与 DeepSeek-R1 等先进推理模型相媲美,同时提供更优的推理吞吐量和内存效率。在本报告中,我们讨论了这些模型的训练流程,包括:从 Llama 3 模型出发进行神经架构搜索以实现加速推理,知识蒸馏,以及继续预训练;随后是专注于推理的后训练阶段,该阶段主要由两部分组成:监督微调和大规模强化学习。Llama-Nemotron 模型是首批支持动态推理切换的开源模型,允许用户在推理期间灵活切换标准聊天和推理模式。为了进一步支持开放研究和促进模型开发: - • - • 我们发布了完整的训练后数据集。 - – - • 参见图注 图 1:截至 2025 年 4 月,根据 Artificial Analysis(https://artificialanalysis.ai/)的评测,我们的旗舰模型 LN-Ultra 是“最智能”的开放模型。参见图注 图 2:LN-Ultra 在广泛的推理和非推理基准测试中,领先于其他开放模型。## 1 引言 近年来,语言模型的发展步伐不断加快,导致在广泛自然语言处理任务上的性能快速提升。最近,OpenAI o1(OpenAI,2025 (https://arxiv.org/html/2505.00949v5#bib.bib29))和 DeepSeek-R1(DeepSeek-AI 等,2025 (https://arxiv.org/html/2505.00949v5#bib.bib10))等推理模型的引入标志着新一轮的进步,使得模型能够在回答问题之前进行深入思考。这些模型的一个决定性特征是它们拥有较长的响应,通常包含长思维链、自我验证、反思和回溯。这样的长响应使它们在各种任务上达到了先进的性能,包括博士级别的 STEM 问题和竞赛级别的数学问题。随着推理能力越来越依赖于推理时的扩展,设计在推理期间高效运行的模型变得至关重要。推理效率已不仅仅是部署时的一个考量——它现在成为了模型总体智能和代理流水线可行性的核心限制因素。因此,最大化推理效率是这些模型的首要优化目标。除了原始的推理效率,赋予最终用户对推理行为的控制权同样至关重要。并非所有查询都受益于详细的多步骤推理——在某些情况下,这样的响应可能显得过于冗长,甚至适得其反。让用户能够打开或关闭推理功能,可以确保推理资源得到合理分配,并且响应风格始终适合当前任务(Anthropic,2025 (https://arxiv.org/html/2505.00949v5#bib.bib4))。在本文中,我们详细介绍了 Llama-Nemotron(LN)系列模型的训练过程。这是一个开放的异构推理模型家族,提供卓越的推理能力、推理效率,并采用开源许可证,可用于企业场景。该系列包含三个规格:LN-Nano(8B)、LN-Super(49B)和 LN-Ultra(253B)。值得注意的是,LN-Ultra 在性能上超越 DeepSeek-R1,同时能适配单个 8xH100 节点,并实现更高的推理吞吐量。这些模型源自 Llama 3.1 和 Llama 3.3(Grattafiori 等,2024 (https://arxiv.org/html/2505.00949v5#bib.bib11)),经过优化以实现高吞吐量推理,同时提供强大的推理性能和 128K 令牌的上下文长度。每个模型都支持推理切换功能,允许用户在推理期间通过一个轻量级系统提示“详细思考开启/关闭”动态切换标准聊天和推理模式。这种设计既实现了成本效益高的通用目的使用,也支持详细的多步骤推理,无需单独的模型或架构。Llama-Nemotron 模型的构建分为五个阶段。第一阶段包括使用神经架构搜索(NAS)优化 Llama 3 系列模型的推理效率,并应用前馈网络(FFN)融合。第二阶段包括使用知识蒸馏和继续预训练进行恢复训练。第三阶段是监督微调(SFT),使用标准指令数据和来自强教师模型(如 DeepSeek-R1)的推理轨迹的混合数据,使模型能够执行多步骤推理。第四阶段是在复杂数学和 STEM 数据集上进行大规模强化学习,这是使学生模型能力超越其教师模型的关键步骤。对于 LN-Ultra,该阶段在 GPQA-D 基准测试上带来了显著性能提升,使其成为科学推理领域的最佳开源模型。为了支持如此大规模的 RL 训练,我们开发了一个定制训练框架,包含多项优化,最值得注意的是 FP8 下的推理生成。最后阶段是一个简短的对齐阶段,侧重于指令遵循和人类偏好。作为此次发布的一部分,我们还开源了 Llama-Nemotron-Post-Training-Dataset (https://huggingface.co/datasets/nvidia/Llama-Nemotron-Post-Training-Dataset),这是一个精心策划的数据集,用于 LN-Nano、LN-Super 和 LN-Ultra 训练中的监督学习和强化学习阶段。它旨在针对数学推理、编程、科学和指令遵循等关键能力,并由一系列开源模型生成的合成响应组成。提示和响应经过质量、正确性和复杂性筛选,以跨多种任务提供强大的训练信号。根据 Artificial Analysis(如图 1 (https://arxiv.org/html/2505.00949v5#S0.F1) 所示,这是一家专注于评估 AI 模型和 API 提供商的独立基准测试和分析公司),截至 2025 年 4 月,LN-Ultra 是最智能的开源模型。此次发布代表了开源社区在支持推理模型开发方面做出的最大贡献之一。 ## 2 创建推理优化模型 LN-Super 和 LN-Ultra 模型针对高效推理进行了优化,使用了 Puzzle 框架(Bercovich 等,2024 (https://arxiv.org/html/2505.00949v5#bib.bib6))。Puzzle 是一个神经架构搜索(NAS)框架,它能在现实部署约束下将大型语言模型转化为硬件高效的变体,如图 3 (https://arxiv.org/html/2505.00949v5#S2.F3) 所示。从 Llama 3 Instruct 模型(LN-Super 对应 Llama 3.3-70B-Instruct,LN-Ultra 对应 Llama 3.1-405B-Instruct)开始,Puzzle 应用逐块局部蒸馏来构建一个替代 Transformer 块的库。每个块独立且并行地进行训练,以近似其父块的功能,同时改善其计算属性,如延迟、内存使用率或吞吐量。这个过程允许每个替代块以特定的准确率-效率权衡曲线来近似原始行为;也就是说,库中的一些块更高效,但可能会引起一定的质量下降——在计算成本和模型准确率之间引入了明确的权衡。块变体包括: - • 注意力移除:某些块完全省略注意力机制,减少了计算量和 KV 缓存内存消耗。 - • 可变 FFN 维度:前馈网络的中间尺寸是可变的,支持不同粒度的压缩(例如,原始隐藏大小的 87%、75%、50%,低至 10%)。虽然 Puzzle 支持其他操作——包括具有不同数量键值头的分组查询注意力(GQA)(Ainslie 等,2023 (https://arxiv.org/html/2505.00949v5#bib.bib3))、注意力的线性替代方案以及无操作替换 —— 但经验评估表明,注意力移除和 FFN 压缩在优化 LN-Super 和 LN-Ultra 模型的总吞吐量和内存节省方面最为有效。 参见图注 图 3:Puzzle 框架概述。一旦块库构建完成,Puzzle 通过每层选择一个块来组装完整的模型。这种选择由混合整数规划(MIP)求解器控制,该求解器在一组给定的约束(如硬件兼容性、最大允许延迟、总内存预算或所需推理吞吐量)下识别出最高效的配置。由于 Puzzle 每层支持多个具有不同准确率-效率权衡曲线的块变体,它使用户能够精确地定位准确率-效率帕累托前沿上的任意点。例如,Puzzle 可以生成满足代理系统或部署流水线特定约束的模型——例如受限的内存使用或严格的端到端响应时间。 ##### 使用 FFN 融合进行垂直压缩。对于 LN-Ultra 模型,我们引入了一种称为 FFN 融合(Bercovich 等,2025 (https://arxiv.org/html/2505.00949v5#bib.bib7))的额外压缩技术,旨在减少顺序深度并改善推理延迟。该技术利用了 Puzzle 移除某些注意力层后出现的一个结构性属性:模型通常包含连续的 FFN 块。FFN 融合识别这些序列,并将它们替换为数量更少、更宽的 FFN 层,这些层可以并行执行。这在不牺牲表达能力的前提下减少了顺序步骤的数量,并显著改善了计算利用率——尤其是在层间通信开销不可忽视的多 GPU 设置中。 ### 2.1 部署约束与效率目标 ##### LN-Super 经过优化,可在单个 NVIDIA H100 GPU 上高效运行,张量并行度为 1(TP1)。使用 Puzzle,我们生产出一个模型,在批量大小为 256、TP1 的情况下,相比 Llama 3.3-70B-Instruct 实现了 5 倍的吞吐量提升。即使 Llama 3.3-70B-Instruct 在其最优配置(TP4)下运行,使用单个 H100 GPU 时,LN-Super(TP1)仍然提供至少 2.17 倍的吞吐量优势。该模型还在约 300K 缓存令牌(批量大小 × 序列长度)的约束下进行了优化,精度为 FP8,在单个 H100 GPU 上测量。例如,这对应于处理批量大小 16 和序列长度 18,750。##### LN-Ultra 针对一个完整的 H100 节点(8 个 GPU)进行了优化。在 Puzzle 的架构搜索阶段,模型被约束为相比 Llama 3.1-405B-Instruct 至少实现 1.5 倍的延迟降低。在应用 FFN 融合后,最终模型实现了 1.71 倍的延迟改善。LN-Ultra 还在缓存令牌约束下进行了优化,在一个 H100 节点上支持 FP8 精度下高达 300 万个令牌,以及 BF16 精度下 60 万个令牌。参见图注 图 4:GPQA-Diamond 准确率 vs. 吞吐量。我们在两种设置下进行测量,S1:500/2000(ISL/OSL);S2:5000/500(ISL/OSL)。两者都有 250 个并发用户。模型使用 FP8 提供服务。注意,我们对 LN-Ultra 和 Llama 3.1 405B 使用 8×H100,但对 Deepseek-R1 因模型尺寸使用 8×H200。图 4 (https://arxiv.org/html/2505.00949v5#S2.F4) 展示了两种设置下 GPQA-Diamond 准确率(%)和处理吞吐量(令牌/秒)之间的权衡。值得注意的是,LN-Ultra 在这些设置下的准确率和效率方面始终优于 DeepSeek-R1 和 Llama-3.1-405B,清晰地将其定位为准确率-吞吐量帕累托曲线上的优越选择。 ### 2.2 NAS 后训练:知识蒸馏与继续预训练 在 NAS 阶段之后,LN-Super 和 LN-Ultra 都会进行额外的训练,以改善块间兼容性并恢复在块替换过程中引入的任何质量损失。 - • LN-Super 在由 Bercovich 等人(2024 (https://arxiv.org/html/2505.00949v5#bib.bib6))引入的 Distillation Mix 数据集上,使用知识蒸馏目标训练了 400 亿个令牌。 - • LN-Ultra 首先使用相同的蒸馏数据集进行知识蒸馏训练了 650 亿个令牌,随后在 Nemotron-H 第 4 阶段预训练数据集(NVIDIA 等,2025 (https://arxiv.org/html/2505.00949v5#bib.bib28))上继续训练了 880 亿个令牌。这个最后的预训练步骤不仅使 LN-Ultra 在关键基准测试上匹配,甚至超越了参考模型 Llama 3.1-405B-Instruct,证明通过短时间的蒸馏和预训练,激进的架构优化可以与高模型性能相协调(见表 1 (https://arxiv.org/html/2505.00949v5#S2.T1))。 | 任务 | Llama 3.1 405B Instruct | LN-Ultra(蒸馏后) | LN-Ultra(继续预训练后) | | :— | :— | :— | :— | | MMLU | 88.1 | 81.4 | 88.6 | | MATH500 | 80.4 | 73.6 | 69.6 | | HumanEval | 88.4 | 84.1 | 86.0 | | RULER 128K | 83.2 | 52.2 | 73.7 | 表 1:LN-Ultra 在继续预训练阶段后(在监督学习和强化学习之前)与 Llama 3 模型的比较。 ## 3 合成数据 我们为监督微调策划了推理数据和非推理数据。对于推理样本,我们包含系统指令“详细思考开”;对于非推理样本,我们使用“详细思考关”。这种设置允许模型在推理时根据提示学习切换推理行为。下面,我们描述针对每种模式的重点数据策划过程。 ### 3.1 推理开启 #### 3.1.1 数学 为了构建数据中的数学推理部分,我们使用了 Moshkov 等人(2025 (https://arxiv.org/html/2505.00949v5#bib.bib23))描述的流程。下面提供此流程的高层概述,详细信息可在原始出版物中找到。我们从 AoPS(Art of Problem Solving)社区论坛(https://artofproblemsolving.com/community)收集了大量数学问题。我们包括了所有论坛讨论,但“初中数学”部分除外,因为早期实验发现该部分过于简单,对训练无益。获取论坛讨论后,我们执行以下步骤来提取问题并合成新解法。除非另有说明,我们使用 Qwen2.5-32B-Instruct(Qwen,2024 (https://arxiv.org/html/2505.00949v5#bib.bib33))来完成流程中的所有步骤。##### 问题提取:我们提示 LLM 识别并从初始论坛帖子中提取所有问题。虽然大多数帖子只包含一个问题,但有些包含多个问题或者完全没有问题。##### 问题分类:每个提取的问题被分类为以下类别: - • 是否为证明问题 - • 是否为多项选择题 - • 是否为二元问题(是/否回答) - • 是否为有效问题。例如,缺乏上下文或引用其他问题的问题被视为无效。我们从最终数据集中移除所有证明问题、多项选择题、二元问题和无效问题。##### 答案提取:我们从论坛讨论中提取最终答案,而不尝试提取完整的解法。只提取最终的答案表达

相似文章

nvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16

Hugging Face Models Trending

NVIDIA 发布 Nemotron 3 Nano Omni,一款 300 亿参数的多模态模型,能够处理视频、音频、图像和文本,并集成推理能力,适用于企业工作流。

NVIDIA 刚刚宣布发布 Nemotron 3 Ultra(2分钟阅读)

TLDR AI

Anthropic 发布了其最智能的模型 Claude Opus 4.5,在 Artificial Analysis Intelligence Index 上获得 70 分,仅次于 Gemini 3 Pro。该模型在编码和智能体任务方面取得了显著进步,同时降低了每个token的价格,并保持了强劲的安全性能。