NVIDIA Vera Rubin 在训练后工作负载中最大化每美元智能——代理式AI的关键指标

NVIDIA Blog 产品

摘要

NVIDIA 推出了 Vera Rubin,这是一种新架构,旨在最大化训练后工作负载的每美元智能,通过优化每 Token 成本和支持大规模强化学习,满足代理式AI的持续学习需求。

<div id="bsf_rt_marker"></div> <p class="wp-block-paragraph">试想一位职业运动员。精英选手的差距往往体现在比赛间隙:持续改进、适应新对手、根据上一场比赛暴露的问题打磨技能。</p> <p class="wp-block-paragraph">代理式AI也是如此。模型不再被要求给出答案,而是被赋予一个目标,并需要随着环境变化、边缘案例出现和工具变更而不断适应。与根据提示响应的生成式模型不同,代理式模型必须进行规划、使用不同的工具,并从中途遇到的问题中恢复。</p> <p class="wp-block-paragraph">正因如此,训练后阶段——即在原始数据初始训练后对模型进行微调的阶段——不再是一次性的收尾步骤。它是持续进行的,因为代理式模型运行的环境变化迅速。代理使用的工具可能每周都在变化。生产环境中出现测试集未预见的边缘案例。每次部署都带来自己的代码库、策略和环境。</p> <p class="wp-block-paragraph">随着新问题的出现,训练后运行从生产环境中循环反馈。计算足迹的增长并非因为单次运行更大,而是因为运行从未停止。代理式AI为训练后引入了新的计算模式,使其成为代理时代的核心工作负载,以及每美元智能的主要驱动力。</p> <p class="wp-block-paragraph"><span style="font-weight: 400;">训练后的目标是通过最大化持续学习周期中每次前向和反向传播的收益来最大化每美元智能。前向传播——推理——</span><a href="https://blogs.nvidia.com/blog/lowest-token-cost-ai-factories/"><span style="font-weight: 400;">以每Token成本衡量</span></a><span style="font-weight: 400;">。这意味着每Token成本的每一次改进都直接转化为每美元智能的提升。</span></p> <h2 class="wp-block-heading"><strong><strong>代理式AI训练后阶段解析</strong></strong></h2> <p class="wp-block-paragraph">训练后阶段是构建智能的地方。在预训练中,模型学习预测下一个Token,这赋予了它流畅性而非智能。训练后阶段,它学习编写代码、规划多步骤任务、使用搜索工具以及在出错时恢复。推理则是之后的工作:模型在实际工作中运行,以每Token成本计价。</p> <p class="wp-block-paragraph"><span style="font-weight: 400;">由于没有标准答案可记忆,只有奖励信号,模型通过</span><a target="_blank" href="https://developer.nvidia.com/blog/mastering-agentic-techniques-ai-agent-reinforcement-learning/"><span style="font-weight: 400;">强化学习</span></a><span style="font-weight: 400;">(RL)技术学习。当给定一个任务时,它会写出一次尝试——前向传播——与它在实际工作中所做的相同。尝试被评分,然后通过反向传播更新模型权重。经过数百万次尝试,智能得以增长。</span></p> <p class="wp-block-paragraph">每一步都是计算密集型的,大规模运行这个循环是一个编排问题:数千个环境并行生成展开,奖励被验证,更新后的权重流回训练,加速器被充分利用。NVIDIA NeMo 开源库,例如用于训练环境的 NeMo Gym 和用于分布式训练后的 NeMo RL,将训练后从定制研究代码转变为可重复的基础设施。</p> <p><img fetchpriority="high" decoding="async" class="aligncenter size-large wp-image-96420" src="https://blogs.nvidia.com/wp-content/uploads/2026/07/ai-infra-diagram-vr-post-traininig-agentic-workflow-1920x1080-5448060-1680x945.jpg" alt="" width="1200" height="675" srcset="https://blogs.nvidia.com/wp-content/uploads/2026/07/ai-infra-diagram-vr-post-traininig-agentic-workflow-1920x1080-5448060-1680x945.jpg 1680w, https://blogs.nvidia.com/wp-content/uploads/2026/07/ai-infra-diagram-vr-post-traininig-agentic-workflow-1920x1080-5448060-960x540.jpg 960w, https://blogs.nvidia.com/wp-content/uploads/2026/07/ai-infra-diagram-vr-post-traininig-agentic-workflow-1920x1080-5448060-1280x720.jpg 1280w, https://blogs.nvidia.com/wp-content/uploads/2026/07/ai-infra-diagram-vr-post-traininig-agentic-workflow-1920x1080-5448060-1536x864.jpg 1536w, https://blogs.nvidia.com/wp-content/uploads/2026/07/ai-infra-diagram-vr-post-traininig-agentic-workflow-1920x1080-5448060-1290x725.jpg 1290w, https://blogs.nvidia.com/wp-content/uploads/2026/07/ai-infra-diagram-vr-post-traininig-agentic-workflow-1920x1080-5448060-630x354.jpg 630w, https://blogs.nvidia.com/wp-content/uploads/2026/07/ai-infra-diagram-vr-post-traininig-agentic-workflow-1920x1080-5448060-300x169.jpg 300w, https://blogs.nvidia.com/wp-content/uploads/2026/07/ai-infra-diagram-vr-post-traininig-agentic-workflow-1920x1080-5448060-400x225.jpg 400w, https://blogs.nvidia.com/wp-content/uploads/2026/07/ai-infra-diagram-vr-post-traininig-agentic-workflow-1920x1080-5448060.jpg 1920w" sizes="(max-width: 1200px) 100vw, 1200px" /></p> <h2 class="wp-block-heading"><strong><strong>为什么每美元智能扩展了每Token成本</strong></strong></h2> <p class="wp-block-paragraph">如果推理是收入引擎,那么训练后就是倍增器:模型能力越强,每个Token的价值就越高。</p> <p><img decoding="async" class="aligncenter wp-image-96423 size-medium" src="https://blogs.nvidia.com/wp-content/uploads/2026/07/intelligence-per-dollar-equation-960x138.jpg" alt="" width="960" height="138" srcset="https://blogs.nvidia.com/wp-content/uploads/2026/07/intelligence-per-dollar-equation-960x138.jpg 960w, https://blogs.nvidia.com/wp-content/uploads/2026/07/intelligence-per-dollar-equation-1680x241.jpg 1680w, https://blogs.nvidia.com/wp-content/uploads/2026/07/intelligence-per-dollar-equation-1280x183.jpg 1280w, https://blogs.nvidia.com/wp-content/uploads/2026/07/intelligence-per-dollar-equation-1536x220.jpg 1536w, https://blogs.nvidia.com/wp-content/uploads/2026/07/intelligence-per-dollar-equation-scaled.jpg 2048w, https://blogs.nvidia.com/wp-content/uploads/2026/07/intelligence-per-dollar-equation-630x90.jpg 630w" sizes="(max-width: 960px) 100vw, 960px" /></p> <div> <p dir="ltr">每Token成本是推理工厂的关键指标:交付100万Token的总成本。每美元智能站在更高一层,回答不同的问题:构建一个值得服务的模型,并在环境变化时保持其价值,需要多少成本?</p> <p dir="ltr">两者嵌套而非竞争。降低每Token成本的AI基础设施同时也降低了模型中每一点智能的构建成本。而每一点智能的构建都提升了推理工厂所服务的每个Token的价值。</p> <p dir="ltr">换句话说,每Token成本衡量运营收益率;每美元智能衡量模型智能投资是否获得回报。</p> <p dir="ltr"><img decoding="async" class="aligncenter size-large wp-image-96426" src="https://blogs.nvidia.com/wp-content/uploads/2026/07/ai-infra-diagram-vr-post-traininig-maximizing-intelligence-1920x1080-5448060-1680x945.jpg" alt="" width="1200" height="675" srcset="https://blogs.nvidia.com/wp-content/uploads/2026/07/ai-infra-diagram-vr-post-traininig-maximizing-intelligence-1920x1080-5448060-1680x945.jpg 1680w, https://blogs.nvidia.com/wp-content/uploads/2026/07/ai-infra-diagram-vr-post-traininig-maximizing-intelligence-1920x1080-5448060-960x540.jpg 960w, https://blogs.nvidia.com/wp-content/uploads/2026/07/ai-infra-diagram-vr-post-traininig-maximizing-intelligence-1920x1080-5448060-1280x720.jpg 1280w, https://blogs.nvidia.com/wp-content/uploads/2026/07/ai-infra-diagram-vr-post-traininig-maximizing-intelligence-1920x1080-5448060-1536x864.jpg 1536w, https://blogs.nvidia.com/wp-content/uploads/2026/07/ai-infra-diagram-vr-post-traininig-maximizing-intelligence-1920x1080-5448060-1290x725.jpg 1290w, https://blogs.nvidia.com/wp-content/uploads/2026/07/ai-infra-diagram-vr-post-traininig-maximizing-intelligence-1920x1080-5448060-630x354.jpg 630w, https://blogs.nvidia.com/wp-content/uploads/2026/07/ai-infra-diagram-vr-post-traininig-maximizing-intelligence-1920x1080-5448060-300x169.jpg 300w, https://blogs.nvidia.com/wp-content/uploads/2026/07/ai-infra-diagram-vr-post-traininig-maximizing-intelligence-1920x1080-5448060-400x225.jpg 400w, https://blogs.nvidia.com/wp-content/uploads/2026/07/ai-infra-diagram-vr-post-traininig-maximizing-intelligence-1920x1080-5448060.jpg 1920w" sizes="(max-width: 1200px) 100vw, 1200px" /></p> </div>
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:24

# NVIDIA Vera Rubin 将后训练工作负载的智能每美元最大化——智能体AI的关键指标 来源:https://blogs.nvidia.com/blog/nvidia-vera-rubin-post-training-intelligence-per-dollar/ 想象一位职业运动员。区分顶尖选手的关键在于比赛间隙的持续打磨:适应新对手,根据上一场暴露的问题精进技能。 智能体AI(Agentic AI)的工作原理如出一辙。模型不再是为了求取单一答案而存在,它背负一个目标,必须随着环境变化、边缘情况出现和工具更迭而不断调整。与生成式模型响应提示不同,智能体模型必须制定计划、使用不同工具,并在运行中途遇到问题时自行恢复。 正因如此,后训练(post-training)——即在初始原始数据训练后对模型进行精炼的阶段——不再是一次性的收尾步骤。它变成了持续的过程,因为智能体模型运行的环境变化极快。智能体使用的工具可能每周都在改变。生产环境中涌现的边界情况,是任何测试集都无法预料的。每次部署都带来独特的代码库、策略和环境。 随着新问题从生产环境浮现,后训练循环重新启动。计算足迹增长不是因为单次运行规模更大,而是因为运行永不停止。智能体AI为后训练引入了全新的计算模式,使其成为智能体时代的核心工作负载,以及智能每美元(intelligence per dollar)的主要驱动力。 后训练的目标是通过在持续学习循环中最大化每次前向传播和后向传播的产出,来实现智能每美元的最大化。前向传播即推理,其衡量标准是每个令牌的成本(cost per token)(https://blogs.nvidia.com/blog/lowest-token-cost-ai-factories/)。这意味着,成本每令牌的每一次改进,都会直接转化为智能每美元。 ## **智能体后训练解密** 后训练是构建智能的阶段。在预训练中,模型学习预测下一个令牌,这赋予了它流畅性,而非智能。后训练阶段,模型才学会编写代码、规划多步骤任务、使用搜索工具以及在出错时恢复。推理则是之后的事情:模型在实际工作中执行任务,按成本每令牌计价。 由于没有现成答案可以背诵,只有奖励信号,模型通过强化学习(reinforcement learning, RL)技术进行学习。当接到一个任务时,它会输出一个尝试方案——这就是前向传播,与它在实际工作中的过程相同。该尝试被评分,然后学习结果更新模型权重——即后向传播。经过数百万次尝试,智能不断增长。 每一步都计算密集,大规模运行这一循环是一个编排难题:数千个环境并行生成推出(rollouts),奖励被验证,更新后的权重流回训练中,同时加速器被充分利用。NVIDIA NeMo开源库,例如用于训练环境的NeMo Gym(https://docs.nvidia.com/nemo/gym/about)和用于分布式后训练的NeMo RL(https://docs.nvidia.com/nemo/rl/latest/index.html),将后训练从定制的研究代码转变为可重复的基础设施。 ## **为什么智能每美元扩展了成本每令牌** 如果说推理是收入引擎,那么后训练就是倍增器:模型能力越强,每个被服务的令牌价值就越高。 成本每令牌是推理工厂的关键指标:交付100万个令牌的总成本。智能每美元则高一个层次,回答的是不同的问题:构建一个值得部署的模型需要多少成本,以及在其环境变化时如何保持这个价值? 这两个指标是嵌套关系,而非竞争关系。降低成本每令牌的AI基础设施,同样会降低构建到模型中的每一点智能的成本。而模型中的每一点智能,都会提升推理工厂所服务令牌的价值。 换言之,成本每令牌衡量运营收益;智能每美元则衡量模型智能投资是否产生了回报。 ## **最大化智能每美元:后训练 Nemotron 3 Ultra** NVIDIA Nemotron 3 Ultra(https://developer.nvidia.com/blog/nvidia-nemotron-3-ultra-powers-faster-more-efficient-reasoning-for-long-running-agents/)——一个开放权重的5500亿参数混合专家(MoE)模型,提供了可验证的基准测试以及完全公开的后训练配方,该配方在NeMo RL上运行。它在标准真实编码基准测试SWE-bench verified上取得了71.7%的分数,意味着对于开源项目中大约七成的真实软件缺陷,它生成了有效的修复,每个修复都通过项目自身的测试进行了验证。 假设200亿推出令牌,基于前一代Nemotron 3 Super约120万次、每次约1万个令牌的推出量,针对更大的Ultra模型进行缩放。平台间的智能每美元独立于此假设;绝对值随令牌数量缩放。NVIDIA Blackwell平台降低了每次运行的成本,使智能体时代所需的频繁后训练在经济上可行。获取的智能体现在每个被服务的令牌中。 NVIDIA Vera Rubin平台进一步延续了这一趋势,以Blackwell一代四分之一数量的GPU训练了最大的模型。它从端到端进行了协同设计,以最大化智能体后训练负载的智能每美元:每次运行更多的推出量、更多的环境参与其中,以及永不停止的后训练循环。 ## **后训练工作流实战** Prime Intellect的实验室(https://www.primeintellect.ai/blog/nvidia-collaboration)在NVIDIA Blackwell上持续后训练前沿开放模型,并使用NVIDIA Dynamo进行推理编排。借助Vera Rubin,Prime Intellect计划扩展强化学习环境,每次运行生成更多推出量,并加速训练到推理的迭代循环,从而为企业最大化智能每美元。 Prime Intellect已优化其沙箱基础设施,使其与NVIDIA Vera CPU(https://www.nvidia.com/en-us/data-center/vera-cpu/)集成,实现低延迟、高能效的强化学习(https://developer.nvidia.com/blog/mastering-agentic-techniques-ai-agent-reinforcement-learning/)。开源工具和模型,如NVIDIA Nemotron和NVIDIA NeMo Gym,也集成到其软件栈中。在对比真实的强化学习沙箱工作负载与替代x86架构时,Prime Intellect发现Vera平均每CPU吞吐量高出30%。 Perplexity(https://research.perplexity.ai/articles/hosting-qwen-on-blackwell)的RL后训练栈在数百个NVIDIA GPU上异步运行,采用基于RDMA的权重传输引擎,可在不到两秒内将万亿参数模型在训练与推理计算节点之间同步。经过后训练的Qwen3 235B模型随后部署在NVIDIA GB200 NVL72系统上提供服务。 Together AI提供后训练即服务(post-training as a service),包括监督微调、强化学习和直接偏好优化。该服务通过功能丰富的应用程序接口(API)和软件开发工具包(SDK)交付,在其AI原生云平台上支持全范围后训练。它一直在NVIDIA平台和优化内核库上运行,并计划接下来使用Vera Rubin平台。 *了解更多关于**NVIDIA Vera Rubin**(https://www.nvidia.com/en-us/data-center/technologies/rubin/)的信息,这是AI工厂在各工作负载上最大化智能每美元的平台。并探索NVIDIA用于**训练前沿模型**(https://www.nvidia.com/en-us/solutions/ai/ai-training/)的全栈平台。*

相似文章

NVIDIA刚刚发布了全新的Vera CPU——据称比x86快两倍

Reddit r/ArtificialInteligence

NVIDIA宣布了采用全新Vera架构的CPU,该架构从头开始为智能代理AI和强化学习而设计,声称性能达到x86替代方案的两倍。Vera Rubin NVL72平台集成了72个GPU和36个CPU,主要客户包括Meta、Oracle和Alibaba。