每瓦功耗工作量提升高达30倍:NVIDIA Vera Rubin NVL72为AI智能体树立新能效标准

NVIDIA Blog 产品

摘要

NVIDIA Vera Rubin NVL72系统在智能体AI工作负载中,展现出每兆瓦吞吐量提升高达30倍的性能,为AI基础设施设定了新的效率标准。

<div id="bsf_rt_marker"></div><p><span style="font-weight: 400;">根据 </span><a target="_blank" href="https://openrouter.ai/blog/insights/deepseek-v4-adoption/"><span style="font-weight: 400;">OpenRouter 的数据</span></a><span style="font-weight: 400;">,智能体AI工作负载消耗的token数量是简单聊天请求的15倍。原因何在?</span></p> <p><span style="font-weight: 400;">设想一下当AI智能体为一项投资决策研究一家公司时会发生什么。该智能体会查询金融数据库、搜索新闻和文件、调用子智能体运行同行比较和估值模型,然后将所有信息综合成一份建议。智能体及其子智能体持续推理直至任务完成,这导致了对token需求的不断增加。每一步骤中,累积的token都会成为下一步骤的输入,这使得长上下文处理成为智能体AI性能的核心。</span></p> <p><img loading="lazy" decoding="async" class="alignnone wp-image-97855 size-full" src="https://blogs.nvidia.com/wp-content/uploads/2026/08/end-to-end-corp-blog-diagram-agentx-activation-1280x680-5565900.gif" alt="" width="1280" height="680" /></p> <p><span style="font-weight: 400;">同样的模式适用于每一个智能体应用场景,从软件开发到客户服务再到深度研究。</span></p> <p><span style="font-weight: 400;">随着智能体AI在各行各业投入生产,运行它的基础设施需要高效地满足这种token需求。</span></p> <p><span style="font-weight: 400;">新的实测性能数据显示,NVIDIA Vera Rubin NVL72系统在智能体工作负载上的每兆瓦吞吐量比NVIDIA GB300 NVL72系统提升高达30倍。</span><span style="font-weight: 400;">NVIDIA使用SemiAnalysis AgentX工作负载测量了这一推理吞吐量数据,该工作负载由真实的智能体编程会话记录组成,保留了实际的上下文增长、工具调用和子智能体生成。对于电力受限的AI工厂而言,这意味着在相同的能耗下,可以完成多达30倍的智能体工作。</span></p> <p><span style="font-weight: 400;">Vera Rubin NVL72的这些早期结果展示了NVIDIA持续加快的创新步伐。通过不断的软件优化,Vera Rubin NVL72和GB300 NVL72的性能都将继续提升。</span></p> <h2><b>Vera Rubin NVL72:每兆瓦吞吐量提升30倍,每token成本降低35倍</b></h2> <p><span style="font-weight: 400;">智能体工作负载与聊天或文档摘要有着根本的不同,后者的输入输出序列通常在1K到8K token之间。在智能体会话中,上下文在步骤间累积,输入token可达数十万,且请求间的输入和输出长度变化很大。性能衡量标准必须进化,以捕获完整的智能体工作流,而不仅仅是单次推理请求。</span></p> <p><img loading="lazy" decoding="async" class="alignnone size-full wp-image-97856" src="https://blogs.nvidia.com/wp-content/uploads/2026/08/InferenceNeedsAgenticBenchmarks-scaled.png" alt="" width="2048" height="1152" srcset="https://blogs.nvidia.com/wp-content/uploads/2026/08/InferenceNeedsAgenticBenchmarks-scaled.png 2048w, https://blogs.nvidia.com/wp-content/uploads/2026/08/InferenceNeedsAgenticBenchmarks-960x540.png 960w, https://blogs.nvidia.com/wp-content/uploads/2026/08/InferenceNeedsAgenticBenchmarks-1680x945.png 1680w, https://blogs.nvidia.com/wp-content/uploads/2026/08/InferenceNeedsAgenticBenchmarks-1280x720.png 1280w, https://blogs.nvidia.com/wp-content/uploads/2026/08/InferenceNeedsAgenticBenchmarks-1536x864.png 1536w, https://blogs.nvidia.com/wp-content/uploads/2026/08/InferenceNeedsAgenticBenchmarks-1290x725.png 1290w, https://blogs.nvidia.com/wp-content/uploads/2026/08/InferenceNeedsAgenticBenchmarks-630x354.png 630w, https://blogs.nvidia.com/wp-content/uploads/2026/08/InferenceNeedsAgenticBenchmarks-300x169.png 300w, https://blogs.nvidia.com/wp-content/uploads/2026/08/InferenceNeedsAgenticBenchmarks-400x225.png 400w" sizes="auto, (max-width: 2048px) 100vw, 2048px" /></p> <p><span style="font-weight: 400;">以下结果反映了在真实世界智能体编程轨迹上测得的性能。</span></p> <p><span style="font-weight: 400;">在 </span><a target="_blank" href="https://newsletter.semianalysis.com/p/agentx-inferencexv3-does-cuda-moat"><span style="font-weight: 400;">SemiAnalysis AgentX</span></a><span style="font-weight: 400;"> 中,NVIDIA Blackwell 平台在包括 Kimi K3、MiniMax M3、GLM5.3、Qwen3.5 和 DeepSeek V4 Pro 在内的多种智能体模型上均提供了领先的性能。</span></p> <p><span style="font-weight: 400;">例如,<a target="_blank" href="https://developer.nvidia.com/blog/nvidia-vera-rubin-and-blackwell-set-a-new-standard-for-agentic-ai-performance-per-watt/?ncid=so-inst-151306">GB300 NVL72 在 DeepSeek V4 Pro 模型上提供的每兆瓦吞吐量比 NVIDIA Hopper 架构提升多达 15 倍</a>,为客户提供了一个运行智能体工作负载的高性能基础。这一飞跃反映了更大规模的GPU域协同设计软件在提供显著更好的推理效率方面的优势。</span></p> <p><span style="font-weight: 400;">Vera Rubin 扩展了这一优势,提升了整个帕累托曲线上的性能,在 DeepSeek V4 Pro 模型上,其每兆瓦吞吐量比 GB300 NVL72 提升高达 30 倍。这些早期结果,使用SemiAnalysis AgentX工作负载测量,目前尚待SemiAnalysis审查,尚未反映Vera CPU在工具调用方面的性能。</span></p> <p><img loading="lazy" decoding="async" class="alignnone size-full wp-image-97890" src="https://blogs.nvidia.com/wp-content/uploads/2026/08/end-to-end-social-chart1-agentx-activation-s1-1920x1080-1.jpg" alt="" width="1920" height="1080" srcset="https://blogs.nvidia.com/wp-content/uploads/2026/08/end-to-end-social-chart1-agentx-activation-s1-1920x1080-1.jpg 1920w, https://blogs.nvidia.com/wp-content/uploads/2026/08/end-to-end-social-chart1-agentx-activation-s1-1920x1080-1-960x540.jpg 960w, https://blogs.nvidia.com/wp-content/uploads/2026/08/end-to-end-social-chart1-agentx-activation-s1-1920x1080-1-1680x945.jpg 1680w, https://blogs.nvidia.com/wp-content/uploads/2026/08/end-to-end-social-chart1-agentx-activation-s1-1920x1080-1-1280x720.jpg 1280w, https://blogs.nvidia.com/wp-content/uploads/2026/08/end-to-end-social-chart1-agentx-activation-s1-1920x1080-1-1536x864.jpg 1536w, https://blogs.nvidia.com/wp-content/uploads/2026/08/end-to-end-social-chart1-agentx-activation-s1-1920x1080-1-1290x725.jpg 1290w, https://blogs.nvidia.com/wp-content/uploads/2026/08/end-to-end-social-chart1-agentx-activation-s1-1920x1080-1-630x354.jpg 630w, https://blogs.nvidia.com/wp-content/uploads/2026/08/end-to-end-social-chart1-agentx-activation-s1-1920x1080-1-300x169.jpg 300w, https://blogs.nvidia.com/wp-content/uploads/2026/08/end-to-end-social-chart1-agentx-activation-s1-1920x1080-1-400x225.jpg 400w" sizes="auto, (max-width: 1920px) 100vw, 1920px" /></p> <p><span style="font-weight: 400;">NVIDIA DSX MaxLPS 技术在GPU、机架和工作负载层面管理功耗,使得在相同的兆瓦预算内能够部署多达40%的额外GPU,从而在AI工厂规模上进一步提高每兆瓦吞吐量。</span></p> <p><span style="font-weight: 400;">每兆瓦吞吐量也直接影响每个生成token的成本。凭借比GB300 NVL72低达35倍的每百万token成本,Vera Rubin NVL72可以持续、大规模地运行智能体,覆盖客户工作负载的全部广度。</span></p> <p><img loading="lazy" decoding="async" class="alignnone size-full wp-image-97891" src="https://blogs.nvidia.com/wp-content/uploads/2026/08/end-to-end-social-chart1-agentx-activation-s2-1920x1080-1.jpg" alt="" width="1920" height="1080" srcset="https://blogs.nvidia.com/wp-content/uploads/2026/08/end-to-end-social-chart1-agentx-activation-s2-1920x1080-1.jpg 1920w, https://blogs.nvidia.com/wp-content/uploads/2026/08/end-to-end-social-chart1-agentx-activation-s2-1920x1080-1-960x540.jpg 960w, https://blogs.nvidia.com/wp-content/uploads/2026/08/end-to-end-social-chart1-agentx-activation-s2-1920x1080-1-1680x945.jpg 1680w, https://blogs.nvidia.com/wp-content/uploads/2026/08/end-to-end-social-chart1-agentx-activation-s2-1920x1080-1-1280x720.jpg 1280w, https://blogs.nvidia.com/wp-content/uploads/2026/08/end-to-end-social-chart1-agentx-activation-s2-1920x1080-1-1536x864.jpg 1536w, https://blogs.nvidia.com/wp-content/uploads/2026/08/end-to-end-social-chart1-agentx-activation-s2-1920x1080-1-1290x725.jpg 1290w, https://blogs.nvidia.com/wp-content/uploads/2026/08/end-to-end-social-chart1-agentx-activation-s2-1920x1080-1-630x354.jpg 630w, https://blogs.nvidia.com/wp-content/uploads/2026/08/end-to-end-social-chart1-agentx-activation-s2-1920x1080-1-300x169.jpg 300w, https://blogs.nvidia.com/wp-content/uploads/2026/08/end-to-end-social-chart1-agentx-activation-s2-1920x1080-1-400x225.jpg 400w" sizes="auto, (max-width: 1920px) 100vw, 1920px" />
查看原文
查看缓存全文

缓存时间: 2026/08/24 16:04

# 每瓦性能提升高达30倍:NVIDIA Vera Rubin NVL72为智能体AI设立效率新标杆 来源:https://blogs.nvidia.com/blog/vera-rubin-nvl72-efficiency-ai-agents/ 根据OpenRouter数据(https://openrouter.ai/blog/insights/deepseek-v4-adoption/),智能体AI工作负载消耗的token量是简单对话请求的15倍。原因何在? 试想当AI智能体为投资决策研究某家公司时的场景:它需要查询金融数据库、检索新闻与文件、调用子智能体进行同行对比与估值建模,最终将所有信息整合成投资建议。智能体与子智能体持续推理直至任务完成,推动token需求量不断攀升。每一步骤中累积的token都会成为下一步的输入,使得长上下文处理成为智能体AI性能的核心。 这种模式贯穿于从软件开发、客户服务到深度研究的所有智能体应用场景。 随着智能体AI在各行各业投入生产环境,支撑其运行的基础设施必须高效满足这种token需求。 最新性能测试数据显示:在智能体工作负载中,NVIDIA Vera Rubin NVL72系统的每兆瓦吞吐量比NVIDIA GB300 NVL72最高提升30倍。NVIDIA通过SemiAnalysis AgentX工作负载(包含保留实际上下文增长、工具调用及子智能体生成的真实智能体编程会话记录)测得此推理吞吐数据。对于能源受限的AI工厂而言,这意味着相同能耗下可完成30倍的智能体任务。 Vera Rubin NVL72的早期测试结果展现了NVIDIA加速创新的步伐。通过持续软件优化,Vera Rubin NVL72与GB300 NVL72的性能将持续提升。 ## **Vera Rubin NVL72:每兆瓦吞吐量提升30倍,token成本降低35倍** 智能体工作负载与传统对话或文档摘要存在本质差异——后者的输入输出序列通常介于1K至8K token之间。而在智能体会话中,上下文会跨步骤累积,输入token量可达数十万级别,且不同请求的输入输出长度变化极大。性能评估标准需演进以捕捉完整智能体工作流,而非仅关注单次推理请求。 以下结果基于真实智能体编程轨迹的性能测量。 在SemiAnalysis AgentX(https://newsletter.semianalysis.com/p/agentx-inferencexv3-does-cuda-moat)测试中,NVIDIA Blackwell平台在Kimi K3、MiniMax M3、GLM5.3、Qwen3.5和DeepSeek V4 Pro等多款智能体模型上均展现出领先性能。 例如,在DeepSeek V4 Pro模型上,GB300 NVL72的每兆瓦吞吐量比NVIDIA Hopper架构最高提升15倍(https://developer.nvidia.com/blog/nvidia-vera-rubin-and-blackwell-set-a-new-standard-for-agentic-ai-performance-per-watt/?ncid=so-inst-151306),为客户提供运行智能体工作负载的高性能基础。这一飞跃体现了更大规模GPU域与协同设计软件在提升推理效率方面的显著优势。 Vera Rubin进一步拓展该优势,全面优化帕累托曲线性能:在DeepSeek V4 Pro模型上,其每兆瓦吞吐量较GB300 NVL72最高提升30倍。这些通过SemiAnalysis AgentX工作负载测得的早期结果(尚待SemiAnalysis审核)暂未体现Vera CPU在工具调用方面的性能。 NVIDIA DSX MaxLPS技术可在GPU、机架和工作负载层面管理功耗,使相同兆瓦预算下可配置最多40%的GPU,从而在AI工厂规模下进一步推高每兆瓦吞吐量。 每兆瓦吞吐量直接决定每个token的生成成本。Vera Rubin NVL72的每百万token成本较GB300 NVL72最高降低35倍,能够为各类客户工作负载提供持续大规模智能体运行能力。 对能源受限的AI工厂而言,每兆瓦吞吐量决定AI工厂营收(https://www.cio.com/article/4209776/5-critical-questions-that-define-ai-factory-economics.html),而每百万token成本则决定该营收的利润率。 ## **面向智能体规模的极致协同设计** 现代推理优化涵盖多项关键技术,对智能体AI尤为关键。NVIDIA Vera Rubin NVL72通过全栈极致协同设计,赋能所有关键技术并实现多倍性能提升。 - **分离式服务**:将上下文处理(预填充)与响应生成(解码)分离,实现独立扩展 - **速率匹配**:同步预填充GPU与解码GPU的token生成速度以最大化效率 - **大规模专家并行**:将混合专家模型(https://blogs.nvidia.com/blog/mixture-of-experts-frontier-models/)中的专家子网络分布至扩展GPU域 - **分布式KV缓存**:在扩展GPU域内扩展内存,同时将低活跃度上下文分层存储至主机和存储设备,确保已处理上下文可随时访问而无需重新计算 - **KV感知路由**:将请求定向至已持有相关缓存上下文的GPU,减少长会话中的冗余计算 - **融合CUDA内核**:MegaMoE等内核将大量计算与GPU间通信操作融合为单次执行流程,保持GPU活跃状态避免数据等待 NVIDIA Rubin GPU增强的第五代Tensor Cores(https://www.nvidia.com/en-us/data-center/tensor-cores/)与第三代Transformer Engine(https://www.nvidia.com/en-us/data-center/tensor-cores/)可加速推理的预填充与解码阶段。NVFP4量化技术将模型权重压缩至4位精度,在保持输出质量的同时减少内存占用并提升吞吐量。 NVL72扩展GPU域作为Vera Rubin与Grace Blackwell的核心架构,为大规模专家并行、分布式KV缓存等技术提供必要的高带宽、低延迟GPU间通信。专为驱动该扩展域设计的NVIDIA NVLink互联技术(现已迭代至第六代)及NVLink交换机,可实现10倍于商用以太网方案的包转发率与3倍更低的延迟。 从优化CUDA内核、推理运行时(如NVIDIA TensorRT LLM)到服务框架(如NVIDIA Dynamo),NVIDIA的软件栈(https://blogs.nvidia.com/blog/inference-software-lowest-token-cost/)均与硬件协同设计,实现推理优化。 上述结果反映Vera Rubin NVL72当前性能,而完整平台采用七芯片架构,包含NVIDIA Vera CPU、Groq 3 LPU(https://developer.nvidia.com/blog/how-nvidia-groq-3-lpx-unlocks-ultrafast-interactivity-at-long-context-on-nvidia-vera-rubin/)、NVLink 6交换机、BlueField-4 DPU、Spectrum-6 SPX和ConnectX-9超级网卡,所有组件均为支持大规模智能体部署的AI工厂而生。 极致协同设计同样延伸至NVIDIA与合作伙伴的联合工程。Vera Rubin已全面投产并在生态系统中规模部署。 *了解**NVIDIA Vera Rubin平台**更多信息(https://blogs.nvidia.com/blog/vera-rubin/)*。

相似文章

NVIDIA刚刚发布了全新的Vera CPU——据称比x86快两倍

Reddit r/ArtificialInteligence

NVIDIA宣布了采用全新Vera架构的CPU,该架构从头开始为智能代理AI和强化学习而设计,声称性能达到x86替代方案的两倍。Vera Rubin NVL72平台集成了72个GPU和36个CPU,主要客户包括Meta、Oracle和Alibaba。