为什么每瓦性能是AI基础设施效率的终极指标

NVIDIA Blog 新闻

摘要

NVIDIA认为每瓦性能是衡量AI基础设施效率的关键指标,并强调其Blackwell和Vera Rubin平台在MoE模型上实现了相比Hopper高达25倍的提升。

<div id="bsf_rt_marker"></div><p><span style="font-weight: 400;">功耗是AI基础设施无法回避的约束。在固定功耗预算内,一个AI工厂能够生成多少</span><a href="https://blogs.nvidia.com/blog/ai-tokens-explained/"><span style="font-weight: 400;">token</span></a><span style="font-weight: 400;">决定了它的收入和盈利能力。正因如此,每瓦性能——这一无法投机取巧、只能通过实际成果赢得的指标——成为了AI工厂的基石。</span></p> <p><span style="font-weight: 400;">随着智能体AI推动token需求持续攀升,如今组织所做的基础设施决策,将决定谁能在功耗受限的世界中实现规模化扩张,而谁将被淘汰。</span></p> <p><span style="font-weight: 400;">当前几乎所有前沿AI模型都运行在</span><a href="https://blogs.nvidia.com/blog/mixture-of-experts-frontier-models/"><span style="font-weight: 400;">混合专家模型</span></a><span style="font-weight: 400;">(MoE)架构之上。在机架规模上部署MoE需要系统与软件栈每一层的协同设计,以及从实际生产负载运行中积累的运营深度。借助</span><a target="_blank" href="https://www.nvidia.com/en-us/data-center/technologies/blackwell-architecture/"><span style="font-weight: 400;">NVIDIA Blackwell NVL72平台</span></a><span style="font-weight: 400;">,这一机架级基础已经建成并得到验证,能够提供最高的每瓦性能以实现收入最大化,以及最低的token成本以实现利润空间最大化。正是这一基础,使得下一代</span><a target="_blank" href="https://www.nvidia.com/en-us/data-center/technologies/rubin/"><span style="font-weight: 400;">NVIDIA Vera Rubin</span></a><span style="font-weight: 400;">平台得以进一步提升机架级能效。</span></p> <h2><b>最大化前沿AI的每瓦性能</b></h2> <p><span style="font-weight: 400;">每一代前沿模型都会带来架构变革,解锁更强的智能能力,同时也需要新的优化手段才能在规模上高效运行。</span></p> <p><span style="font-weight: 400;">在最新一代领先开源模型中,NVIDIA GB300 NVL72相比NVIDIA Hopper代实现了高达25倍的每瓦性能提升。这些数字反映了Blackwell目前所处的水平,这是一个持续改进的起点。</span></p> <p><span style="font-weight: 400;">任何单一数字都只能讲述部分故事。不同的工作负载需要不同的运行点:有些优化延迟,有些优化吞吐量和成本——而大多数工作负载需要在两者之间切换。</span></p> <p><span style="font-weight: 400;">为了最好地呈现这些运行点,NVIDIA展示的是每个模型的帕累托曲线,而非单一数据点,并提供诸如</span><a target="_blank" href="https://developer.nvidia.com/blog/dynosim-simulating-the-pareto-frontier/"><span style="font-weight: 400;">DynoSim</span></a><span style="font-weight: 400;">之类的工具,帮助团队在花费GPU时间进行验证之前,就找到帕累托前沿上的最优运行点。</span></p> <figure id="attachment_96113" aria-describedby="caption-attachment-96113" style="width: 1170px" class="wp-caption alignnone"><img fetchpriority="high" decoding="async" class="wp-image-96113 size-full" src="https://blogs.nvidia.com/wp-content/uploads/2026/07/nvidia-blackwell-delivers-25x-throughput-per-watt.png" alt="" width="1170" height="595" srcset="https://blogs.nvidia.com/wp-content/uploads/2026/07/nvidia-blackwell-delivers-25x-throughput-per-watt.png 1170w, https://blogs.nvidia.com/wp-content/uploads/2026/07/nvidia-blackwell-delivers-25x-throughput-per-watt-960x488.png 960w, https://blogs.nvidia.com/wp-content/uploads/2026/07/nvidia-blackwell-delivers-25x-throughput-per-watt-630x320.png 630w" sizes="(max-width: 1170px) 100vw, 1170px" /><figcaption id="caption-attachment-96113" class="wp-caption-text">NVIDIA GB300 NVL72系统在DeepSeek V4 Pro上相比NVIDIA Hopper实现了最高25倍的每瓦性能。来源:SemiAnalysis InferenceX</figcaption></figure> <figure id="attachment_96104" aria-describedby="caption-attachment-96104" style="width: 1189px" class="wp-caption alignnone"><img decoding="async" class="size-full wp-image-96104" src="https://blogs.nvidia.com/wp-content/uploads/2026/07/nvidia-blackwell-delivers-20x-throughput-per-megawatt.png" alt="" width="1189" height="615" srcset="https://blogs.nvidia.com/wp-content/uploads/2026/07/nvidia-blackwell-delivers-20x-throughput-per-megawatt.png 1189w, https://blogs.nvidia.com/wp-content/uploads/2026/07/nvidia-blackwell-delivers-20x-throughput-per-megawatt-960x497.png 960w, https://blogs.nvidia.com/wp-content/uploads/2026/07/nvidia-blackwell-delivers-20x-throughput-per-megawatt-630x326.png 630w" sizes="(max-width: 1189px) 100vw, 1189px" /><figcaption id="caption-attachment-96104" class="wp-caption-text">在GLM5.1上,NVIDIA GB300 NVL72系统相比NVIDIA Hopper实现了最高20倍的每瓦性能。来源:SemiAnalysis InferenceX</figcaption></figure> <figure id="attachment_96110" aria-describedby="caption-attachment-96110" style="width: 1179px" class="wp-caption alignnone"><img decoding="async" class="size-full wp-image-96110" src="https://blogs.nvidia.com/wp-content/uploads/2026/07/nvidia-blackwell-delivers-10x-throughput-per-megawatt.png" alt="" width="1179" height="622" srcset="https://blogs.nvidia.com/wp-content/uploads/2026/07/nvidia-blackwell-delivers-10x-throughput-per-megawatt.png 1179w, https://blogs.nvidia.com/wp-content/uploads/2026/07/nvidia-blackwell-delivers-10x-throughput-per-megawatt-960x506.png 960w, https://blogs.nvidia.com/wp-content/uploads/2026/07/nvidia-blackwell-delivers-10x-throughput-per-megawatt-630x332.png 630w" sizes="(max-width: 1179px) 100vw, 1179px" /><figcaption id="caption-attachment-96110" class="wp-caption-text">NVIDIA GB300 NVL72系统在Kimi K2.6(一款专为长期智能体任务设计的模型)上相比NVIDIA Hopper实现了最高10倍的每瓦性能。来源:SemiAnalysis InferenceX</figcaption></figure> <p><span style="font-weight: 400;">NVIDIA Blackwell实现的每瓦性能是深度协同设计的结果:机架级系统的每一个组件,从硅片到</span><a href="https://blogs.nvidia.com/blog/inference-software-lowest-token-cost/"><span style="font-weight: 400;">软件</span></a><span style="font-weight: 400;">,都经过协同设计以最大化AI推理工作负载的token吞吐量。这种协同设计贯穿堆栈的每一层。</span></p> <p><span style="font-weight: 400;">例如,</span><a target="_blank" href="https://www.nvidia.com/en-us/data-center/nvlink/"><span style="font-weight: 400;">NVIDIA NVLink Switch</span></a><span style="font-weight: 400;">对机架级性能至关重要,它专为GPU扩展域设计,而非从通用网络适配而来。现在随着Vera Rubin平台进入第六代,其能力专为AI工作负载设计,例如SHARP(直接在交换机中执行网络内计算,从而减少GPU自身的计算负载)。</span></p> <p><span style="font-weight: 400;">NVIDIA的</span><a href="https://blogs.nvidia.com/blog/inference-software-lowest-token-cost/"><span style="font-weight: 400;">推理软件堆栈</span></a><span style="font-weight: 400;">,包括NVIDIA Dynamo和TensorRT LLM,以及SGLang和vLLM,旨在运行全面的优化功能:NVFP4量化、分离式服务、大规模专家并行、KV感知路由、KV缓存卸载等。这些优化叠加起来,成倍提升了每个GPU的性能。此外,软件还在持续提升性能:在DeepSeek V4上,每瓦性能提升了高达</span></p>
查看原文
查看缓存全文

缓存时间: 2026/07/14 16:15

# 为什么每瓦性能是AI基础设施效率的终极指标 来源:https://blogs.nvidia.com/blog/performance-per-watt-ai-infrastructure-efficiency/ 电力是AI基础设施无法回避的约束。一个AI工厂在固定电力预算内能生成多少[令牌](https://blogs.nvidia.com/blog/ai-tokens-explained/),决定了它的收入和盈利能力。正因如此,每瓦性能——一个无法作弊、只能通过实际成果赢得的指标——成为AI工厂的基石。 随着智能体AI推动令牌需求不断攀升,组织今天做出的基础设施决策,将决定谁能在电力受限的世界中规模化发展,谁将被淘汰。 几乎所有前沿AI模型如今都采用[混合专家](https://blogs.nvidia.com/blog/mixture-of-experts-frontier-models/)(MoE)架构。在机架级规模上服务MoE,需要系统与软件栈每一层的协同设计,再加上在真实生产负载下运行这些模型所积累的运营深度。借助[NVIDIA Blackwell NVL72平台](https://www.nvidia.com/en-us/data-center/technologies/blackwell-architecture/),这一机架级基础已经构建并得到验证,以最高的每瓦性能最大化收入,以及最低的令牌成本最大化利润率。正是这一基础,让[NVIDIA Vera Rubin](https://www.nvidia.com/en-us/data-center/technologies/rubin/)平台在此基础上进一步演进,提升机架级能效。 ## **最大化前沿AI的每瓦性能** 每一代前沿模型都会带来架构变化,解锁更高智能的同时,也需要新的优化才能高效规模化运行。 在最新一代领先开源模型中,NVIDIA GB300 NVL72相比NVIDIA Hopper代际,每瓦性能提升高达25倍。这些数字反映了Blackwell如今的起点,而且还在持续改善。 任何单一数字都只能说明部分情况。不同的工作负载需要不同的工作点:有些优化延迟,有些优化吞吐量和成本——而大多数需要在两者之间动态切换。 为了更好地代表这些工作点,NVIDIA为每个模型展示帕累托曲线而非单个点,并提供[DynoSim](https://developer.nvidia.com/blog/dynosim-simulating-the-pareto-frontier/)等工具,帮助团队在花费哪怕一个GPU小时进行验证之前,找到帕累托边界上的最优工作点。 NVIDIA GB300 NVL72系统在DeepSeek V4 Pro上每瓦性能相比NVIDIA Hopper提升高达25倍。来源:SemiAnalysis InferenceX 在GLM 5.1上,NVIDIA GB300 NVL72系统每瓦性能相比NVIDIA Hopper提升高达20倍。来源:SemiAnalysis InferenceX NVIDIA GB300 NVL72系统在Kimi K2.6(一个专为长程智能体任务构建的模型)上,每瓦性能相比NVIDIA Hopper提升高达10倍。来源:SemiAnalysis InferenceX NVIDIA Blackwell实现的每瓦性能是极端协同设计的结果:从硅片到[软件](https://blogs.nvidia.com/blog/inference-software-lowest-token-cost/),机架级系统的每个组件都经过共同设计,以最大化AI推理工作负载的令牌吞吐量。这种协同设计触及栈的每一层。 例如,[NVIDIA NVLink Switch](https://www.nvidia.com/en-us/data-center/nvlink/)对机架级性能至关重要,它是专为GPU扩展域设计的,而非改编自通用网络。现在进入第六代(与Vera Rubin平台一同),其能力专为AI工作负载设计,例如SHARP,它直接在交换机中执行网络内计算,从而减轻GPU自身的负担。 NVIDIA的[推理软件栈](https://blogs.nvidia.com/blog/inference-software-lowest-token-cost/),包括NVIDIA Dynamo和TensorRT LLM,以及SGLang和vLLM,旨在运行全套优化:NVFP4量化、解耦服务、大规模专家并行、KV感知路由、KV缓存卸载等。这些技术叠加起来,放大了每个GPU的性能。此外,软件持续提升性能:在DeepSeek V4上,每瓦性能在一个月内提升了高达5倍。 在AI工厂中,因冷却和机架级低效而损失的电力,可能意味着从电网取电中只有约60%转化为有效的AI工作。NVIDIA DSX MaxLPS是[NVIDIA DSX](https://www.nvidia.com/en-us/data-center/products/dsx/)平台中的电力与效率软件,它通过实时在GPU和机架之间转移电力、支持温水液冷,并利用电力转向等技术来榨取更多性能,从而弥合这一差距。这使得运营商能在相同电力预算内运行多达40%更多的GPU。 ## **生产环境才是关键** 在AI工厂规模下的机架级可靠性来之不易。机架级系统会引入单节点部署从未遇到的故障模式,处理这些模式需要工程严谨性和生产运行时间。 NVIDIA Blackwell NVL72系统在各种模型和生产用例中持续树立标准,提供持续性能、机架级可靠性以及在实际流量下日复一日保持稳定的经济效益。 这就是为什么[Anthropic](https://www.anthropic.com/)和[OpenAI](https://openai.com/)等领先AI实验室使用NVIDIA Blackwell NVL72系统运行推理的原因。 此外,众多推理服务提供商和AI原生公司也在使用Blackwell平台部署开源模型投入生产。 [CoreWeave](https://www.coreweave.com/)已在NVIDIA GB300 NVL72上部署了Kimi K2.6,结合NVFP4量化和EAGLE3推测解码,最大化推理性能。 [Perplexity](https://www.perplexity.ai/)在其AI智能体平台上运行Qwen3 235B和后训练的Qwen3.5-397B-A17B(基于NVIDIA GB200 NVL72),每天服务数百万查询,满足消费者所需的延迟和可靠性。 [Fireworks AI](https://fireworks.ai/)在NVIDIA Blackwell平台上部署GLM 5.2,为Cursor和Factory AI等客户实现生产部署。 这种跨世代前沿模型和实际部署积累的生产经验,正是NVIDIA Vera Rubin获得先发优势的根基。 *在本**技术博客**中了解更多关于NVIDIA Vera Rubin平台的信息,并查看**NVIDIA DSX AI工厂级平台及DSX MaxLPS**的详细信息。*

相似文章

性价比不断提升,成本不断降低

Reddit r/singularity

Wafer 证实,AMD MI355X GPU 在推理前沿模型(如 GLM5.2)时,提供了有竞争力的性能,且成本远低于 NVIDIA Blackwell,使用 MXFP4 量化和 sglang 框架,以不到一半的价格实现了 B200 80% 的吞吐量。