AI创新者采用NVIDIA Vera — 大规模最高单线程CPU为何至关重要

NVIDIA Blog 产品

摘要

NVIDIA推出Vera,一款专为智能AI时代设计的新型最高单线程CPU,通过优化每核性能来加速AI智能体循环,最大化AI工厂收入。

<div id="bsf_rt_marker"></div><p><span style="font-weight: 400;">大规模最高单线程CPU是为智能AI时代打造的新类别CPU。</span></p> <p><span style="font-weight: 400;">在智能体系统的创建和部署过程中,CPU处于推理、响应时间和学习的关键路径上。CPU是执行AI模型所指挥工作的处理器:工具调用、代码执行、数据处理、KV缓存和结果分析。</span></p> <p><span style="font-weight: 400;">对于AI工厂中的智能体而言,速度至关重要。</span></p> <p><span style="font-weight: 400;">CPU运行工具的速度越快,智能体执行手头任务的速度就越快。</span></p> <p><span style="font-weight: 400;">对于AI工厂来说,GPU的利用率是数据中心中最宝贵的资源,因此任何等待任务完成的时间都会限制AI工厂的收入——甚至更糟,会影响等待CPU完成任务时的GPU利用率。AI工厂需要一款具有最高单线程性能的CPU,以最大化AI工厂收入和智能体性能。</span></p> <p><span style="font-weight: 400;">当今的数据中心CPU并非为大规模速度而设计。</span></p> <p><span style="font-weight: 400;">虽然世界上有为个人电脑和工作站打造的快速CPU,但数据中心CPU的发展方向已偏离单线程性能。云计算的兴起促使CPU制造商构建更高核心数的CPU,同时以牺牲性能为代价来最小化成本。</span></p> <p><span style="font-weight: 400;">构建优化每租用核心成本的CPU增加了每芯片的核心数量,同时减少了用于使这些核心快速运行的硅面积——例如高性能内存架构和每核更快的指令处理。向芯粒架构的转变进一步降低了成本,但造成了“芯粒税”,即每个CPU核心不再能完全访问芯片的全部内存性能。</span></p> <p><span style="font-weight: 400;">AI智能体需要一款专为大规模最高单线程性能设计的CPU。</span></p> <p><span style="font-weight: 400;">大规模最高单线程CPU确保在系统满载时每个智能体步骤依然快速。每个核心以全性能完成智能体任务,不受其他核心拖慢。大规模最高单线程CPU通过不同设计来提供:</span></p> <ul> <li style="font-weight: 400;" aria-level="1"><span style="font-weight: 400;">负载下每核的强劲性能</span></li> <li style="font-weight: 400;" aria-level="1"><span style="font-weight: 400;">每核足够的内存带宽,确保活动核心数据供应充足</span></li> <li style="font-weight: 400;" aria-level="1"><span style="font-weight: 400;">可预测的延迟</span></li> </ul> <p><span style="font-weight: 400;">每个核心都能独立完成任务,不受其他核心影响,提供出色的吞吐量,更重要的是,实现最快的单核任务性能。</span></p> <p><span style="font-weight: 400;">NVIDIA Vera体现了这种新型CPU设计。</span></p> <h2><b>大规模最高单线程CPU如何构建以运行智能体循环</b></h2> <p><span style="font-weight: 400;">AI智能体在单个请求后不会停止运行。它在一个循环中运作。模型推理下一步。CPU执行模型周围的工作。结果返回。模型决定下一步做什么。然后循环再次运行。</span></p> <p><span style="font-weight: 400;">这种模式产生了一种需求曲线,传统CPU并未对此优化。传统CPU工作是间歇性的、由用户驱动的,由人们触发的短交互组成。智能体工作是持续且并行的:智能体群持续运行,每个智能体通过一系列步骤前进,每个步骤依赖于前一步的结果。</span></p> <p><span style="font-weight: 400;">CPU中的更多核心意味着每个CPU可处理更多智能体任务,数据中心CPU需要大量核心以最大化任务吞吐量。</span></p> <p><span style="font-weight: 400;">然而,向CPU添加更多核心不能缩短单个智能体循环中每一步的时间。更多核心不能让任何单个任务运行得更快。事实上,旨在最大化核心数的CPU甚至可能因核心竞争资源而降低每个核心的性能。</span></p> <p><span style="font-weight: 400;">单个每核性能对于驱动每一步的完成速度至关重要。额外核心的吞吐量有用但不足。由于每个行动依赖于前一个结果,每核速度决定了循环前进的速度。</span></p> <figure id="attachment_95990" aria-describedby="caption-attachment-95990" style="width: 1079px" class="wp-caption aligncenter"><img fetchpriority="high" decoding="async" class="size-full wp-image-95990" src="https://blogs.nvidia.com/wp-content/uploads/2026/07/single-threaded-core-performance-vs-throughput.png" alt="" width="1079" height="784" srcset="https://blogs.nvidia.com/wp-content/uploads/2026/07/single-threaded-core-performance-vs-throughput.png 1079w, https://blogs.nvidia.com/wp-content/uploads/2026/07/single-threaded-core-performance-vs-throughput-960x698.png 960w, https://blogs.nvidia.com/wp-content/uploads/2026/07/single-threaded-core-performance-vs-throughput-630x458.png 630w" sizes="(max-width: 1079px) 100vw, 1079px" /><figcaption id="caption-attachment-95990" class="wp-caption-text">单线程核心性能与吞吐量对比。</figcaption></figure> <p><span style="font-weight: 400;">最终,最佳智能体CPU需要每个核心拥有最佳单线程性能,并且每个核心需毫无妥协地提供该性能。世界以秒计数。智能体以纳秒计数。NVIDIA Vera正是为这种新类别和速度的工作而构建。</span></p> <h2><b>NVIDIA Vera是面向智能体的大规模最高单线程CPU</b></h2> <p><span style="font-weight: 400;">NVIDIA Vera是一款大规模最高单线程CPU,从底层为智能体循环设计:即模型调用之间智能体使用工具、处理数据、运行代码和检查结果的工作。</span></p> <figure id="attachment_95993" aria-describedby="caption-attachment-95993" style="width: 960px" class="wp-caption aligncenter"><img decoding="async" class="size-medium wp-image-95993" src="https://blogs.nvidia.com/wp-content/uploads/2026/07/nvidia-vera-960x510.jpg" alt="" width="960" height="510" srcset="https://blogs.nvidia.com/wp-content/uploads/2026/07/nvidia-vera-960x510.jpg 960w, https://blogs.nvidia.com/wp-content/uploads/2026/07/nvidia-vera-630x335.jpg 630w, https://blogs.nvidia.com/wp-content/uploads/2026/07/nvidia-vera.jpg 1280w" sizes="(max-width: 960px) 100vw, 960px" /><figcaption id="caption-attachment-95993" class="wp-caption-text">NVIDIA Vera CPU。</figcaption></figure> <p><span style="font-weight: 400;">Vera的核心是Olympus,NVIDIA自研CPU核心,每时钟周期指令数比NVIDIA Grace高50%。这很重要,因为许多智能体步骤是顺序的。工具调用、代码执行、测试运行或数据处理步骤必须在下一个模型调用能使用结果之前完成。更快的核心推动每个循环更快前进。</span></p> <p><span style="font-weight: 400;">Vera将这些更快的核心与高达1.2TB/s的LPDDR5X内存带宽(功耗低于40瓦)配对,加上单片计算芯片,帮助活动核心保持数据供应,并以3.4TB/s的核心间带宽(是任何其他数据中心CPU的3倍)确保数据移动可预测。这使得所有88个核心都能获得CPU的全部内存性能,而不会产生拖慢每个核心的瓶颈。</span></p>
查看原文
查看缓存全文

缓存时间: 2026/07/07 16:38

# AI创新者采用NVIDIA Vera——为什么大规模最高单线程CPU至关重要 来源:https://blogs.nvidia.com/blog/nvidia-vera-max-single-threaded-cpu-at-scale/ 大规模最高单线程CPU是为智能体AI时代打造的全新CPU品类。 在智能体系统的创建与部署过程中,CPU处于推理、响应时间和学习的关键路径上。CPU负责执行AI模型指令的工作:工具调用、代码执行、数据处理、KV缓存和结果分析。 对于AI工厂中的智能体而言,速度至关重要。 CPU运行工具的速度越快,智能体执行手头任务的速度就越快。 对于AI工厂来说,GPU利用率是数据中心最宝贵的资源,因此任何等待任务完成的时间都会制约AI工厂的收入——更糟的是,这会因为等待CPU完成任务而影响GPU利用率。AI工厂需要具备最高单线程性能的CPU,以最大化AI工厂收入和智能体性能。 当今的数据中心CPU并非为大规模速度而设计。 虽然世界上的PC和工作站拥有快速的CPU,但数据中心CPU一直在朝着背离单线程性能的方向发展。云计算的兴起促使CPU制造商在牺牲性能以最小化成本的同时,构建更高核心数的CPU。 构建优化每可租用核心成本的CPU,增加了每颗芯片的核心数量,同时却减少了让这些核心高速运行的硅面积——比如高性能内存结构和每核心更快的指令处理。转向小芯片架构进一步降低了成本,但产生了"小芯片税",即每个CPU的核心再也无法获得芯片完整的内存性能。 AI智能体需要为大规模最高单线程性能而设计的CPU。 大规模最高单线程CPU在系统满载时仍能保持每个智能体步骤的快速执行。每个核心都能以完全性能完成智能体任务,而不受其他核心拖累。大规模最高单线程CPU以不同的方式设计,以提供: - 负载下每核心的强劲性能 - 每核心足够的内存带宽,以持续为活跃核心提供数据 - 可预测的延迟 每个核心都能独立完成其任务,不受其他核心影响,从而提供出色的吞吐量,更重要的是,实现尽可能快的单核任务性能。 NVIDIA Vera正是这种新型CPU设计的典范。 ## **大规模最高单线程CPU如何构建以运行智能体循环** AI智能体不会在单个请求后停止运行。它以循环方式运作。模型推理下一步行动。CPU执行模型周围的工作。结果返回。模型决定接下来做什么。然后循环再次运行。 这种模式产生了一种传统CPU并未优化的需求特征。传统CPU工作是间歇性的、由用户驱动的,由人类触发的短暂交互组成。而智能体工作是持续且并行的:成群结队的智能体持续运行,每个都沿着一系列步骤推进,每一步都依赖于前一步的结果。 CPU中更多的核心意味着每个CPU能处理更多智能体任务,数据中心CPU需要大量核心以最大化任务吞吐量。 然而,为CPU增加更多核心并不能缩短单个智能体循环中每一步的时间。更多核心无法让任何一个任务运行得更快。事实上,为最大化核心数而设计的CPU甚至可能因资源争用而降低每个核心的性能。 单个核心的性能对于驱动每一步的完成速度至关重要。额外核心的吞吐量虽然有用但不够。由于每个操作都依赖于前一个结果,每核心速度决定了循环前进的速度。 单线程核心性能 vs. 吞吐量。最终,最佳的智能体CPU需要每核心具备最佳的单线程性能,并且每个核心都需要在不妥协的情况下提供这种性能。世界以秒计数。智能体以纳秒计数。NVIDIA Vera正是为这种新型工作——及其速度——而构建。 ## **NVIDIA Vera是面向智能体的大规模最高单线程CPU** NVIDIA Vera是大规模最高单线程CPU,从头开始为智能体循环设计:指智能体使用工具、处理数据、运行代码和检查结果时发生在模型调用之间的工作。 NVIDIA Vera CPU。Vera的核心是Olympus,NVIDIA的定制CPU核心,其每周期指令数比NVIDIA Grace高出50%。这一点很重要,因为许多智能体步骤是顺序执行的。工具调用、代码执行、测试运行或数据处理步骤必须在下一个模型调用可以使用结果之前完成。更快的核心能让每个循环更快地推进。 Vera将这些更快的核心与高达1.2TB/s的LPDDR5X内存带宽(内存功耗低于40瓦)配对,再加上一个单片计算芯片,有助于保持活跃核心的供给,并通过3.4TB/s的核心间带宽(是任何其他数据中心CPU的3倍)使数据移动可预测。这使得所有88个核心都能获得CPU的完整内存性能,而不会产生拖慢每个核心的瓶颈。 结果是更快的智能体循环。在代表智能体执行的负载CPU工作负载中,Vera的持续每核心性能是x86的1.8倍。 这些增益在工具调用、代码执行、数据处理步骤和验证过程中不断累积,帮助AI工厂利用其已有GPU完成更多智能体工作。 Perplexity在Vera上测试了其每天运行的智能体工作。运行真实编码工作流——克隆仓库并在沙箱中运行其测试套件——Vera完成任务的速度比x86快约1.5倍,启动并发沙箱的速度最高快1.9倍。Perplexity目前正计划在其即将推出的生产系统中部署Vera。 智能体也依赖数据。它们持续查询、检索、过滤和移动信息,Vera能更快地运行这些CPU侧的数据工作负载。合作伙伴测量到,与领先的x86服务器CPU相比,使用Starburst进行大规模SQL分析速度提升3倍,使用Redpanda进行实时流式处理的延迟最高降低6倍。 智能体工作并非单一工作负载。一个智能体运行工具和沙箱、处理数据、处理请求并通过强化学习训练下一个模型——所有这些都依赖于相同的优势。 一个Vera就能处理整个范围,而不需要为每种工作配备不同的CPU。而且,由于Vera与在NVIDIA Vera Rubin中托管GPU并驱动NVIDIA BlueField-4 STX存储处理器的CPU相同,整个AI工厂运行在统一的架构和工具链上。 NVIDIA并未止步。NVIDIA的下一代Rosa CPU(采用Rigel核心)将继续公司在智能体AI时代的CPU路线图。Rigel是NVIDIA的下一代Arm v9.2 CPU核心,在保持相同硅面积的同时提供比Olympus更高的每核心性能。主要改进包括更好的指令交付、更大的L2缓存和更高效的内存处理。 ## **为智能体的速度而构建** 在智能体AI时代,将存在数十亿个智能体,每个智能体都将依靠CPU来执行、检查、检索、执行和验证。在这个新市场中,完成的智能体工作就是产品。更快的智能体循环有助于每个GPU将更多时间用于产生收入的工作,而减少等待时间。 NVIDIA Vera正是为那个未来而构建的CPU。 *了解更多关于**NVIDIA Vera CPU* (https://www.nvidia.com/en-us/data-center/vera-cpu/)*的信息。*

相似文章

NVIDIA刚刚发布了全新的Vera CPU——据称比x86快两倍

Reddit r/ArtificialInteligence

NVIDIA宣布了采用全新Vera架构的CPU,该架构从头开始为智能代理AI和强化学习而设计,声称性能达到x86替代方案的两倍。Vera Rubin NVL72平台集成了72个GPU和36个CPU,主要客户包括Meta、Oracle和Alibaba。