@PyTorch: 实现更智能、更长时间思考的智能体 通过缩短CPU执行时间规模化智能体AI和强化学习,在…
摘要
NVIDIA推出搭载神经分支预测器的Vera CPU,通过缩短CPU执行时间、提高AI工厂吞吐量,加速智能体AI和强化学习工作负载。
查看缓存全文
缓存时间: 2026/06/11 19:41
打造更智能、更长时间思考的智能体
通过缩短CPU执行时间、提高任务吞吐量并改善整体AI工厂输出来扩展智能体AI和强化学习。
@nvidia 在NVIDIA Vera CPU中定制的Olympus核心采用神经分支预测器,可减少分支密集型代码中的停顿。结合其他预测机制,它能够每个周期维持两条已采用分支且零惩罚,从而保持PyTorch、图工作负载和脚本引擎等深层软件栈的吞吐量。
阅读完整博客文章:
NVIDIA Vera CPU为AI工厂中的智能体工作负载树立新标准
来源:https://developer.nvidia.com/blog/nvidia-vera-cpu-sets-a-new-standard-for-agentic-workloads-in-ai-factories/ 每一次AI浪潮都催生了新的扩展定律。预训练通过更大的数据集、更多的参数和超大规模并行GPU系统扩展了智能。后训练通过指令调优和重新平衡GPU用于生成式推理来扩展实用性。测试时扩展通过给予模型更多生成令牌进行思考来改进推理能力。
如今,智能体AI和强化学习扩展了行动。模型执行更多步骤、调用更多工具、运行更多评估,并与执行环境交互以完成任务*。
本博客解释了NVIDIA Vera CPU如何通过缩短CPU执行时间、提高任务吞吐量、改善整体AI工厂输出,并支持更智能、更长时间思考的智能体,来帮助AI工厂扩展智能体AI和强化学习。
智能体AI循环示意图,显示CPU执行模型生成的内容(工具调用、沙箱代码、检索、数据处理)为下一步提供新上下文。图1. CPU执行成为AI循环的一部分
为什么在智能体时代CPU更为重要https://developer.nvidia.com/blog/nvidia-vera-cpu-sets-a-new-standard-for-agentic-workloads-in-ai-factories/#why_cpus_matter_more_in_the_agentic_era
GPU对于模型推理和训练仍然至关重要。但在智能体AI、强化学习和数据密集型AI服务中,围绕模型执行的大部分操作都在CPU上运行,例如:
- 沙箱代码和工具执行
- 数据检索和数据处理
- 结果计算
- 调度和编排
这是一个精确的循环:
- 提示(来自用户、推理令牌或前一轮的结果)启动生成:“我应该编译并运行hello.c。”
- GPU生成要在CPU上执行的工具调用的参数:
gcc -o hello hello.c ; ./hello - CPU执行工具调用,产生结果反馈给GPU以更新强化学习中的权重,或由智能体用于生成下一提示:输出:‘Hello, world!’ – 任务返回(0) – 成功
- GPU根据结果生成推理令牌:“嗯!看起来成功了!”
随着智能体能力增强,它们会执行更多步骤、调用更多工具并运行更多检查。CPU时间在请求中累积。
这使得CPU成为关键路径的一部分。它不再仅仅是向GPU提供数据的主机处理器。它影响延迟、加速器利用率以及AI工厂每瓦特和每美元的输出。
过去十年,数据中心CPU市场主要围绕云经济进行优化:更多核心、更多虚拟机以及更低每核心成本。这对通用云服务仍然重要,但每核心性能并未以相同速度提升。
摩尔定律的终结进一步加剧了这一问题,它限制了CPU代际性能的提升,而GPU架构和工作负载则受益于持续协同优化的循环。
AI工厂将度量标准从每核心美元转变为每令牌美元——从数据中心能出租多少CPU核心,转变为它能产生多少AI输出。
这要求为AI工厂设计新的CPU:
- 高核心数以运行数千个并发智能体、RL环境、沙箱和服务。
- 高每核心性能,因为每个智能体步骤受限于顺序执行。
- 能效内存带宽以保持数据流动,而不使CPU基础设施成为瓶颈。
一张示意图展示了智能体AI对新CPU设计点的需求。图中显示了从通用云服务优先最大化“每核心美元”到AI工厂优先最大化“每令牌美元”的转变,这需要许多核心、高每核心性能和能效内存带宽。图2. AI催生了对新CPU的需求
NVIDIA Vera CPU:为AI智能体而生https://developer.nvidia.com/blog/nvidia-vera-cpu-sets-a-new-standard-for-agentic-workloads-in-ai-factories/#the_nvidia_vera_cpu_built_for_ai_agents
NVIDIA Vera CPU (https://developer.nvidia.com/blog/nvidia-vera-cpu-delivers-high-performance-bandwidth-and-efficiency-for-ai-factories/)专为现代工作负载的现实而设计,具备快速每核心性能、高并发性和高效内存带宽,以保持AI工厂运转。
Vera CPU结合了88个NVIDIA Olympus核心和高达1.2 TB/s的LPDDR5X内存带宽,确保核心在工具调用、沙箱执行(包括原生代码和Python或JavaScript等语言)、数据检索、数据处理和编排过程中始终得到充分供给。
关键要求是始终保持快速的每核心性能。与云虚拟机不同,CPU插槽保持满载,处理许多并发智能体的工作。在高系统负载下仍能快速运行的核心减少了任务完成时间,在提供更快结果的同时释放资源以服务下一个请求。
对于智能体来说,这意味着多步骤请求的延迟更低。对于强化学习,这意味着每个训练窗口有更多完成的评估和更多数据,帮助模型更快达到更高的质量水平。对于AI工厂,快速核心确保加速器无需等待编排、工具执行或数据移动。
要实现这一点,需要将核心、内存子系统和互连结构协同设计,以处理分支密集型代码、高带宽数据移动以及负载下的可预测性能。
这始于Vera CPU内部的NVIDIA定制Olympus核心。
NVIDIA Vera CPU架构图,突出展示了Olympus定制核心、1.2TB/s LPDDR5X内存子系统和NVIDIA可扩展一致性互连结构(SCF)等关键组件,这些都为智能体设计点而工程化,以实现高每核心性能和高效内存带宽。图3. Vera CPU专为智能体设计点而打造
NVIDIA Olympus核心与内存子系统https://developer.nvidia.com/blog/nvidia-vera-cpu-sets-a-new-standard-for-agentic-workloads-in-ai-factories/#nvidia_olympus_core_and_memory_subsystem
NVIDIA Olympus核心提供比NVIDIA Grace高达50%的IPC提升,结合了宽前端、先进分支预测、深度乱序指令调度和专用内存预取,以在分支密集型、内存敏感的智能体代码上维持高吞吐量。
Olympus采用神经分支预测器来减少分支密集型代码中的停顿。结合其他预测机制,它能够每个周期维持两条已采用分支且零惩罚,从而保持PyTorch、图工作负载和脚本引擎等深层软件栈的吞吐量。
Olympus还包含一个10宽解码单元和一个深度乱序引擎,旨在维持高每周期指令数。大缓冲区和先进指令调度帮助核心在代码路径、依赖关系和内存访问模式变化时保持前进。
在高负载下维持高IPC需要确保核心数据供给充足。Vera CPU提供高达1.2 TB/s的LPDDR5X内存带宽,在负载下可维持超过90%的峰值内存带宽。与x86 CPU相比,还提供40%更低的峰值内存延迟,确保Olympus核心在检索、分析、沙箱执行和编排过程中及时获得数据。
Olympus还新增了一种新颖的图预取器,专为图分析和智能体内存遍历中常见的间接内存访问模式而构建。结合高每核心内存带宽,Vera CPU在图遍历工作负载上的性能比基于x86的架构高出3倍以上。
NVIDIA可扩展一致性互连结构(SCF)通过单片网格连接所有核心和统一缓存,与将计算分散在不同芯片上的CPU相比,提供可预测的延迟和快50%的核心间数据传输速度。对于强化学习和智能体AI,这种可预测性有助于在全负载下维持评估循环。
通过Olympus核心、NVIDIA SCF和LPDDR5X内存子系统的协同,Vera CPU能够在满载的智能体工作负载下提供比竞争对手高出1.8倍以上的沙箱性能,如图4所示。
柱状图说明在峰值负载下,NVIDIA Vera CPU在广泛的工作负载(包括代码编译、代码分析和Python)中,提供比基于x86的架构高出超过1.8倍的智能体沙箱性能。图4. Vera CPU提供业界领先的智能体沙箱性能
系统效率https://developer.nvidia.com/blog/nvidia-vera-cpu-sets-a-new-standard-for-agentic-workloads-in-ai-factories/#system_efficiency
除性能外,智能体AI对基础设施效率的压力也在增加。随着AI工厂扩展到数千个CPU,内存功耗可能成为平台功耗、冷却需求和运营成本的主要贡献者。
Vera CPU将其架构与高带宽SOCAMM LPDDR5X内存配对,与传统DDR服务器设计相比降低了内存功耗。LPDDR5X子系统的功耗通常低于30瓦,而DDR5配置则超过100瓦。基于MRDIMM的系统可能使内存功耗更高。
凭借250W至450W的可配置TDP范围,Vera CPU降低了CPU和内存子系统的组合功耗,同时提供智能体推理和强化学习环境所需的带宽。对于AI工厂而言,这转化为更好的每瓦性能、更低的运营成本以及更高效地使用电力和冷却基础设施。
面向智能体的AI工厂CPUhttps://developer.nvidia.com/blog/nvidia-vera-cpu-sets-a-new-standard-for-agentic-workloads-in-ai-factories/#the_ai_factory_cpu_for_agents
智能体AI时代要求CPU设计发生转变——从最大化每核心美元转变为最大化AI工厂每瓦特和每美元的输出。NVIDIA Vera CPU是面向智能体的CPU,结合了快速每核心性能、高并发性和高效内存带宽。借助定制Olympus核心、LPDDR5X内存和NVIDIA可扩展一致性互连结构,Vera CPU在智能体沙箱性能上比传统x86架构高出1.8倍以上,帮助AI工厂完成更多工具调用、返回更多评估并保持加速器持续运转。
了解更多关于Vera CPU (https://www.nvidia.com/en-us/data-center/vera-cpu/)、NVIDIA Vera Rubin NVL2 (https://www.nvidia.com/en-us/data-center/vera-rubin-nvl72/) 以及Phoronix对Vera CPU的基准测试 (https://blogs.nvidia.com/blog/vera-cpu-phoronix/)。
相对性能基于测量数据,可能会有变化。NVIDIA Vera CPU搭配LPDDR5X的性能对标最新x86 CPU。
相似文章
AI创新者采用NVIDIA Vera — 大规模最高单线程CPU为何至关重要
NVIDIA推出Vera,一款专为智能AI时代设计的新型最高单线程CPU,通过优化每核性能来加速AI智能体循环,最大化AI工厂收入。
@NVIDIAAP:AI代理在循环中工作。模型推理 → CPU执行 → 结果返回 → 重复。每一步都依赖于…
NVIDIA强调,AI代理以顺序循环方式运行,单线程速度比核心数量更重要,并推出了Vera CPU,旨在大规模提供所有88个核心的最大单线程性能。
Vera到来:英伟达首款为智能体打造的CPU抵达顶级AI实验室
英伟达亲手将首批Vera CPU交付给Anthropic、OpenAI、甲骨文云基础设施和SpaceXAI,标志着专为智能体AI工作负载设计的CPU到来。
NVIDIA刚刚发布了全新的Vera CPU——据称比x86快两倍
NVIDIA宣布了采用全新Vera架构的CPU,该架构从头开始为智能代理AI和强化学习而设计,声称性能达到x86替代方案的两倍。Vera Rubin NVL72平台集成了72个GPU和36个CPU,主要客户包括Meta、Oracle和Alibaba。
NVIDIA Vera CPU 开启洛斯阿拉莫斯国家实验室代理科学 AI 之路
NVIDIA 宣布其 Vera CPU 将为洛斯阿拉莫斯国家实验室的新超级计算机提供动力,为代理型 AI 模拟和科学工作负载带来显著性能提升。