@PyTorch: 实现更智能、更长时间思考的智能体 通过缩短CPU执行时间规模化智能体AI和强化学习,在…

X AI KOLs Following 新闻

摘要

NVIDIA推出搭载神经分支预测器的Vera CPU,通过缩短CPU执行时间、提高AI工厂吞吐量,加速智能体AI和强化学习工作负载。

实现更智能、更长时间思考的智能体 通过缩短CPU执行时间、增加任务吞吐量并改善整体AI工厂产出,规模化智能体AI和强化学习。 @nvidia定制的Olympus核心搭载于NVIDIA Vera CPU中,利用神经分支预测器减少分支密集型代码中的停顿。结合其他预测机制,它能够在每个周期内以零惩罚维持两个已采用分支,从而保持对PyTorch、图工作负载和脚本引擎等深度软件栈的吞吐量。 阅读完整博文:
查看原文
查看缓存全文

缓存时间: 2026/06/11 19:41

打造更智能、更长时间思考的智能体

通过缩短CPU执行时间、提高任务吞吐量并改善整体AI工厂输出来扩展智能体AI和强化学习。

@nvidia 在NVIDIA Vera CPU中定制的Olympus核心采用神经分支预测器,可减少分支密集型代码中的停顿。结合其他预测机制,它能够每个周期维持两条已采用分支且零惩罚,从而保持PyTorch、图工作负载和脚本引擎等深层软件栈的吞吐量。

阅读完整博客文章:


NVIDIA Vera CPU为AI工厂中的智能体工作负载树立新标准

来源:https://developer.nvidia.com/blog/nvidia-vera-cpu-sets-a-new-standard-for-agentic-workloads-in-ai-factories/ 每一次AI浪潮都催生了新的扩展定律。预训练通过更大的数据集、更多的参数和超大规模并行GPU系统扩展了智能。后训练通过指令调优和重新平衡GPU用于生成式推理来扩展实用性。测试时扩展通过给予模型更多生成令牌进行思考来改进推理能力。

如今,智能体AI强化学习扩展了行动。模型执行更多步骤、调用更多工具、运行更多评估,并与执行环境交互以完成任务*。

本博客解释了NVIDIA Vera CPU如何通过缩短CPU执行时间、提高任务吞吐量、改善整体AI工厂输出,并支持更智能、更长时间思考的智能体,来帮助AI工厂扩展智能体AI和强化学习。

智能体AI循环示意图,显示CPU执行模型生成的内容(工具调用、沙箱代码、检索、数据处理)为下一步提供新上下文。图1. CPU执行成为AI循环的一部分

为什么在智能体时代CPU更为重要https://developer.nvidia.com/blog/nvidia-vera-cpu-sets-a-new-standard-for-agentic-workloads-in-ai-factories/#why_cpus_matter_more_in_the_agentic_era

GPU对于模型推理和训练仍然至关重要。但在智能体AI、强化学习和数据密集型AI服务中,围绕模型执行的大部分操作都在CPU上运行,例如:

  • 沙箱代码和工具执行
  • 数据检索和数据处理
  • 结果计算
  • 调度和编排

这是一个精确的循环:

  • 提示(来自用户、推理令牌或前一轮的结果)启动生成:“我应该编译并运行hello.c。”
  • GPU生成要在CPU上执行的工具调用的参数:gcc -o hello hello.c ; ./hello
  • CPU执行工具调用,产生结果反馈给GPU以更新强化学习中的权重,或由智能体用于生成下一提示:输出:‘Hello, world!’ – 任务返回(0) – 成功
  • GPU根据结果生成推理令牌:“嗯!看起来成功了!”

随着智能体能力增强,它们会执行更多步骤、调用更多工具并运行更多检查。CPU时间在请求中累积。

这使得CPU成为关键路径的一部分。它不再仅仅是向GPU提供数据的主机处理器。它影响延迟、加速器利用率以及AI工厂每瓦特和每美元的输出。

过去十年,数据中心CPU市场主要围绕云经济进行优化:更多核心、更多虚拟机以及更低每核心成本。这对通用云服务仍然重要,但每核心性能并未以相同速度提升。

摩尔定律的终结进一步加剧了这一问题,它限制了CPU代际性能的提升,而GPU架构和工作负载则受益于持续协同优化的循环。

AI工厂将度量标准从每核心美元转变为每令牌美元——从数据中心能出租多少CPU核心,转变为它能产生多少AI输出。

这要求为AI工厂设计新的CPU:

  • 高核心数以运行数千个并发智能体、RL环境、沙箱和服务。
  • 高每核心性能,因为每个智能体步骤受限于顺序执行。
  • 能效内存带宽以保持数据流动,而不使CPU基础设施成为瓶颈。

一张示意图展示了智能体AI对新CPU设计点的需求。图中显示了从通用云服务优先最大化“每核心美元”到AI工厂优先最大化“每令牌美元”的转变,这需要许多核心、高每核心性能和能效内存带宽。图2. AI催生了对新CPU的需求

NVIDIA Vera CPU:为AI智能体而生https://developer.nvidia.com/blog/nvidia-vera-cpu-sets-a-new-standard-for-agentic-workloads-in-ai-factories/#the_nvidia_vera_cpu_built_for_ai_agents

NVIDIA Vera CPU (https://developer.nvidia.com/blog/nvidia-vera-cpu-delivers-high-performance-bandwidth-and-efficiency-for-ai-factories/)专为现代工作负载的现实而设计,具备快速每核心性能、高并发性和高效内存带宽,以保持AI工厂运转。

Vera CPU结合了88个NVIDIA Olympus核心和高达1.2 TB/s的LPDDR5X内存带宽,确保核心在工具调用、沙箱执行(包括原生代码和Python或JavaScript等语言)、数据检索、数据处理和编排过程中始终得到充分供给。

关键要求是始终保持快速的每核心性能。与云虚拟机不同,CPU插槽保持满载,处理许多并发智能体的工作。在高系统负载下仍能快速运行的核心减少了任务完成时间,在提供更快结果的同时释放资源以服务下一个请求。

对于智能体来说,这意味着多步骤请求的延迟更低。对于强化学习,这意味着每个训练窗口有更多完成的评估和更多数据,帮助模型更快达到更高的质量水平。对于AI工厂,快速核心确保加速器无需等待编排、工具执行或数据移动。

要实现这一点,需要将核心、内存子系统和互连结构协同设计,以处理分支密集型代码、高带宽数据移动以及负载下的可预测性能。

这始于Vera CPU内部的NVIDIA定制Olympus核心。

NVIDIA Vera CPU架构图,突出展示了Olympus定制核心、1.2TB/s LPDDR5X内存子系统和NVIDIA可扩展一致性互连结构(SCF)等关键组件,这些都为智能体设计点而工程化,以实现高每核心性能和高效内存带宽。图3. Vera CPU专为智能体设计点而打造

NVIDIA Olympus核心与内存子系统https://developer.nvidia.com/blog/nvidia-vera-cpu-sets-a-new-standard-for-agentic-workloads-in-ai-factories/#nvidia_olympus_core_and_memory_subsystem

NVIDIA Olympus核心提供比NVIDIA Grace高达50%的IPC提升,结合了宽前端、先进分支预测、深度乱序指令调度和专用内存预取,以在分支密集型、内存敏感的智能体代码上维持高吞吐量。

Olympus采用神经分支预测器来减少分支密集型代码中的停顿。结合其他预测机制,它能够每个周期维持两条已采用分支且零惩罚,从而保持PyTorch、图工作负载和脚本引擎等深层软件栈的吞吐量。

Olympus还包含一个10宽解码单元和一个深度乱序引擎,旨在维持高每周期指令数。大缓冲区和先进指令调度帮助核心在代码路径、依赖关系和内存访问模式变化时保持前进。

在高负载下维持高IPC需要确保核心数据供给充足。Vera CPU提供高达1.2 TB/s的LPDDR5X内存带宽,在负载下可维持超过90%的峰值内存带宽。与x86 CPU相比,还提供40%更低的峰值内存延迟,确保Olympus核心在检索、分析、沙箱执行和编排过程中及时获得数据。

Olympus还新增了一种新颖的图预取器,专为图分析和智能体内存遍历中常见的间接内存访问模式而构建。结合高每核心内存带宽,Vera CPU在图遍历工作负载上的性能比基于x86的架构高出3倍以上。

NVIDIA可扩展一致性互连结构(SCF)通过单片网格连接所有核心和统一缓存,与将计算分散在不同芯片上的CPU相比,提供可预测的延迟和快50%的核心间数据传输速度。对于强化学习和智能体AI,这种可预测性有助于在全负载下维持评估循环。

通过Olympus核心、NVIDIA SCF和LPDDR5X内存子系统的协同,Vera CPU能够在满载的智能体工作负载下提供比竞争对手高出1.8倍以上的沙箱性能,如图4所示。

柱状图说明在峰值负载下,NVIDIA Vera CPU在广泛的工作负载(包括代码编译、代码分析和Python)中,提供比基于x86的架构高出超过1.8倍的智能体沙箱性能。图4. Vera CPU提供业界领先的智能体沙箱性能

系统效率https://developer.nvidia.com/blog/nvidia-vera-cpu-sets-a-new-standard-for-agentic-workloads-in-ai-factories/#system_efficiency

除性能外,智能体AI对基础设施效率的压力也在增加。随着AI工厂扩展到数千个CPU,内存功耗可能成为平台功耗、冷却需求和运营成本的主要贡献者。

Vera CPU将其架构与高带宽SOCAMM LPDDR5X内存配对,与传统DDR服务器设计相比降低了内存功耗。LPDDR5X子系统的功耗通常低于30瓦,而DDR5配置则超过100瓦。基于MRDIMM的系统可能使内存功耗更高。

凭借250W至450W的可配置TDP范围,Vera CPU降低了CPU和内存子系统的组合功耗,同时提供智能体推理和强化学习环境所需的带宽。对于AI工厂而言,这转化为更好的每瓦性能、更低的运营成本以及更高效地使用电力和冷却基础设施。

面向智能体的AI工厂CPUhttps://developer.nvidia.com/blog/nvidia-vera-cpu-sets-a-new-standard-for-agentic-workloads-in-ai-factories/#the_ai_factory_cpu_for_agents

智能体AI时代要求CPU设计发生转变——从最大化每核心美元转变为最大化AI工厂每瓦特和每美元的输出。NVIDIA Vera CPU是面向智能体的CPU,结合了快速每核心性能、高并发性和高效内存带宽。借助定制Olympus核心、LPDDR5X内存和NVIDIA可扩展一致性互连结构,Vera CPU在智能体沙箱性能上比传统x86架构高出1.8倍以上,帮助AI工厂完成更多工具调用、返回更多评估并保持加速器持续运转。

了解更多关于Vera CPU (https://www.nvidia.com/en-us/data-center/vera-cpu/)、NVIDIA Vera Rubin NVL2 (https://www.nvidia.com/en-us/data-center/vera-rubin-nvl72/) 以及Phoronix对Vera CPU的基准测试 (https://blogs.nvidia.com/blog/vera-cpu-phoronix/)。

相对性能基于测量数据,可能会有变化。NVIDIA Vera CPU搭配LPDDR5X的性能对标最新x86 CPU。

相似文章

NVIDIA刚刚发布了全新的Vera CPU——据称比x86快两倍

Reddit r/ArtificialInteligence

NVIDIA宣布了采用全新Vera架构的CPU,该架构从头开始为智能代理AI和强化学习而设计,声称性能达到x86替代方案的两倍。Vera Rubin NVL72平台集成了72个GPU和36个CPU,主要客户包括Meta、Oracle和Alibaba。