@benitoz: Rene Haas 在昨日的 Arm 第四季度财报电话会议上刚刚确认了 Vera CPU 论点。他并非有意如此——他的表述是:GPU 受限于光刻掩模版尺寸。
摘要
Rene Haas 在 Arm 财报电话会议上的言论被解读为确认了“Vera CPU 论点”,暗示在 NVIDIA GPU 基础设施之外,转向专用 CPU 编排以处理代理型 AI 工作负载。
Rene Haas 在昨日的 Arm 第四季度财报电话会议上刚刚确认了 Vera CPU 论点。他并非有意如此——他的表述是:GPU 受限于光刻掩模版尺寸。而 CPU 不受此限。比例变化体现在核心数量上,而非芯片数量。他的原话是:“256 颗 Vera CPU 芯片,每颗 88 核,一台 200 千瓦液冷机架,设计用于放置在数据中心内,紧邻 Vera Rubin 系统。”这并非主机 CPU。这是专用的代理型编排。
两天前,NVIDIA 自家工程师发布了证明。他们追踪了一次真实的 33 分钟 Claude Code 会话:283 次推理请求,58 次主代理轮次协调 225 次子代理调用。上下文从 15K 令牌增长到 156K 令牌,之后压缩降至 20K。仅主代理在前 40 轮中就处理了约 350 万输入令牌。Anthropic 自己的数据:代理型系统消耗的令牌量高达聊天场景的 15 倍。编码代理的提示缓存命中率维持在 95% 至 98%。若不使用缓存,成本将高出 6 倍。
这就是 GPU 调用之间正在发生的事情:文件读取、工具调用、子代理生成、压缩、KV 缓存管理。所有这些都不在 GPU 上运行。
这就是为什么 12,000 个 GPU 需要 400,000 个 CPU 核心。33 比 1 的比例并非预测,而是实测结果。NVIDIA 在博客中直接指出:这无法通过增加更多计算 FLOP 和内存容量来解决。
翻译过来就是:纯 GPU 路径已走到尽头。代理型篇章需要的是平台,而非芯片。
他们的七芯片方案:Vera Rubin NVL72——容量和预填充;Vera CPU——工具执行、KV 缓存卸载;Groq 3 LPX——优先 SRAM 解码、低抖动生成;NVLink 6、ConnectX-9、BlueField-4、Spectrum-X——网络结构。
他们声称的结果:在 400K 上下文下,万亿参数 MoE 模型每位用户每秒超过 400 个令牌。Vera 规格:88 核 Olympus、176 线程、1.8 TB/s NVLink-C2C、1.2 TB/s LPDDR5X、2270 亿个晶体管。一个 256 CPU 机架提供 45,056 个线程和 400 TB 内存。
有一个细节无人提及:该博客的第二作者此前是 Groq 的代理负责人,第三作者此前曾在 @GroqInc 和 Intel 任职。NVIDIA 并未授权 LPX 架构,而是吸纳了构建该架构的团队。
Haas 并非提出竞争性论点,而是从另一方证实了这一论点。Arm 数据中心版税收入同比增长一倍,他预计还将再翻一番。
目前感觉进展缓慢,是因为我们正处于平台更迭期。提速将在 2026 年下半年到来。架构之争已尘埃落定,部署是唯一剩下的变量。
我在《安静的建筑师》和《第四块拼图》中深入探讨了这一点。$arm $NVDA
相似文章
NVIDIA刚刚发布了全新的Vera CPU——据称比x86快两倍
NVIDIA宣布了采用全新Vera架构的CPU,该架构从头开始为智能代理AI和强化学习而设计,声称性能达到x86替代方案的两倍。Vera Rubin NVL72平台集成了72个GPU和36个CPU,主要客户包括Meta、Oracle和Alibaba。
NVIDIA Vera CPU 以‘重拳出击’之势挑战竞争对手
NVIDIA Vera CPU采用定制Olympus Arm核心和LPDDR5X内存,为代理型AI工作负载提供卓越性能和内存带宽,Phoronix初步基准测试已证实这一点。
Vera到来:英伟达首款为智能体打造的CPU抵达顶级AI实验室
英伟达亲手将首批Vera CPU交付给Anthropic、OpenAI、甲骨文云基础设施和SpaceXAI,标志着专为智能体AI工作负载设计的CPU到来。
Nvidia 的 Vera CPU、DGX Station、Windows PC 都指向同一个目标:本地运行的 AI 代理
Nvidia CEO Jensen Huang 宣布了 Vera CPU、适用于 Windows 的 DGX Station 以及其他 PC,旨在支持本地 AI 代理,强调本地推理以控制 token 成本。
AI创新者采用NVIDIA Vera — 大规模最高单线程CPU为何至关重要
NVIDIA推出Vera,一款专为智能AI时代设计的新型最高单线程CPU,通过优化每核性能来加速AI智能体循环,最大化AI工厂收入。