Groq 3 LPX全面投产,NVIDIA扩展Vera Rubin代理推理平台
摘要
NVIDIA宣布Groq 3 LPX现已全面投产,通过Vera Rubin平台为代理AI系统提供超快令牌生成能力,基准测试显示性能提升4倍。
<div id="bsf_rt_marker"></div><p><span style="font-weight: 400;">AI推理的下一个时代将不由单一的突破性芯片、网络或系统定义,而取决于AI工厂每个层级如何协同工作。正因如此,NVIDIA正在扩展Vera Rubin NVL72,为代理系统提供快速令牌生成能力。</span></p>
<p><a target="_blank" href="https://nvidianews.nvidia.com/news/nvidia-groq-3-lpx-now-in-full-production-with-world-class-speed-for-agentic-ai"><span style="font-weight: 400;">今日宣布</span></a><span style="font-weight: 400;">,NVIDIA Vera Rubin机架级系统NVIDIA Groq 3 LPX已全面投产。在一项运行开源代理模型Gemma 4 31B的Artificial Analysis基准测试中,该系统在代理系统关键的10万令牌长上下文用例中,实现了每秒3,400个输出令牌的性能,比最接近的替代平台快4倍。</span></p>
<p><span style="font-weight: 400;">全球行业合作伙伴正在采用Vera Rubin平台解决方案。SpaceXAI宣布,NVIDIA Vera CPU将为其下一代代理AI提供动力。CoreWeave已部署Spectrum-X Multiplane投入生产,该系统通过多并行交换机连接NVIDIA Vera Rubin机架,提供高带宽、扁平化且无损的AI网络。Nebius成为首个采用NVIDIA Groq 3 LPX的AI云服务商。</span></p>
<p><span style="font-weight: 400;">随着AI从训练转向推理与代理,推理已成为新的前沿领域。代理AI系统正在生成更多令牌,处理显著增大的上下文窗口,并日益与其他AI系统协作以解决复杂问题。</span></p>
<p><span style="font-weight: 400;">这些工作负载需要一类新的基础设施,其优化目标不仅是性能,还包括前所未有的规模下的吞吐量、响应速度和经济性。</span><a target="_blank" href="https://nvidia-my.sharepoint.com/personal/scmartin_nvidia_com/Documents/Microsoft%20Copilot%20Chat%20Files/Rubin%20CPX%20Product%20Aug%202026.pdf"><span style="font-weight: 400;"> </span></a></p>
<p><span style="font-weight: 400;">在加州帕洛阿尔托举办的Hot Chips大会上,NVIDIA正在展示极致协同设计如何重塑端到端的AI工厂。通过将计算、网络和推理加速设计为一个统一系统,NVIDIA正在帮助客户构建专为长上下文推理和多代理系统新兴需求量身定制的基础设施。</span></p>
<h3><b>极致协同设计为性能优化</b></h3>
<p><span style="font-weight: 400;">极致协同设计是NVIDIA平台背后的指导原则。Vera Rubin专为加速代理在越来越长的序列上进行推理而设计。</span></p>
<p><a target="_blank" href="https://www.nvidia.com/en-us/networking/spectrumx/"><span style="font-weight: 400;">NVIDIA Spectrum-X以太网</span></a><span style="font-weight: 400;">可在AI工厂中高效移动这些庞大的数据流,而NVIDIA Groq 3 LPX专为以超快速度生成令牌而构建。两者共同展示了NVIDIA如何将AI流水线的每个阶段——从上下文和通信到生成——作为单一集成AI工厂架构的一部分进行优化。</span></p>
<p><span style="font-weight: 400;">NVIDIA Groq 3 LPX带来了一种新的低延迟推理架构,旨在与最通用的AI工厂平台Vera Rubin NVL72协同工作,帮助企业和云服务商提供代理应用所需的低延迟、极高吞吐量和可扩展的经济性。</span></p>
<p><span style="font-weight: 400;">突破性的性能并非来自孤立地优化单个组件,而是通过协同设计栈中的每一层来实现。从网络和上下文处理到大规模推理,NVIDIA的全栈平台将AI工厂转变为集成的智能引擎,旨在将不断增长的令牌量转化为收益。</span></p>
<hr />
<p><em>太平洋时间8月24日星期二上午8:00 <b><a href="https://blogs.nvidia.com/blog/vera-rubin-lpx-spectrum-x-nvlink-fusion/#nvidia-partners"><img src="https://s.w.org/images/core/emoji/17.0.2/72x72/1f517.png" alt="🔗" class="wp-smiley" style="height: 1em; max-height: 1em;" /></a></b></em></p>
<h2 id="nvidia-partners" class="wp-block-heading" style="scroll-margin-top: 100px;">NVIDIA合作伙伴采用Vera Rubin以实现最低令牌成本</h2>
<p><span style="font-weight: 400;">领先的AI云服务商Nebius率先采用NVIDIA Groq 3 LPX,使开发者能够访问领先的令牌生成速度,以构建高响应度的代理AI应用。</span></p>
<p><span style="font-weight: 400;">在Nebius Token Factory中将NVIDIA Groq 3 LPX添加到NVIDIA Vera Rubin NVL72,将提升推理性能,使开发者能够大规模构建高度交互的代理、编码系统和其他实时AI体验。</span></p>
<p><span style="font-weight: 400;">在连接NVIDIA Vera Rubin机架方面,<span style="font-weight: 400;">CoreWeave</span>正在生产环境中部署Spectrum-X Multiplane,为其AI云基础设施解锁新的进步。</span></p>
<hr />
<p><em>太平洋时间8月24日星期二上午8:00 <b><a href="https://blogs.nvidia.com/blog/vera-rubin-lpx-spectrum-x-nvlink-fusion/#spacexai-vera-cpus"><img src="https://s.w.org/images/core/emoji/17.0.2/72x72/1f517.png" alt="🔗" class="wp-smiley" style="height: 1em; max-height: 1em;" /></a></b></em></p>
<h2 id="spacexai-vera-cpus" class="wp-block-heading" style="scroll-margin-top: 100px;"><b>SpaceXAI采用NVIDIA Vera CPU驱动代理AI</b></h2>
<p><span style="font-weight: 400;">SpaceXAI计划围绕NVIDIA Vera Rubin构建并扩展其未来的AI架构,从地球上的数据中心到轨道卫星。该公司计划部署NVIDIA Vera CPU,以加速代理AI背后CPU密集型的工作负载,包括编排、工具使用、代码执行、数据处理和模拟。</span></p>
<p><img decoding="async" class="alignnone size-medium wp-image-97839" src="https://blogs.nvidia.com/wp-content/uploads/2026/08/cpu-press-hot-chips-vera-cpu-1920x1080-5562750-960x540.jpg" alt="" width="960" height="540" srcset="https://blogs.nvidia.com/wp-content/uploads/2026/08/cpu-press-hot-chips-vera-cpu-1920x1080-5562750-960x540.jpg 960w, https://blogs.nvidia.com/wp-content/uploads/2026/08/cpu-press-hot-chips-vera-cpu-1920x1080-5562750-1680x945.jpg 1680w, https://blogs.nvidia.com/wp-content/uploads/2026/08/cpu-press-hot-chips-vera-cpu-1920x1080-5562750-1280x720.jpg 1280w, https://blogs.nvidia.com/wp-content/uploads/2026/08/cpu-press-hot-chips-vera-cpu-1920x1080-5562750-1536x864.jpg 1536w, https://blogs.nvidia.com/wp-content/uploads/2026/08/cpu-press-hot-chips-vera-cpu-1920x1080-5562750-1290x725.jpg 1290w, https://blogs.nvidia.com/wp-content/uploads/2026/08/cpu-press-hot-chips-vera-cpu-1920x1080-5562750-630x354.jpg 630w, https://blogs.nvidia.com/wp-content/uploads/2026/08/cpu-press-hot-chips-vera-cpu-1920x1080-5562750-300x169.jpg 300w, https://blogs.nvidia.com/wp-content/uploads/2026/08/cpu-press-hot-chips-vera-cpu-1920x1080-5562750-400x225.jpg 400w, https://blogs.nvidia.com/wp-content/uploads/2026/08/cpu-press-hot-chips-vera-cpu-1920x1080-5562750.jpg 1920w" sizes="(max-width: 960px) 100vw, 960px" /></p>
<p><span style="font-weight: 400;">这项<span style="font-weight: 400;">SpaceXAI合作</span>将NVIDIA的全栈AI平台扩展至SpaceXAI,整合了Vera CPU、NVIDIA加速计算、网络和软件,以前所未有的规模推动AI发展。</span></p>
<p><span style="font-weight: 400;">专为代理时代设计的Vera Rubin提供了领先的单核性能、卓越的内存带宽和预
查看缓存全文
缓存时间: 2026/08/24 16:04
# 随着Groq 3 LPX全面投产,NVIDIA扩展Vera Rubin代理推理能力
来源:https://blogs.nvidia.com/blog/vera-rubin-lpx-spectrum-x-nvlink-fusion/
AI推理的下一个时代将不再由单一突破性芯片、网络或系统定义。它将由AI工厂各层的协同工作方式定义。因此,NVIDIA正在扩展Vera Rubin NVL72,为代理系统提供快速的令牌生成能力。
今日宣布(https://nvidianews.nvidia.com/news/nvidia-groq-3-lpx-now-in-full-production-with-world-class-speed-for-agentic-ai),NVIDIA机架级系统NVIDIA Groq 3 LPX已进入全面生产。在运行开源代理模型Gemma 4 31B的Artificial Analysis基准测试中,该系统在100,000令牌长上下文场景下实现了每秒3,400输出令牌的性能,速度比最接近的替代平台快4倍,这对代理系统至关重要。
全球行业合作伙伴正在采用Vera Rubin平台解决方案。SpaceXAI宣布其下一代代理式AI将采用NVIDIA Vera CPU驱动。CoreWeave已将Spectrum-X Multiplane投入生产部署,该方案使用多个并行交换机连接NVIDIA Vera Rubin机架,提供高带宽、扁平且无损的AI网络。Nebius成为首个采用NVIDIA Groq 3 LPX的AI云服务商。
随着AI从训练转向推理与代理化,推理已成为新的前沿领域。代理式AI系统正生成更多令牌,处理显著扩大的上下文窗口,并越来越多地与其他AI系统协作以解决复杂问题。
这些工作负载需要新型基础设施,不仅要优化性能,还要在空前规模下实现吞吐量、响应速度和经济效益的全面提升。
在本周于加利福尼亚州帕洛阿尔托举行的Hot Chips大会上,NVIDIA展示了极端协同设计如何从端到端重塑AI工厂。通过将计算、网络和推理加速构建成统一系统,NVIDIA正帮助客户构建专门针对长上下文推理和多代理系统新兴需求的基础设施。
### **极端协同设计实现性能优化**
极端协同设计是NVIDIA平台的指导原则。Vera Rubin旨在加速代理推理长序列处理。
NVIDIA Spectrum-X以太网(https://www.nvidia.com/en-us/networking/spectrumx/)高效传输这些海量数据流,而NVIDIA Groq 3 LPX专为超高速令牌生成而构建。两者共同展示了NVIDIA如何将AI流水线的每个阶段——从上下文、通信到生成——作为单一集成AI工厂架构的一部分进行优化。
NVIDIA Groq 3 LPX带来全新的低延迟推理架构,旨在与最具通用性的AI工厂平台Vera Rubin NVL72协同工作,帮助企业和云服务商提供代理应用所需的低延迟、极高吞吐量和可扩展的经济效益。
突破性性能并非来自孤立优化单个组件,而是源于对技术栈每一层的协同设计。从网络和上下文处理到大规模推理,NVIDIA的全栈平台将AI工厂转变为集成的智能引擎,旨在将不断增长的令牌量转化为收益。
---
*8月24日星期二,太平洋时间上午8点**🔗 (https://blogs.nvidia.com/blog/vera-rubin-lpx-spectrum-x-nvlink-fusion/#nvidia-partners)***
## NVIDIA合作伙伴采用Vera Rubin以实现最低令牌成本
领先的AI云服务商Nebius率先采用NVIDIA Groq 3 LPX,为开发者提供领先的令牌生成速度,以构建高度响应的代理式AI应用。
将NVIDIA Groq 3 LPX添加到Nebius Token Factory中的NVIDIA Vera Rubin NVL72将提升推理性能,使开发者能够大规模构建高度交互式的代理系统、编程系统及其他实时AI体验。
CoreWeave正在部署连接NVIDIA Vera Rubin机架的Spectrum-X Multiplane,为其AI云基础设施带来突破性进展。
---
*8月24日星期二,太平洋时间上午8点**🔗 (https://blogs.nvidia.com/blog/vera-rubin-lpx-spectrum-x-nvlink-fusion/#spacexai-vera-cpus)***
## **SpaceXAI采用NVIDIA Vera CPU赋能代理式AI**
SpaceXAI计划围绕NVIDIA Vera Rubin构建并扩展其未来AI架构,覆盖从地球数据中心到轨道卫星。该公司计划部署NVIDIA Vera CPU加速代理式AI背后的CPU密集型工作负载,包括编排、工具调用、代码执行、数据处理和模拟。
SpaceXAI的合作(https://nvidianews.nvidia.com/news/spacexai-adopts-nvidia-vera-cpu-to-accelerate-agentic-ai-at-massive-scale)将NVIDIA全栈AI平台扩展至SpaceXAI,整合Vera CPU、NVIDIA加速计算、网络和软件,以前所未有的规模推进AI发展。
专为代理时代设计的Vera Rubin提供领先的单核性能、卓越的内存带宽和负载下的可预测性能,帮助代理更快完成任务,并确保宝贵的GPU基础设施得到充分利用。
---
*8月24日星期二,太平洋时间上午8点**🔗 (https://blogs.nvidia.com/blog/vera-rubin-lpx-spectrum-x-nvlink-fusion/#groq-3-lpx)***
## **NVIDIA Groq 3 LPX:交互式AI推理加速器**
与Vera Rubin NVL72平台协同设计的NVIDIA Groq 3 LPX,正帮助AI工厂为代理工作负载提供最低延迟的令牌生成。
代理式AI带来了新的性能挑战:解码延迟。当AI代理进行推理、使用工具并与系统交互时,它们逐个令牌生成响应,即使微小的延迟也会在复杂工作链中累积放大。为确保代理以用户预期的速度运行,NVIDIA Groq 3 LPX为Vera Rubin NVL72平台扩展了专门的令牌生成加速能力。
NVIDIA Rubin GPU处理大规模上下文处理,而LPX加速延迟敏感的解码工作负载。结果实现更快、更可预测的令牌生成,帮助AI工厂提供响应式推理、更流畅的代理交互和更高的基础设施效率。
Rubin GPU和LPU共同消除了速度与吞吐量之间的传统权衡,帮助AI提供商为新一代代理式AI应用提供响应式大规模推理。
### **构建令牌工厂**
随着行业从模型训练转向大规模智能服务,基础设施必须进化为NVIDIA所描述的“令牌工厂”,能够同时实现性能、吞吐量、智能完整性和经济效率。代理式AI系统日益与其他AI系统通信、访问多个数据源并维护大量上下文,对快速推理产生了前所未有的需求。
NVIDIA Groq 3 LPX正是为此类工作负载设计。作为Vera Rubin NVL72的扩展,即使在大规模上下文窗口下也能实现超快响应,同时帮助服务提供商最大化吞吐量和基础设施利用率。
### **面向推理的极端协同设计**
与独立加速器不同,NVIDIA Groq 3 LPX通过极端协同设计融合了GPU和LPU的优势。Rubin GPU和LPU共同计算AI模型的每一层,为代理工作负载带来新的推理性能水平。
在大规模部署中,LPU集群作为优化确定性推理的巨型处理器运行。机架级NVIDIA Groq 3 LPX部署可包含256个LP30加速器,通过芯片直连链路互联,构建专为现代AI工厂打造的高效推理引擎。
### **专为代理式AI时代设计**
随着推理模型增长和代理工作负载生成更多令牌,服务这些模型的基础设施必须进化。NVIDIA Groq 3 LPX为Vera Rubin NVL72平台扩展了专用推理架构,旨在最大化响应速度、吞吐量和效率,为下一代AI工厂提供动力。
这只是开始——更多优化、更多模型、与Vera Rubin NVL72结合时更多性能提升即将到来。吞吐量和交互性将达到新高度。敬请期待。
---
*8月24日星期二,太平洋时间上午8点**🔗 (https://blogs.nvidia.com/blog/vera-rubin-lpx-spectrum-x-nvlink-fusion/#spectrum-x-multiplane)***
## NVIDIA Spectrum-X Multiplane在更扁平、更具弹性的网络上实现大规模AI工厂扩展
随着AI工厂规模扩大,网络已成为性能的关键引擎。在Hot Chips大会上,NVIDIA重点展示Spectrum-X Multiplane(https://www.nvidia.com/en-us/networking/spectrumx/)——这是Spectrum-X以太网架构的最新硬件加速技术,使以太网能够扩展至前所未有的规模,同时避免因增加网络层级而产生的延迟、抖动和成本。
NVIDIA Spectrum-X以太网是端到端AI优化的以太网平台,结合NVIDIA Spectrum-X以太网交换机、SuperNIC和软件,提升基于以太网的AI基础设施在AI工厂和云环境中的性能与效率。该平台旨在提供比商用以太网高出1.6倍的AI网络性能,同时在多租户环境中保持一致、可预测的性能。
### **Multiplane实现无新增层级权衡的扩展**
传统上,将AI工厂扩展到当今最大集群之外意味着需要添加第三层网络,这会增加延迟、不可预测地降低速度,并推高布线、光模块和电力成本。Spectrum-X Multiplane采用更简洁的方法:它将每台服务器的网络连接分成若干独立路径或“平面”,每个平面运行自己的轻量级两层网络。结果形成一个扁平、简单的网络,可扩展至512,000个GPU,无需第三层网络的额外成本和复杂性。
这一切自动完成。NVIDIA ConnectX SuperNIC内部的专用硬件引擎管理跨平面流量,并即时重路由绕过任何故障,因此应用程序和软件仅看到一个快速、可靠的连接。在八平面拓扑中,如果一个平面故障,网络仍能保持约90%的总带宽,硬件恢复速度比基于软件的多平面负载均衡快11倍。这转化为1.6倍的AI工厂产出提升。
### **通过极端协同设计构建**
这种可靠性源于Vera Rubin NVL72的极端协同设计,涵盖交换机芯片、SuperNIC和软件。基于102.4Tb/s Spectrum-6以太网ASIC和ConnectX-9 SuperNIC(支持每GPU最高1,600Gb/s)的Spectrum-X SN6000系列交换机,专为Vera Rubin NVL72 AI工厂构建。Spectrum-XGS以太网将这种协同设计扩展到数据中心,使多个设施能够作为单一AI超级工厂运行,并将多站点NCCL集合通信加速1.9倍。
---
*8月24日星期二,太平洋时间上午8点**🔗 (https://blogs.nvidia.com/blog/vera-rubin-lpx-spectrum-x-nvlink-fusion/#scale-in)***
## NVIDIA推出由BlueField-4、DOCA赋能的代理式AI工厂规模化基础设施
NVIDIA推出NVIDIA Scale-In,作为NVIDIA AI网络的第五大支柱,这是面向代理式AI工厂的新型加速网络基础设施。Scale-In将专用加速扩展至保护、管理和运营AI工厂的基础设施服务。
基于NVIDIA BlueField-4处理器和NVIDIA DOCA软件平台,并通过NVIDIA Spectrum-X以太网连接,NVIDIA Scale-In将传统的南北向访问网络转变为统一、加速的基础设施域。
云计算为数据中心带来了软件定义网络、可组合性和弹性,使用户、应用程序、数据和服务能够动态扩展。
代理式AI代表着下一个平台变革。AI工厂将海量加速计算与日益增长的用户、应用程序和自主代理相结合,所有这些持续与数据、存储和服务交互。这改变了使AI得以实现的基础设施需求。网络、存储、网络安全和运维现在必须与AI计算一起加速,将软件定义的灵活性与专用硬件加速和全栈协同设计相结合。
NVIDIA Scale-In提供多租户网络、高性能存储访问、芯片级安全、弹性配置和实时可观测性,同时保持基础设施处理独立于主机计算资源。通过将这些服务作为AI工厂的一部分进行加速和协同设计,Scale-In帮助安全、数据访问和运维与AI计算同步扩展。结果是安全、高效且可管理的共享基础设施,用于大规模部署和运营代理式AI。
---
*8月24日星期二,太平洋时间上午8点**🔗 (https://blogs.nvidia.com/blog/vera-rubin-lpx-spectrum-x-nvlink-fusion/#xpus)***
## NVIDIA NVLink Fusion将XPUs连接到NVIDIA领先AI平台
NVIDIA NVLink Fusion将定制芯片引入NVIDIA全球领先的AI基础设施平台,使超大规模企业和AI原生公司能够以更高性能、灵活性和速度构建半定制化AI工厂。
随着AI模型规模和复杂度的增长,仅靠原始算力已不足够。AI工厂需要高带宽、低延迟的纵向扩展网络、经过验证的机架级架构,以及涵盖电力、冷却、管理软件和供应链的完整生态系统。NVLink Fusion通过将定制XPUs和CPU连接到NVIDIA的纵向扩展和横向扩展技术栈来应对这些挑战。
该平台包括第六代NVIDIA NVLink(https://developer.nvidia.com/blog/nvidia-nvlink-the-scale-up-network-for-ai-factories/)和NVLink Switch专用纵向扩展网络,以及用于XPUs和CPU之间高效连接的NVLink-C2C。通过NVIDIA MGX生态系统,采用者还可使用经过生产验证的机架设计、组件、制造合作伙伴解决方案以及用于分布式计算、分解工作负载和集群管理的开放、可扩展软件。
通过将基于GPU和XPU的系统统一架构标准化,NVLink Fusion帮助将数据中心建设与芯片就绪性解耦。运营商可以共享机架空间、网络、冷却、电力输送和管理系统,然后根据供应和工作负载需求的变化调整GPU与XPU的组合。
NVLink Fusion将NVIDIA AI平台的垂直集成、水平开放方法扩展到定制硅芯片领域。它赋予合作伙伴在其差异化领域自由创新,同时利用NVIDIA在计算、网络、基础设施和软件方面的技术——构建单一、灵活的AI工厂,这是任何单个公司都无法独立建造的。
相似文章
NVIDIA全面投产Groq 3 LPX AI推理加速芯片,以史上最快的令牌生成速度为Vera Rubin平台注入强大动力(4分钟阅读)
NVIDIA已开始全面生产Groq 3 LPX AI推理加速芯片,该芯片为Vera Rubin平台提供支持,实现了AI模型有史以来最快的令牌生成速度。
@rohanpaul_ai:NVIDIA的非独占Groq许可协议8个月后,Groq技术终于出现在机架规模的……
NVIDIA正在将Groq技术集成到机架规模的产品中,以通过跨专业处理器分配工作负载来增强代理AI性能,改善令牌生成延迟和整体响应性。
NVIDIA刚刚发布了全新的Vera CPU——据称比x86快两倍
NVIDIA宣布了采用全新Vera架构的CPU,该架构从头开始为智能代理AI和强化学习而设计,声称性能达到x86替代方案的两倍。Vera Rubin NVL72平台集成了72个GPU和36个CPU,主要客户包括Meta、Oracle和Alibaba。
Groq在英伟达交易后筹集3.5亿美元(4分钟阅读)
Groq在英伟达授权技术并招聘其高级团队后,以35亿美元估值筹集了3.5亿美元,并转向使用LPUs和英伟达系统的推理云业务。
每瓦功耗工作量提升高达30倍:NVIDIA Vera Rubin NVL72为AI智能体树立新能效标准
NVIDIA Vera Rubin NVL72系统在智能体AI工作负载中,展现出每兆瓦吞吐量提升高达30倍的性能,为AI基础设施设定了新的效率标准。