NVIDIA Spectrum-X——开放、AI原生的以太网架构——为千亿级AI设定标准,现已集成MRC
摘要
NVIDIA Spectrum-X以太网架构搭配多路径可靠连接(MRC)为千亿级AI网络设立新标准,提升大规模AI训练的吞吐量、负载均衡和弹性,OpenAI、微软和甲骨文已率先应用。
<div id="bsf_rt_marker"></div><p><span style="font-weight: 400;">打造全球最强AI工厂的竞赛,需要的网络必须跟上AI本身的雄心。</span></p>
<p><a target="_blank" href="https://www.nvidia.com/en-us/networking/spectrumx/"><span style="font-weight: 400;">NVIDIA Spectrum-X以太网</span></a><span style="font-weight: 400;">扩展基础设施在这场竞赛中处于前沿,是当今最先进的AI网络技术,已部署于那些绝不能在性能、弹性或规模上妥协的行业领导者。</span></p>
<p><span style="font-weight: 400;">这些领导者包括</span><span style="font-weight: 400;">OpenAI</span><span style="font-weight: 400;">、</span><span style="font-weight: 400;">微软</span><span style="font-weight: 400;">和</span><span style="font-weight: 400;">甲骨文</span><span style="font-weight: 400;">。</span></p>
<p><span style="font-weight: 400;">包括NVIDIA、<a target="_blank" href="https://aka.ms/BuildingResilientNetworksForAISupercomputers">微软</a>和</span><a target="_blank" href="https://openai.com/index/mrc-supercomputer-networking"><span style="font-weight: 400;">OpenAI</span></a><span style="font-weight: 400;">在内的公司已</span><a target="_blank" href="https://cdn.openai.com/pdf/resilient-ai-supercomputer-networking-using-mrc-and-srv6.pdf"><span style="font-weight: 400;">展示</span></a><span style="font-weight: 400;">了行业领导力,引入了多路径可靠连接(MRC),这是一种RDMA传输协议。MRC使单一RDMA连接能够将流量分配到多条网络路径,从而提升大规模AI训练架构的吞吐量、负载均衡和可用性。</span></p>
<p><span style="font-weight: 400;">可以将其想象为用巧妙的街道网格系统配合实时交通应用取代贯穿城镇的单车道道路,使驾驶员能够绕开拥堵和道路封闭。</span></p>
<p><span style="font-weight: 400;">“在Blackwell这一代部署MRC非常成功,这得益于与NVIDIA的紧密合作,”OpenAI工业计算负责人Sachin Katti表示。“MRC的端到端方法使我们能够避免许多典型的网络相关降速和中断,从而保持前沿训练任务在大规模下的效率。”</span></p>
<p><span style="font-weight: 400;">此外,微软和NVIDIA有着长期合作,专注于推进下一代AI所需的基础设施。<a target="_blank" href="https://blogs.microsoft.com/blog/2025/09/18/inside-the-worlds-most-powerful-ai-datacenter/"><span style="font-weight: 400;">微软的Fairwater</span></a><span style="font-weight: 400;">以及<a target="_blank" href="https://blogs.oracle.com/cloud-infrastructure/first-principles-multipath-reliable-connection">甲骨文云基础设施(OCI)的Abilene</a>数据中心,这两个专门为训练和部署前沿大语言模型而建的最大AI工厂,都依赖MRC来实现性能、规模和效率要求。NVIDIA Spectrum-X以太网非常适合这种环境,有助于提供运行大规模AI模型和应用所需的可靠网络基础。</span></p>
<p><span style="font-weight: 400;">MRC首先在NVIDIA Spectrum-X以太网硬件上进行了性能优化并在生产环境中得到验证,现在已通过开放计算项目(OCP)作为开放规范<a target="_blank" href="https://www.opencompute.org/documents/ocp-mrc-1-0-pdf">发布</a>,这展示了Spectrum-X以太网平台的强大能力:专用硬件、深度遥测和智能结构控制协同工作,将一种新协议——一套控制数据在网络中两个系统间移动的规则——从概念推向千亿级AI生产。</span></p>
<p><span style="font-weight: 400;">MRC通过在所有可用路径上均衡流量来提供高GPU利用率,使每个GPU在整个训练过程中都能获得所需带宽。即使在拥塞情况下,它也能通过实时动态避开过载路径来维持高带宽。</span></p>
<p><span style="font-weight: 400;">当数据丢失发生时,智能重传可实现快速、精确的恢复,将短暂中断对长时间运行任务的影响降至最低,有助于避免GPU空闲时间。</span></p>
<p><span style="font-weight: 400;">管理员还可以获得对流量路径的细粒度可见性和控制,简化操作并加速大规模故障排除。</span></p>
<p><span style="font-weight: 400;">部署在Spectrum-X以太网上的MRC针对大规模弹性进行了优化和设计。其故障绕过技术可以在微秒内检测网络路径故障并自动在硬件中重新路由流量。</span></p>
<p><span style="font-weight: 400;">这种故障绕过技术对于数千个GPU必须保持同步的AI训练集群至关重要,因为即使是短暂的网络中断也可能减慢或中断整个训练任务。Spectrum-X以太网通过以硬件速度响应来防止这种情况,使流量沿着精确路径在千亿级AI架构中流动。</span></p>
<p><span style="font-weight: 400;">实现千亿级AI工厂的另一项关键创新是多平面网络设计,OpenAI与Spectrum-X以太网结合MRC部署了该设计。多平面网络由多个独立的网络架构(或平面)组成,每个平面为GPU之间提供备用通信路径。</span></p>
<p><span style="font-weight: 400;">NVIDIA Spectrum-X多平面能力通过支持跨平面的硬件加速负载均衡来增强这一网络架构,在不牺牲性能的情况下提高弹性和扩展性。这使得延迟可预测地保持较低,同时扩展到数十万个GPU。</span></p>
<p><span style="font-weight: 400;">借助Spectrum-X以太网,客户可以选择RDMA传输模型。Spectrum-X以太网自适应RDMA和MRC协议,以及其他自定义协议,都可以原生运行在<a target="_blank" href="https://www.nvidia.com/en-us/networking/products/ethernet/supernic/">NVIDIA ConnectX SuperNICs</a>和<a target="_blank" href="https://www.nvidia.com/en-us/networking/ethernet-switching/">Spectrum-X以太网交换机</a>上,并支持千亿级多平面网络设计。</span></p>
<p><span style="font-weight: 400;">如此一来,驱动当今最大AI集群的Spectrum-X以太网硬件和软件基础设施,让客户能够灵活选择适合其工作负载的传输方式。</span></p>
<p><span style="font-weight: 400;">MRC传输协议是业界如何将Spectrum-X以太网用作灵活、可组合平台的最新例证,该平台集成于现代AI基础设施的全部范围。</span></p>
<p><span style="font-weight: 400;">随着AI工厂持续扩展,网络不仅要快速传输数据,还必须智能、弹性且基于开放标准。NVIDIA Spectrum-X以太网在三个方面都表现出色,并通过MRC继续为先进AI网络设定标准。</span></p>
<p><span style="font-weight: 400;">NVI</span></p>
查看缓存全文
缓存时间: 2026/05/08 06:42
# NVIDIA Spectrum-X — 开放、AI 原生的以太网架构 — 为千兆级 AI 树立标准,现已支持 MRC
来源:https://blogs.nvidia.com/blog/spectrum-x-ethernet-mrc/
构建全球最强大 AI 工厂的竞赛,需要网络速度与 AI 自身的雄心并驾齐驱。
NVIDIA Spectrum-X 以太网横向扩展基础设施在这场竞赛中处于领先地位,是当今最先进的 AI 网络技术,已被那些在性能、弹性和规模上不容妥协的行业领导者所部署。
其中包括 OpenAI、Microsoft 和 Oracle。
NVIDIA、Microsoft 和 OpenAI 等公司通过引入多路径可靠连接(MRC)——一种 RDMA 传输协议——展现了行业领导力。MRC 使单个 RDMA 连接能够将流量分散到多条网络路径上,从而提升大规模 AI 训练架构的吞吐量、负载均衡能力和可用性。
可以将其想象成将一条贯穿小镇的单车道公路,替换为一个巧妙布局的街道网格系统,并搭配一个实时导航应用,让车辆能够绕开拥堵和封路路段。
"在 Blackwell 代际部署 MRC 非常成功,这得益于与 NVIDIA 的紧密合作,"OpenAI 工业计算负责人 Sachin Katti 表示。"MRC 的端到端方法使我们能够避免大部分典型的网络相关降速和中断,从而在规模上维持前沿训练运行的效率。"
此外,Microsoft 和 NVIDIA 长期合作,专注于推进下一代 AI 所需的基础设施。Microsoft 的 Fairwater 数据中心和 Oracle 云基础设施(OCI)的 Abilene 数据中心——两个专为训练和部署前沿大语言模型而建的全球最大 AI 工厂——均依赖 MRC 来满足性能、规模和效率要求。NVIDIA Spectrum-X 以太网非常适合这种环境,为大规模 AI 模型和应用的自信运行提供了所需的网络基础。
MRC 首先在 NVIDIA Spectrum-X 以太网硬件上经过生产验证并优化性能,现已通过开放计算项目(OCP)作为开放规范发布。这展示了 Spectrum-X 以太网平台的能力:专用硬件、深度遥测和智能架构控制协同工作,将一种新协议——控制数据在网络上两系统间移动的一组规则——从概念变为千兆级 AI 生产环境。
MRC 通过在所有可用路径上均衡流量,实现高 GPU 利用率,确保每个 GPU 在整个训练过程中获得所需带宽。即使在拥塞情况下,它也能通过实时动态避开过载路径来保持高带宽。
当发生数据丢失时,智能重传可实现快速精确的恢复,最大限度减少短暂中断对长期运行作业的影响,有助于避免 GPU 空闲时间。
管理员还能获得对流量路径的细粒度可见性和控制,简化运维并加速大规模问题排查。
部署在 Spectrum-X 以太网上的 MRC,经过优化和设计,可在大规模下实现弹性。其故障旁路技术能在微秒内检测到网络路径故障,并在硬件中自动重路由流量。
这项故障旁路技术对于 AI 训练集群至关重要——数千个 GPU 必须保持同步,即使是短暂的网络中断也可能减慢或中断整个训练任务。Spectrum-X 以太网通过以硬件速度响应来防止这种情况,确保流量在千兆级 AI 架构中沿精确路径持续流动。
实现千兆级 AI 工厂的另一项关键创新是多平面网络设计。OpenAI 结合 Spectrum-X 以太网和 MRC 部署了这种设计。多平面网络由多个独立的网络架构(平面)组成,每个平面在 GPU 之间提供一条备用通信路径。
NVIDIA Spectrum-X 多平面能力通过支持跨平面的硬件加速负载均衡来增强这种网络架构,在不牺牲性能的前提下提升弹性和规模。这使得延迟保持可预测的低水平,同时可扩展到数十万个 GPU。
借助 Spectrum-X 以太网,客户可以选择不同的 RDMA 传输模型。Spectrum-X 以太网自适应 RDMA 和 MRC 协议,以及其他自定义协议,均可原生运行于 NVIDIA ConnectX SuperNIC 和 Spectrum-X 以太网交换机之上,并支持千兆级的多平面网络设计。
通过这种方式,驱动当今最大 AI 集群的 Spectrum-X 以太网硬件和软件基础设施,为客户提供了为其工作负载选择合适传输方式的灵活性。
MRC 传输协议是业界如何将 Spectrum-X 以太网作为灵活、可组合平台,并集成到现代 AI 基础设施全貌的最新例证。
随着 AI 工厂持续扩展,网络必须做的不仅仅是快速移动数据。它必须智能、弹性且基于开放标准。NVIDIA Spectrum-X 以太网三者兼备,并通过 MRC 继续为先进的 AI 网络树立标杆。
NVIDIA 与 AMD、Broadcom、Intel、Microsoft 和 OpenAI 合作开发了 MRC。
*了解更多关于 NVIDIA Spectrum-X 以太网的信息,请访问**网页**、**数据表**和**技术白皮书**。*
*请参阅关于软件产品信息的**声明**。*
相似文章
专为Vera Rubin打造,NVIDIA Spectrum-6进入千兆级AI工厂
NVIDIA宣布推出专为Vera Rubin平台打造的Spectrum-6 102.4太比特/秒以太网交换系统,现已进入千兆级AI工厂。其容量是上一代产品的两倍,正被主要AI基础设施构建商采用,以加速训练和推理。
利用 MRC(多路径可靠连接)解锁大规模 AI 训练网络
OpenAI 发布了 MRC(Multipath Reliable Connection),这是一种与行业合作伙伴共同开发的全新网络协议,旨在提升大规模 AI 训练集群的性能和可靠性。该规范通过 Open Compute Project 发布,以标准化基础设施,实现高效的超级计算机运行。
@CNET:NVIDIA CEO 黄仁勋在 GTC 2026 谈 NVIDIA 共封装光学
Supermicro 与 NVIDIA 在 GTC 2026 发布一站式“AI 工厂”机柜,提供预验证的整机柜级计算/存储/网络堆栈,加速企业 AI 部署。
Amazon 推出了“Resilient Network Graphs”(RNG),一种数据中心网络,可将硬件需求降低 69%,并将吞吐量提升 33%。
Amazon 推出了“Resilient Network Graphs”(RNG),这是一种数据中心网络设计,可将硬件需求降低 69%,并将吞吐量提升 33%。自去年悄然部署以来,现已成为大多数 AWS 工作负载的默认网络。
NVIDIA与AWS合作,将AI大规模投入生产
NVIDIA与AWS宣布推出搭载NVIDIA RTX PRO 4500 Blackwell GPU的全新EC2 G7实例,以及在Amazon OpenSearch Serverless中提供GPU加速的向量搜索功能,使企业能够以更优的性能和更低的运营复杂性,大规模部署AI应用。