SpaceX 设计了轨道上的 Vera Rubin。接下来是辐射问题。
摘要
SpaceX 和 Nvidia 正在将 Vera Rubin NVL72 AI 平台适配用于轨道应用,并计划于2027年第四季度作为 Starmind AI 卫星项目的一部分发射一个空间优化系统。
暂无内容
查看缓存全文
缓存时间: 2026/09/01 12:53
# SpaceX 设计轨道版 Vera Rubin 系统,下一步应对辐射挑战
来源:https://thenewstack.io/spacex-nvidia-orbital-ai/
**SpaceX 与 Nvidia 宣布** 正在将 Vera Rubin NVL72 机架级AI平台适配用于轨道环境,SpaceX 计划于 2027年第四季度进行首次发射。
太空数据中心的愿景 (https://thenewstack.io/spacex-and-nvidias-orbital-ai-datacenter-fantasy/) 在 SpaceX 与 Nvidia 于8月24日的联合公告中得以延续——用于近地轨道(LEO)的Starmind (https://www.spacex.com/spacexai/starmind) AI卫星平台,将基于 Vera Rubin NVL72 (https://www.nvidia.com/en-us/data-center/vera-rubin-nvl72/) 芯片系列与架构构建。
该系统将构成 SpaceX AI 首代 Starmind AI卫星 (https://blogs.nvidia.com/blog/vera-rubin-lpx-spectrum-x-nvlink-fusion/#spacexai-vera-cpus) 的计算核心,并将 Nvidia 的架构从地面AI数据中心延伸至太空。
SpaceX 首席执行官埃隆·马斯克同日在 X 平台发布推文:“SpaceX 正与 Nvidia 合作,设计了优化用于轨道的 Vera Rubin NVL72 系统,计划于明年第四季度发射,并将于 2028 年实现规模化部署。”
> SpaceX 正与 Nvidia 合作,设计了优化用于轨道的 Vera Rubin NVL72 系统,计划于明年第四季度发射,并将于 2028 年实现规模化部署https://t.co/qdDq8YBkzl — Elon Musk (@elonmusk) 2026年8月24日 (https://x.com/elonmusk/status/2091939113008238838?ref_src=twsrc%5Etfw)
马斯克的推文发布于他在SpaceX第二季度财报电话会议上发言之后,当时他表示:“展望未来,我们已决定完全基于 Nvidia 平台进行构建,因为我们认为 Vera Rubin 架构是最佳架构。”马斯克补充道:“这不是某种遥远的未来事物;我们预计明年就开始发射。我们认为 NVL72 VR 电脑的设计远优于传统的机架式设计。因此我们计划将其同时部署在地面和轨道,因为我们认为它将极大简化标准NVL72机架。它的成本将更低,效果将更佳。如果我们能将其部署在太空,又何尝不想部署在地面呢?我认为这将非常酷。”
在地球上,Vera Rubin NVL72 (https://blogs.nvidia.com/blog/vera-rubin-nvl72-efficiency-ai-agents/) 是 Nvidia 的机架级AI设计,它将72个 Rubin GPU 与36个 Vera CPU 结合,并配备 ConnectX-9 SuperNICs 等高速网络组件。Nvidia 表示,SpaceX AI 计划的Starmind卫星将基于该系统的优化版本构建。
> 传统NVL72机架依赖重力、技术人员、稳定电网供电、建筑级液冷循环以及频繁更换故障部件。轨道环境则移除了所有这些前提条件。
其构想比在航天器上搭载传统边缘AI加速器更为宏大。Nvidia 与 SpaceX AI 提议将一种用于AI数据中心的改良架构送入轨道,并针对轨道运行要求进行调整。
然而,要在轨道上实现这一目标,说来容易做来难。
正如 Kingy AI (https://kingy.ai/) 创始人 Curtis Pyke (https://www.linkedin.com/in/curtis-pyke-4b52a420/) 所写:“传统NVL72机架依赖重力、技术人员、稳定电网供电、建筑级液冷循环以及频繁更换故障部件。轨道环境则移除了所有这些前提条件。(https://kingy.ai/blog/spacex-nvidia-orbital-ai-supercomputer-2027/)”
> “冷却系统面临严苛挑战。太空虽然寒冷,但真空无法通过对流带走热量。”
Pyke 进一步指出:“冷却系统面临严苛挑战。太空虽然寒冷,但真空无法通过对流带走热量。热量必须从芯片传递到散热器表面,然后以红外辐射形式散发到太空。SpaceX 表示,AI1 系统可以避免使用冷却器、冷却塔和风扇,并将冷却开销降低一个数量级。”
SpaceX 解释称,AI1 将改用航天器内部的闭环液冷系统,以及大型可展开散热器,直接以红外辐射形式将热量散发到太空。尽管其声称的降温效果在物理原理上是可行的,但目前尚无证据表明这些AI卫星的冷却系统能够达到预期效果。
另一个尚未解决的重大问题是如何让轨道机架具备抗辐射能力。使 Vera Rubin NVL72 抗辐射,远不止是将普通NVL72机架放入屏蔽卫星外壳那么简单。这需要围绕特定轨道和任务寿命,对其GPU、CPU、内存、网络、电源、冷却、固件和运行方式进行系统级重新设计。
近地轨道环境并非安全无虞。美国国家航空航天局(NASA)指出,对于500公里以下的低倾角近地轨道航天器,典型的捕获粒子剂量率为每年100至1000拉德(硅)(https://llis.nasa.gov/lesson/824)。这种辐射水平不会立即导致电子设备失效,但在多年的任务周期内会造成累积性降解。抗辐射航天硬件 (https://spacenexus.us/blog/radiation-hardening-space-electronics-strategies-trade-offs) 可以应对这一问题,但商用现成(COTS)电子设备则另当别论。一个真正的抗辐射Rubin GPU还需要在晶体管和电路层面进行设计变更。
即使 Nvidia 制造出这样的芯片,对于像 SpaceX 设计的高密度AI系统而言,担忧并不仅仅在于单个处理器能否承受5年或10年的辐射剂量。卫星包含众多辐射敏感部件,如GPU逻辑单元、SRAM缓存、寄存器文件、系统内存和内存控制器。拥有数千个核心和数十亿个内存存储单元,其设计驱动因素是整体故障率——而非单个组件的行为表现。
最现实的近期解决方案将是采用具备抗辐射能力、支持故障管理的基于Rubin架构的轨道系统,而非传统军事航天意义上的完全抗辐射NVL72。它可能使用精选的商用Nvidia部件、大量屏蔽、ECC和数据完整性机制、冗余控制器和电源路径、激进的故障检测、软件恢复以及降性能运行模式。
相似文章
@elonmusk:相同的Starmind V1卫星设计(不含太阳能板和散热器)将部署在我们数据中心的陆地上。这是……
埃隆·马斯克表示,Starmind V1卫星设计将适应地面部署,用于数据中心以提高效率。SpaceX正与NVIDIA合作,利用Rubin GPU和Vera CPU开发Starmind AI1卫星计算载荷。
NVIDIA下一代Vera Rubin GPU定于2027年中期推出
NVIDIA预计2027财年第三季度Vera Rubin系统的销售额将达到200亿美元,这标志着其历史上最快的产品爬坡速度,首批出货将面向Microsoft等主要超大规模客户。
Nvidia与SK海力士签署多年期AI合作协议 迎接Vera Rubin发布
Nvidia与SK海力士已签署下一代HBM4内存的多年期技术合作协议,同时Nvidia的Vera Rubin AI平台进入生产阶段,代理吞吐量提升10倍,将于第三季度向主要云服务商发货。
Figure.AI 计划在2027年下半年初始部署100,000个Vera Rubin GPU,以推进面向家用的通用人形机器人"将机器人带入每个家庭需要前所未有的计算规模"
Figure.AI与Nscale合作,计划到2027年部署多达100,000个NVIDIA Vera Rubin GPU,初始投资为35亿美元,以推进面向家用的通用人形机器人。
Vera到来:英伟达首款为智能体打造的CPU抵达顶级AI实验室
英伟达亲手将首批Vera CPU交付给Anthropic、OpenAI、甲骨文云基础设施和SpaceXAI,标志着专为智能体AI工作负载设计的CPU到来。