Hot Chips 2026: CUDA 瞄准 RISC-V – 作者:Chester Lam
摘要
在 Hot Chips 2026 上,Nvidia 宣布了将 CUDA 支持扩展到 RISC-V CPU 的计划,概述了具体的硬件要求,如服务器级CPU、ACPI和PCIe一致性,以实现高效的GPU计算。
暂无内容
查看缓存全文
缓存时间: 2026/08/24 19:49
# Hot Chips 2026: CUDA剑指RISC-V
来源:https://chipsandcheese.com/p/hot-chips-2026-cuda-targets-risc
CUDA是GPU计算领域的巨擘,其应用覆盖机器学习等场景。目前CUDA仅支持x86-64与aarch64架构CPU。如今Nvidia正着手将CUDA支持扩展至RISC-V架构。这一举措为RISC-V CPU驱动GPU计算打开了大门。Nvidia的演讲重点阐述了RISC-V CPU运行CUDA所需满足的要求,本质上需要服务器级CPU与配套平台。

Nvidia首先要求CPU符合RVA23标准,并遵循RISC-V服务器SoC规范(https://docs.riscv.org/reference/server-soc/_attachments/riscv-server-soc.pdf)与服务器平台规范(https://github.com/riscv-non-isa/riscv-server-platform/releases/tag/v1.0)。这些规范包含RAS(可靠性、可用性与可维护性)功能、专用安全处理器及其他基础特性。Nvidia的服务器级需求主要通过这些规范得以实现。
Nvidia还提出超越上述RISC-V架构与平台规范的额外要求,因为他们发现缺乏这些特性将导致CUDA软件难以高效运行。Nvidia希望避免"最低公分母"困境——若无法确保硬件支持性能扩展指令集,则无法使用相关优化技术。从Nvidia视角看,这将迫使其发布低效代码。Nvidia以向量扩展为例说明:谓词支持能帮助减少分支预测。

ACPI支持是更具挑战性的要求。ACPI允许软件检测硬件功能,可用于电源、性能与温控管理。Nvidia软件团队在初期移植CUDA时因RISC-V硬件缺乏ACPI支持而苦恼,但该问题已在2025年得到解决:UEFI论坛正式纳入RISC-V ACPI支持,且RISC-V BRS(启动与运行时服务)规范于去年获批,其中包含ACPI要求。

此外Nvidia要求支持PCIe缓存一致性。Nvidia指出典型场景:当CPU写入数据后仍保留在缓存中,若CUDA发起DMA请求将数据传输至GPU,DMA引擎可能从DRAM读取数据而忽略CPU缓存中的修改版本。在GPU返回结果时,DMA写入DRAM后CPU仍可能从缓存读取旧数据。若系统缺乏PCIe一致性,软件必须显式刷新缓存以避免此类问题。将缓存刷新机制整合至CUDA栈存在较大难度,而Nvidia认为PCIe一致性本应是服务器CPU标配功能。虽然RISC-V服务器SoC规范建议实现缓存一致性,但Nvidia需要明确保障。

Nvidia同时要求硬件支持PCIe对等通信。缺乏该功能时,跨设备缓冲区传输需经由CPU内存中转,这既影响性能又增加同步信号需求。

遗憾的是Nvidia未详述所有要求。他们仅表示目标是达到特定性能水平,完整要求清单不超过两页。这两页的具体规格未明确——可能是双倍行距大字体文档,亦或是开卷考试允许携带的笔记页(学生通常会尽量填满)。
除CUDA在RISC-V平台的适配外,Nvidia简要介绍了NVLink Fusion的要求。该技术允许其他厂商在自家芯片中集成Nvidia的NVLink IP,从而使用NVLink C2C链路连接自选CPU。类似产品可能参照Nvidia的GB10方案——该设备通过NVLink C2C将联发科CPU芯片与Nvidia GPU连接。Nvidia当然希望客户使用自家CPU,但若客户需要连接定制CPU或其他加速器,仍建议采用NVLink IP,而定制CPU可以是RISC-V架构。

NVLink Fusion的要求包含CUDA全部规范,并需支持DOCA、NCCL等软件框架。此外要求与Nvidia建立紧密合作关系——这本是意料之中。IP集成工作复杂度高,很可能需要类似联发科与Nvidia在GB10项目中的协作深度。

RISC-V软件生态距离x86-64与aarch64仍有差距。Nvidia推动CUDA适配RISC-V是积极进展,但这并不意味着现有RISC-V设备能立即搭载Nvidia GPU运行CUDA。绝大多数现有硬件无法满足Nvidia要求,事实上近期能满足要求的消费级RISC-V设备可能都不会出现。ACPI支持是明显瓶颈,厂商实现难度较大。尽管aarch64架构已多年支持ACPI标准,但实际采用情况仍不完善(https://uefi.org/sites/default/files/resources/UEFI%20and%20ACPI%20in%20Arm%20System%20Architecture_Wei.pdf)。2025年通过的RISC-V标准可能需要数年才能获得广泛支持,甚至更久。

未来若RISC-V系统支持CUDA,更可能出现在服务器领域而非业余爱好者青睐的单板计算机。Nvidia表示正与SiFive合作,后者计划在Hot Chips展示运行CUDA的系统。Nvidia演示文稿中的CPU规格可能对应此系统,高核心数服务器芯片的定位显而易见。笔者期待该演示,同时希望Nvidia不要限制CUDA在非认证系统运行——爱好者尝试用RISC-V系统驱动Nvidia GPU将是非常有趣的实验。
展望未来,期待Nvidia放宽要求使现有RISC-V系统有更多适配可能。缺乏向量扩展或PCIe一致性未必导致性能危机:使用分支替代谓词若分支预测准确仍可高效运行;缓存刷新虽会带来性能损耗,但对于计算密集型而非数据密集型工作负载,该代价或许可以接受。PCIe对等传输亦是同理——虽然高速通道更优,但低频操作可通过精细设计使用低速路径。但愿Nvidia当前要求只是快速低风险移植的权宜之计,并期待CUDA未来能支持更广泛的RISC-V系统,而非仅限于专业企业级设计。
相似文章
RISC-V 势不可挡:State of the Union 主题演讲指出
在 RISC-V 欧洲峰会 2026 上,Krste Asanović 宣布开放标准 ISA 状态强劲,并强调其扩展至高性能服务器级芯片,以及被 Qualcomm、Nvidia 和 Google 等主要科技公司采用。
Computex 2026 将成为 NVIDIA 今年最重要的活动。以下是值得期待的亮点(5分钟阅读)
NVIDIA 预计将在 Computex 2026 上发布其新款 N1X 笔记本电脑 APU,这是一款 20 核 ARM 芯片,配备相当于 RTX 5070 的 GPU 和 128GB 统一内存,专为 AI 工作负载设计。本文预览了该产品的发布及其对笔记本电脑市场的潜在影响。
RISC-V 与浮点运算
关于 RISC-V 架构浮点功能及更新的报告。
CPython 正式支持 RISC-V 架构
CPython 已正式将 RISC-V 架构添加为三级支持平台,使 Python 能在开源指令集硬件上运行。
Nvidia 预告将在 6 月 2 日 Computex 上发布新款 PC 笔记本电脑芯片
Nvidia 预告将在 6 月 2 日 Computex 上发布一款新的基于 ARM 的 PC 笔记本电脑芯片(很可能是 N1X)。该芯片是 DGX Spark 中使用的 GB10 Superchip 的低功耗版本,拥有 20 个 ARM 核心和 6144 个 CUDA 核心,面向 Windows 笔记本电脑。