Hot Chips 2026: CUDA 瞄准 RISC-V – 作者:Chester Lam

Hacker News Top 事件

摘要

在 Hot Chips 2026 上,Nvidia 宣布了将 CUDA 支持扩展到 RISC-V CPU 的计划,概述了具体的硬件要求,如服务器级CPU、ACPI和PCIe一致性,以实现高效的GPU计算。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/24 19:49

# Hot Chips 2026: CUDA剑指RISC-V 来源:https://chipsandcheese.com/p/hot-chips-2026-cuda-targets-risc CUDA是GPU计算领域的巨擘,其应用覆盖机器学习等场景。目前CUDA仅支持x86-64与aarch64架构CPU。如今Nvidia正着手将CUDA支持扩展至RISC-V架构。这一举措为RISC-V CPU驱动GPU计算打开了大门。Nvidia的演讲重点阐述了RISC-V CPU运行CUDA所需满足的要求,本质上需要服务器级CPU与配套平台。 ![Nvidia对RISC-V架构的基本要求](https://substackcdn.com/image/fetch/$s_!BKke!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F64737827-904c-4a0a-884f-6a3b0adf14ab_1548x867.png) Nvidia首先要求CPU符合RVA23标准,并遵循RISC-V服务器SoC规范(https://docs.riscv.org/reference/server-soc/_attachments/riscv-server-soc.pdf)与服务器平台规范(https://github.com/riscv-non-isa/riscv-server-platform/releases/tag/v1.0)。这些规范包含RAS(可靠性、可用性与可维护性)功能、专用安全处理器及其他基础特性。Nvidia的服务器级需求主要通过这些规范得以实现。 Nvidia还提出超越上述RISC-V架构与平台规范的额外要求,因为他们发现缺乏这些特性将导致CUDA软件难以高效运行。Nvidia希望避免"最低公分母"困境——若无法确保硬件支持性能扩展指令集,则无法使用相关优化技术。从Nvidia视角看,这将迫使其发布低效代码。Nvidia以向量扩展为例说明:谓词支持能帮助减少分支预测。 ![CUDA软件栈的关键需求](https://substackcdn.com/image/fetch/$s_!XQxA!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Ffa127636-1d29-4f06-ab49-4a1e58f94d6e_1451x800.png) ACPI支持是更具挑战性的要求。ACPI允许软件检测硬件功能,可用于电源、性能与温控管理。Nvidia软件团队在初期移植CUDA时因RISC-V硬件缺乏ACPI支持而苦恼,但该问题已在2025年得到解决:UEFI论坛正式纳入RISC-V ACPI支持,且RISC-V BRS(启动与运行时服务)规范于去年获批,其中包含ACPI要求。 ![ACPI规范对电源管理至关重要](https://substackcdn.com/image/fetch/$s_!0Fqc!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F07ec8187-4552-4cb5-9248-f782775a1393_1458x816.png) 此外Nvidia要求支持PCIe缓存一致性。Nvidia指出典型场景:当CPU写入数据后仍保留在缓存中,若CUDA发起DMA请求将数据传输至GPU,DMA引擎可能从DRAM读取数据而忽略CPU缓存中的修改版本。在GPU返回结果时,DMA写入DRAM后CPU仍可能从缓存读取旧数据。若系统缺乏PCIe一致性,软件必须显式刷新缓存以避免此类问题。将缓存刷新机制整合至CUDA栈存在较大难度,而Nvidia认为PCIe一致性本应是服务器CPU标配功能。虽然RISC-V服务器SoC规范建议实现缓存一致性,但Nvidia需要明确保障。 ![缓存一致性问题示意图](https://substackcdn.com/image/fetch/$s_!WSv7!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fdd2d01bb-a818-4c21-a696-d0e56e41a52e_1452x814.png) Nvidia同时要求硬件支持PCIe对等通信。缺乏该功能时,跨设备缓冲区传输需经由CPU内存中转,这既影响性能又增加同步信号需求。 ![NVLink Fusion架构示意图](https://substackcdn.com/image/fetch/$s_!BXla!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F3bf886a2-61de-4fbe-ae89-e855179f7897_1455x814.png) 遗憾的是Nvidia未详述所有要求。他们仅表示目标是达到特定性能水平,完整要求清单不超过两页。这两页的具体规格未明确——可能是双倍行距大字体文档,亦或是开卷考试允许携带的笔记页(学生通常会尽量填满)。 除CUDA在RISC-V平台的适配外,Nvidia简要介绍了NVLink Fusion的要求。该技术允许其他厂商在自家芯片中集成Nvidia的NVLink IP,从而使用NVLink C2C链路连接自选CPU。类似产品可能参照Nvidia的GB10方案——该设备通过NVLink C2C将联发科CPU芯片与Nvidia GPU连接。Nvidia当然希望客户使用自家CPU,但若客户需要连接定制CPU或其他加速器,仍建议采用NVLink IP,而定制CPU可以是RISC-V架构。 ![NVLink Fusion技术要求](https://substackcdn.com/image/fetch/$s_!Axea!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fb6bca6f4-8ecd-454f-89e9-22b8291aa3b6_1449x806.png) NVLink Fusion的要求包含CUDA全部规范,并需支持DOCA、NCCL等软件框架。此外要求与Nvidia建立紧密合作关系——这本是意料之中。IP集成工作复杂度高,很可能需要类似联发科与Nvidia在GB10项目中的协作深度。 ![RISC-V生态发展展望](https://substackcdn.com/image/fetch/$s_!PSiu!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fbd31b979-e550-43a4-981a-b3699cab7528_1454x815.png) RISC-V软件生态距离x86-64与aarch64仍有差距。Nvidia推动CUDA适配RISC-V是积极进展,但这并不意味着现有RISC-V设备能立即搭载Nvidia GPU运行CUDA。绝大多数现有硬件无法满足Nvidia要求,事实上近期能满足要求的消费级RISC-V设备可能都不会出现。ACPI支持是明显瓶颈,厂商实现难度较大。尽管aarch64架构已多年支持ACPI标准,但实际采用情况仍不完善(https://uefi.org/sites/default/files/resources/UEFI%20and%20ACPI%20in%20Arm%20System%20Architecture_Wei.pdf)。2025年通过的RISC-V标准可能需要数年才能获得广泛支持,甚至更久。 ![Nvidia与SiFive合作展望](https://substackcdn.com/image/fetch/$s_!J-EI!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F088b2d6a-8bab-4f7d-aec3-7cd0889c2d9b_1455x813.png) 未来若RISC-V系统支持CUDA,更可能出现在服务器领域而非业余爱好者青睐的单板计算机。Nvidia表示正与SiFive合作,后者计划在Hot Chips展示运行CUDA的系统。Nvidia演示文稿中的CPU规格可能对应此系统,高核心数服务器芯片的定位显而易见。笔者期待该演示,同时希望Nvidia不要限制CUDA在非认证系统运行——爱好者尝试用RISC-V系统驱动Nvidia GPU将是非常有趣的实验。 展望未来,期待Nvidia放宽要求使现有RISC-V系统有更多适配可能。缺乏向量扩展或PCIe一致性未必导致性能危机:使用分支替代谓词若分支预测准确仍可高效运行;缓存刷新虽会带来性能损耗,但对于计算密集型而非数据密集型工作负载,该代价或许可以接受。PCIe对等传输亦是同理——虽然高速通道更优,但低频操作可通过精细设计使用低速路径。但愿Nvidia当前要求只是快速低风险移植的权宜之计,并期待CUDA未来能支持更广泛的RISC-V系统,而非仅限于专业企业级设计。

相似文章