ROCm 10.0:十年开放计算,专为智能体AI时代打造

Reddit r/LocalLLaMA 产品

摘要

AMD发布了其开源GPU计算平台的重大更新ROCm 10.0,标志着十年发展历程,并通过ROCm.AI引入了原生智能体AI开发体验。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/28 19:47

# ROCm 10.0:十年开放计算,专为代理AI时代而生 来源:https://rocm.blogs.amd.com/ecosystems-and-partners/rocm-x-blog/README.html ## ROCm 10.0:十年开放计算,专为代理AI时代而生 (https://rocm.blogs.amd.com/ecosystems-and-partners/rocm-x-blog/README.html#rocm-10-0-a-decade-of-open-compute-built-for-the-age-of-agentic-ai) ROCm 10.0:十年开放计算,专为代理AI时代而生 5分钟阅读 | 总计1249字 标签: [AI/ML](https://rocm.blogs.amd.com/blog/tag/aiml.html)、 [线性代数](https://rocm.blogs.amd.com/blog/tag/linear-algebra.html)、 [编译器](https://rocm.blogs.amd.com/blog/tag/compiler.html)、 [硬件](https://rocm.blogs.amd.com/blog/tag/hardware.html)、 [计算机视觉](https://rocm.blogs.amd.com/blog/tag/computer-vision.html)、 [HPC](https://rocm.blogs.amd.com/blog/tag/hpc.html)、 [安装](https://rocm.blogs.amd.com/blog/tag/installation.html)、 [JAX](https://rocm.blogs.amd.com/blog/tag/jax.html)、 [LLM](https://rocm.blogs.amd.com/blog/tag/llm.html)、 [内存](https://rocm.blogs.amd.com/blog/tag/memory.html)、 [OpenMP](https://rocm.blogs.amd.com/blog/tag/openmp.html)、 [性能](https://rocm.blogs.amd.com/blog/tag/performance.html)、 [性能分析](https://rocm.blogs.amd.com/blog/tag/profiling.html)、 [PyTorch](https://rocm.blogs.amd.com/blog/tag/pytorch.html)、 [代理AI](https://rocm.blogs.amd.com/blog/tag/agentic-ai.html)、 [ROCm.AI](https://rocm.blogs.amd.com/blog/tag/rocm.ai.html)、 [ROCm CLI](https://rocm.blogs.amd.com/blog/tag/rocm-cli.html)、 [AMD Skills](https://rocm.blogs.amd.com/blog/tag/amd-skills.html)、 [Hyperloom](https://rocm.blogs.amd.com/blog/tag/hyperloom.html) AMD于2016年4月发布了ROCm 1.0:一个围绕C++编译器和名为HIP的GPU编程语言构建的开源GPU计算栈,旨在用于高性能计算。十年后,同一平台已在各行各业训练和部署前沿AI模型,并赋能几乎所有受益于GPU的计算应用。ROCm 10.0以一个主版本号的跃升来纪念这一十年,而这一跳跃是刻意为之的。TheRock——在ROCm 7.14中投入生产的自动化开源构建与发布系统——现在已成为整个版本发布的基础。而且,ROCm首次随附了原生的代理AI开发者体验:ROCm.AI(http://rocm.ai/),它基于全新的ROCm CLI、AMD Skills和Hyperloom构建,重塑了平台自身的打包和支持方式。 本文将介绍亮点内容:发生了什么变化、它能实现什么,以及为何重要——从基础开始,经过ROCm.AI(http://rocm.ai/)和本版本的其他焦点,最后展望未来。 ## 基于TheRock构建的新主版本 (https://rocm.blogs.amd.com/ecosystems-and-partners/rocm-x-blog/README.html#a-new-major-version-built-on-therock) ROCm Core SDK 10.0是自7.x系列以来的首个主版本升级,它完全构建于TheRock(https://github.com/ROCm/TheRock)之上——这是一个在ROCm 7.14中投入生产的自动化开源构建与发布系统。基础组件、库和框架轮子都来自同一条流水线,在发布前经过整个栈的分阶段验证。ROCm 10及其后续小版本将继续大约每六周发布一次。 正是这条单一的流水线,使得ROCm能够部署到AMD GPU产品组合中的所有产品——包括Instinct加速器、Radeon显卡和Ryzen集成显卡——无论是在Windows还是Linux上。一套栈,一个源代码树,一次发布。为某个产品系列或某个操作系统新增的功能,会在同一批次中为其他产品构建和验证,而不是作为单独的移植项目排队进行。你在笔记本电脑上进行原型设计的平台,与数据中心机架中为前沿模型提供服务的平台是同一个,你在其中一个平台上完成的工作可以无缝地延续到另一个平台。 ## 获取AMD GPU软件的统一入口 (https://rocm.blogs.amd.com/ecosystems-and-partners/rocm-x-blog/README.html#one-place-to-get-amd-gpu-software) 在发布版本本身的同时,AMD正在将GPU软件分发渠道整合到一个重新设计的仓库(https://repo.amd.com/)中,以支持未来的版本发布。历史上,要运行完整的GPU栈,意味着需要从不同地方收集组件:从一个地方获取ROCm软件包,从另一个地方获取图形和计算驱动,再从其他地方获取数据中心工具。每个都有自己的布局、命名和需要遵循的说明。 这次重新设计将AMD GPU软件统一到一个屋檐下。ROCm软件包、amdgpu驱动和AMD公开的GPU工具将发布到一个结构一致的单一仓库——一个可信赖的主机,一个需要配置的仓库,一套无论你需要栈的哪个部分都保持不变的说明文档。 新的布局还支持多个ROCm版本和多种架构并存,因此一台机器可以同时拥有多个ROCm版本,团队可以根据自己的时间表(而非发布列车的时间表)进行固定、分阶段和滚动升级。每夜构建、候选发布和稳定正式版(GA)的产物都以统一的标准格式发布。对于任何自动化安装来说,这部分价值会不断累积。容器构建、配置脚本或离线镜像现在只需要指向一个地方并保持指向即可。将驱动添加到现有的ROCm部署中,不再需要第二个仓库和第二组密钥,而是变成从已配置仓库中获取的另一个软件包。 ## ROCm.AI:AI原生开发者体验 (https://rocm.blogs.amd.com/ecosystems-and-partners/rocm-x-blog/README.html#rocm-ai-an-ai-native-developer-experience) ROCm 10.0的头条是**ROCm.AI(http://rocm.ai/)**,AMD全新的AI原生开发者体验,于Advancing AI 2026(https://www.amd.com/en/corporate/events/advancing-ai.html)上公开介绍,并从本版本开始推出。过去的ROCm版本主要为你提供了更好的基础组件和库来构建,而ROCm.AI(http://rocm.ai/)则专注于围绕这些组件的工作流程:安装、验证、部署和优化AMD硬件上的AI工作负载,大幅减少手动操作负担。 它由三个部分组成,随ROCm 10.0一起发布——ROCm CLI、AMD Skills(https://github.com/amd/skills)和Hyperloom(https://github.com/AMD-AGI/Hyperloom)。 ### ROCm CLI (https://rocm.blogs.amd.com/ecosystems-and-partners/rocm-x-blog/README.html#rocm-cli) **ROCm CLI**是一个单一的统一命令行工具,用于在AMD平台上安装、验证、部署、更新和故障排除AI工作负载,取代了过去一系列独立的脚本和手动步骤。它在ROCm 10.0中以技术预览版发布——请将其视为早期访问版本,界面预计将持续演进。`rocm serve`可以在PyTorch上为模型启动推理服务,`rocm examine`用于诊断环境和驱动问题,并且该CLI支持离线环境,允许其依赖项与二进制文件一起下载为自包含的捆绑包。 ### AMD Skills (https://rocm.blogs.amd.com/ecosystems-and-partners/rocm-x-blog/README.html#amd-skills) **AMD Skills**通过Agent Skills格式,将AMD验证的ROCm知识直接引入开发者已经使用的AI编程助手——Claude、Cursor、Codex——中,如图1所示。官方目录位于`amd/skills`(https://github.com/amd/skills)GitHub仓库,作为一个联合技能集合,与这些工具已查找的标准技能目录(`~/\.claude/skills/`、`~/\.cursor/skills/`、`.claude/skills/`)兼容,并提供一个配套市场,打包由AMD团队构建的技能,支持一键安装。 该目录涵盖GPU和CPU工作流。在GPU方面,`rocm-doctor`驱动CLI的`rocm examine`诊断功能,而`serving-llms-on-instinct`则引导智能体在MI300X、MI325X、MI350X或MI355X上搭建一个vLLM OpenAI兼容端点。在CPU方面,该目录通过ZenDNN和zentorch将相同的方法扩展到EPYC处理器:`serving-llms-on-epyc`和`quantize-for-zentorch`为智能体提供在CPU-only推理场景下部署和量化模型所需的一切,基于公开的AMD PACE vLLM插件构建。 无论是针对Instinct GPU还是EPYC CPU,采用的都是相同的基于技能的工作流程——安装了AMD Skills的助手会自动获取正确的技能。 **AMD Skills** 图1:AMD Skills与ROCm CLI (https://rocm.blogs.amd.com/ecosystems-and-partners/rocm-x-blog/README.html#id1) ### Hyperloom:闭环优化 (https://rocm.blogs.amd.com/ecosystems-and-partners/rocm-x-blog/README.html#hyperloom-closing-the-optimization-loop) **Hyperloom**是ROCm.AI(http://rocm.ai/)的第三部分,也是最接近完全将人类从循环中移除的部分。它是一个新的开源、代理式系统,可自动化端到端的推理工作负载优化——分析工作负载、分析结果、规划更改、应用更改并验证正确性,循环往复,无需工程师手动驱动每个周期。 AMD报告称,Hyperloom将过去需要数周的手动优化工作缩短至数小时,同时探索了远超人类在时间压力下会尝试的解决方案空间。在底层,Hyperloom将五个组件协调成一个单一的Profile → Analyze → Plan → Optimize → Validate循环,如图2所示:用于自动化瓶颈识别的TraceLens-Agent、用于内核评估和基准测试的Magpie、IntelliKit的对话式分析工具、GEAK的自主多智能体内核优化(涵盖Triton、HIP、CK、FlyDSL和TileLang后端),以及Arbor在优化空间上的自进化搜索。 另一个独立工具AgentKernelArena允许团队对不同的优化智能体进行A/B测试和评分,在标准化任务上比较它们。Hyperloom现已开源,可在MI300X、MI325X和MI355X上运行,并通过单条`pip`命令安装——将其指向模型和配置,然后告诉你的智能体类似“使用Hyperloom优化Minimax M3 MXFP8”的指令即可启动会话。有关完整架构、组件分解和设置说明,请参阅专门的Hyperloom博客(https://rocm.blogs.amd.com/software-tools-optimization/hyperloom/README.html)。 **Hyperloom** 图2:Hyperloom工作流程 (https://rocm.blogs.amd.com/ecosystems-and-partners/rocm-x-blog/README.html#id2) ## 框架与模型性能 (https://rocm.blogs.amd.com/ecosystems-and-partners/rocm-x-blog/README.html#frameworks-and-model-performance) ### 开箱即用的部署容器 (https://rocm.blogs.amd.com/ecosystems-and-partners/rocm-x-blog/README.html#turnkey-serving-containers) ROCm 10.0为**vLLM(https://github.com/vllm-project/vllm)**和**SGLang(https://github.com/sgl-project/sglang)**提供了生产就绪支持,使团队能够在AMD Instinct、Radeon和Ryzen硬件上运行LLM推理,无需从源代码构建整个栈。两个框架都经过了与ROCm其余部分相同的发布验证,其上游贡献会回流到各自的社区。经过验证的容器和Python轮子在Docker Hub上可用,通过TheRock的多架构CI流水线构建。 ### 在Ryzen™ AI MAX上进行本地LLM微调 (https://rocm.blogs.amd.com/ecosystems-and-partners/rocm-x-blog/README.html#local-llm-fine-tuning-on-ryzen-ai-max) ROCm 10.0新增了在Ryzen™ AI MAX平台上支持**Unsloth(https://github.com/unslothai/unsloth)**的功能,实现了快速、内存高效的大型语言模型本地微调。通过支持LoRA和QLoRA等技术,开发者可以在降低内存需求的同时微调模型,并利用Ryzen™ AI MAX上的大容量统一内存。这使得AI开发体验更易访问且更私密,允许用户在本地微调模型,无需依赖云基础设施。 ### 使用ComfyUI优化生成式AI工作负载 (https://rocm.blogs.amd.com/ecosystems-and-partners/rocm-x-blog/README.html#optimized-generative-ai-workloads-with-comfyui) ROCm 10.0通过扩展ComfyUI对领先图像和视频生成模型的优化,增强了生成式AI体验。AMD已对流行模型(包括Wan2.2、FLUX.2 KLEIN、Stable Diffusion 3.5 Medium、Stable Diffusion 2.1和Stable Diffusion XL Base)进行了性能调优,帮助用户在受支持的Ryzen和Ryzen平台上获得出色的开箱即用性能。 除了模型验证外,ROCm还为ComfyUI图像和视频生成工作负载提供了选择最佳注意力算法和后端的实用指南([理解图像和视频生成中的注意力算法及其后端](https://rocm.blogs.amd.com/software-tools-optimization/comfyui-fa-backends/README.html))。这些建议帮助用户以最小的调优在AMD GPU上获得最佳性能,使从安装到内容创作的过程更加容易。 ## 通信库:RCCL和rocSHMEM (https://rocm.blogs.amd.com/ecosystems-and-partners/rocm-x-blog/README.html#communication-libraries-rccl-and-rocshmem) 通信库在本次发布中获得了最大的单笔投资——一次协调一致的推进,旨在缩小与NVIDIA NCCL和NVSHMEM的差距,并在真正大规模运行时添加相关能力。 **RCCL(https://github.com/ROCm/rocm-systems/tree/develop/projects/rccl)**,即ROCm集体通信库,将其上游NCCL合并从2.28.3推进到2.30.4,并新增了对称内存支持,用于紧耦合多GPU点对点通信;新增了GPU发起的网络(GIN)设备API,允许GPU直接通过GDA和SDMA路径启动网络传输,而非通过CPU中转;新增了用于集体通信之外数据移动的单边主机API;以及一套新的Python化API,用于直接在Python中使用RCCL。 大规模引导改进降低了跨数百个GPU的启动开销,容错增强提高了长时间运行作业的弹性,复制引擎集体操作、分层AllGather和直接集体操作提升了多节点和单节点拓扑的吞吐量。 **rocSHMEM(https://rocm.docs.amd.com/projects/rocSHMEM/en/latest/)**继续缩小与NVSHMEM 3.6.5的API差距:本版本新增了主机AMO和上下文API,支持非MPI IPC运行时;新增了`reduce_on_stream`变体和原生的`reduce_scatter`实现;新增了波级集体操作;新增了用于更细粒度团队管理的`team_split_2d`;以及额外的缓冲区和堆管理函数——使ROCm中的GPU发起通信在功能上更接近其CUDA对应物。 ## 库 (https://rocm.blogs.amd.com/ecosystems-and-partners/rocm-x-blog/README.html#libraries) 本次发布中有两个库尤为突出,两者都旨在为AMD平台带来比竞争对手更明显的优势。 **hipBLASLt(https://rocm.docs.amd.com/projects/hipBLASLt/en/latest/)**带来了新的GEMM内核优化器,允许团队在本地为自己的工作负载调整内核选择,而无需向AMD或任何第三方暴露模型权重或专有数据——基准测试在本地运行,并生成偏向于给定问题形状下性能最佳内核的配置文件。它将GEMM依赖的Transformer推理和训练(这是大多数团队实际运行的工作负载)从固定成本转变为可调优的优势。 **rocSPARSE(https://github.com/ROCm/rocm-libraries/tree/develop/projects/rocsparse)**新增了一套匹配的稀疏线性代数改进,旨在使AMD在稀疏工作负载上领先:一个智能的SPMM选择器,可为给定矩阵结构自动选择最佳稀疏矩阵-矩阵乘法算法;CSC三角求解器;以及...

相似文章

2026年中ROCm状态 [D]

Reddit r/MachineLearning

作者询问2026年中AMD的ROCm生态系统在AI训练领域的当前可行性,将其与NVIDIA的CUDA进行比较,并询问它是否已达到PyTorch的“开箱即用”阶段。