llama.cpp B9387 重大 AMD/ROCm PP 更新
摘要
llama.cpp 版本 b9387 引入了对 AMD CDNA 架构(MI100、MI200、MI300 系列)的 MFMA 支持,提升了数据中心 AMD GPU 上的处理流程性能。
[https://github.com/ggml-org/llama.cpp/releases/tag/b9387](https://github.com/ggml-org/llama.cpp/releases/tag/b9387) MFMA 仅限于 AMD CDNA 架构,即 MI100、MI200、MI300 系列数据中心显卡。如果你尝试了,请发布你的初步结果!😉
相似文章
GLM 和我创建了一个针对 AMD GFX906(Mi50、Mi60、Radeon VII、GCN HIP)优化的 llama.cpp 分支 - 机器学习、大语言模型和 AI
已创建一个 llama.cpp 的分支,并针对 AMD GFX906 GPU 进行了优化,提升了 Mi50、Mi60、Radeon VII 和 GCN HIP 上的性能,适用于机器学习和大语言模型应用。
AMD 用户:您试过 llama.cpp 的 AMD-Ecosystem 分支吗?最高 2 倍提示处理速度
本文讨论了 llama.cpp 的一个 AMD 特定分支,该分支显著提升了 AMD 用户的提示处理速度,使用 ROCm/Hip 时,在密集模型上性能最高提升 2 倍,尽管在其他指标上有些权衡。
ggml-cuda: hip: 添加缺失的 AMD GCN MMQ 配置 by thelittlefireman · Pull Request #27841 · ggml-org/llama.cpp - RDNA2(MI50, MI60) 的预填充性能改进
此拉取请求为 ggml-cuda 的 HIP 添加缺失的 AMD GCN MMQ 配置,增强了 llama.cpp 推理库中 RDNA2 GPU(如 MI50 和 MI60)的预填充性能。
llama:由AlexGabbia添加的Maple 20B-A1B三元MoE架构(CPU支持)· 拉取请求 #27000 · ggml-org/llama.cpp
此拉取请求为llama.cpp框架添加了Maple 20B-A1B三元混合专家架构的CPU推理支持。
vulkan: 针对AMD RDNA3和RDNA4的int8 coopmat1矩阵乘法实现 (… · ggml-org/llama.cpp@70c4e15)
此更新为llama.cpp引入了基于Vulkan的int8协作矩阵乘法实现,针对AMD RDNA3和RDNA4 GPU,提升这些硬件平台上的推理性能。