AMD 用户:您试过 llama.cpp 的 AMD-Ecosystem 分支吗?最高 2 倍提示处理速度

Reddit r/LocalLLaMA 工具

摘要

本文讨论了 llama.cpp 的一个 AMD 特定分支,该分支显著提升了 AMD 用户的提示处理速度,使用 ROCm/Hip 时,在密集模型上性能最高提升 2 倍,尽管在其他指标上有些权衡。

AMD 拥有自己的 llama.cpp 分支:https://github.com/AMD-Ecosystem/llama.cpp 尽管有弃用警告,但它仍在积极维护(内容会稍后上游同步到常规的 llama.cpp)。我在我的 Strix Halo 上注意到:它有一些有趣的新补丁(如果你使用 ROCm/Hip)。使用密集模型时,提示处理速度有时超过 2 倍快!我使用 14B 密集模型时获得约 550 tokens/s,而常规 llama.cpp 为 230。然而,TG 比使用 Vulkan 时慢约 15%。MoE 速度相同。
查看原文

相似文章

llama.cpp B9387 重大 AMD/ROCm PP 更新

Reddit r/LocalLLaMA

llama.cpp 版本 b9387 引入了对 AMD CDNA 架构(MI100、MI200、MI300 系列)的 MFMA 支持,提升了数据中心 AMD GPU 上的处理流程性能。