llama.cpp b9095 发布!支持双 Blackwell PCIe 显卡无需 NCCL 的张量并行
摘要
llama.cpp b9095 版本引入了针对双 Blackwell PCIe GPU 的免 NCCL 张量并行功能,使得在不依赖 NCCL 的情况下也能实现高效的多 GPU 推理。
b9095 终于让 -sm tensor 功能在双消费级 Blackwell PCIe GPU 上无需 NCCL 即可正常工作。如果你使用的是双 Blackwell GPU,这可能会带来显著的提升。我会在第一时间分享基于 2 张 RTX 5060 Ti 的测试结果。
相似文章
Blackwell 与 PDL 性能提升
Llama.cpp 现已支持适用于 Blackwell GPU 的 Nvidia 程序化依赖启动 (PDL),在 Token 生成时可带来 5-10% 的性能提升。该功能默认未启用,需通过编译标志开启。
@ggerganov:强调 llama.cpp 在多GPU和张量并行支持方面的最新进展 过去几个月来,llama.cpp 取得了多项…
llama.cpp 维护者与 NVIDIA 工程师合作,显著提升了 ggml 中的多GPU性能,实现了硬件无关的张量并行,并在 RTX 系统上获得了显著的性能提升。
双GPU llama.cpp加速
llama.cpp的一个分支修复了量化KV缓存中的--split-mode tensor问题,在双GPU配置上实现高达40%的速度提升,且无质量损失。
双GPU下流水线与张量并行的llama.cpp中测量PCIe传输
在双GPU下使用流水线和张量并行运行llama.cpp时的PCIe传输性能分析。
vulkan: 使TP可行 · Pull Request #25051 · ggml-org/llama.cpp
此拉取请求使得在使用Vulkan后端时,llama.cpp中的张量并行(TP)变得可行,从而能够在多个GPU上进行分布式推理。