@ggerganov:强调 llama.cpp 在多GPU和张量并行支持方面的最新进展 过去几个月来,llama.cpp 取得了多项…
摘要
llama.cpp 维护者与 NVIDIA 工程师合作,显著提升了 ggml 中的多GPU性能,实现了硬件无关的张量并行,并在 RTX 系统上获得了显著的性能提升。
强调 llama.cpp 在多GPU和张量并行支持方面的最新进展。过去几个月里,llama.cpp 维护者与 NVIDIA 工程师合作,改进了 ggml 中的多GPU性能。这在 RTX 系统上带来了显著的性能提升,并为 ggml 中硬件无关的张量并行奠定了基础。欲了解有关此内容以及 llama.cpp 底层推理引擎其他进展的更多信息,请查看下方 @NVIDIARTXSpark 的技术博客。
相似文章
vulkan: 使TP可行 · Pull Request #25051 · ggml-org/llama.cpp
此拉取请求使得在使用Vulkan后端时,llama.cpp中的张量并行(TP)变得可行,从而能够在多个GPU上进行分布式推理。
@analogalok:别再盲目信任本地 LLM 的默认多 GPU 设置了,你实际上正浪费 25% 的性能……
基准测试结果对比了 llama.cpp 中针对双 GPU 设置的层并行与张量并行:层模式在预填充(RAG 管道)中快 25%,而张量模式在解码(交互式聊天)中快 16%。
llama.cpp b9095 发布!支持双 Blackwell PCIe 显卡无需 NCCL 的张量并行
llama.cpp b9095 版本引入了针对双 Blackwell PCIe GPU 的免 NCCL 张量并行功能,使得在不依赖 NCCL 的情况下也能实现高效的多 GPU 推理。
vulkan: 针对AMD RDNA3和RDNA4的int8 coopmat1矩阵乘法实现 (… · ggml-org/llama.cpp@70c4e15)
此更新为llama.cpp引入了基于Vulkan的int8协作矩阵乘法实现,针对AMD RDNA3和RDNA4 GPU,提升这些硬件平台上的推理性能。
比较 llama.cpp 行/张量分割与 ik_llama 图分割的双GPU推理速度
一位用户使用llama.cpp(行/张量切分)和ik_llama(图切分)在两张RTX 3080 20GB上对双GPU推理速度进行了基准测试,使用Qwen3.6-27B GGUF模型,比较了token生成和提示处理速度。