llama.cpp b9095 发布!支持双 Blackwell PCIe 显卡无需 NCCL 的张量并行

Reddit r/LocalLLaMA 工具

摘要

llama.cpp b9095 版本引入了针对双 Blackwell PCIe GPU 的免 NCCL 张量并行功能,使得在不依赖 NCCL 的情况下也能实现高效的多 GPU 推理。

b9095 终于让 -sm tensor 功能在双消费级 Blackwell PCIe GPU 上无需 NCCL 即可正常工作。如果你使用的是双 Blackwell GPU,这可能会带来显著的提升。我会在第一时间分享基于 2 张 RTX 5060 Ti 的测试结果。
查看原文

相似文章

Blackwell 与 PDL 性能提升

Reddit r/LocalLLaMA

Llama.cpp 现已支持适用于 Blackwell GPU 的 Nvidia 程序化依赖启动 (PDL),在 Token 生成时可带来 5-10% 的性能提升。该功能默认未启用,需通过编译标志开启。

双GPU llama.cpp加速

Reddit r/LocalLLaMA

llama.cpp的一个分支修复了量化KV缓存中的--split-mode tensor问题,在双GPU配置上实现高达40%的速度提升,且无质量损失。