双GPU下流水线与张量并行的llama.cpp中测量PCIe传输

Reddit r/LocalLLaMA 工具

摘要

在双GPU下使用流水线和张量并行运行llama.cpp时的PCIe传输性能分析。

暂无内容
查看原文

相似文章

双GPU llama.cpp加速

Reddit r/LocalLLaMA

llama.cpp的一个分支修复了量化KV缓存中的--split-mode tensor问题,在双GPU配置上实现高达40%的速度提升,且无质量损失。