Linux - 为什么 llama.cpp ROCm 的 KV 缓存消耗比 Vulkan 多那么多显存?

Reddit r/LocalLLaMA 工具

摘要

一位用户报告称,在使用相同模型和设置的情况下,llama.cpp 的 ROCm 后端比 Vulkan 后端消耗的 KV 缓存显存显著更多,这引发了对其潜在原因的探究。

我有一个包含多个 AI 服务的 Docker 栈,其中 llama.cpp 服务器是核心。我有一套可用的 Vulkan yml 配置用于 llama.cpp,但出于好奇,我将其切换为 ROCm(最新版本),却没有看到任何性能提升。事实上,我注意到,对于相同的模型、相同的上下文设置以及相同的 KV 缓存量化(Q8_0),ROCm 版本消耗了 29.1GB 显存,而 Vulkan 版本只消耗了 25.3GB。我是不是漏掉了什么?这种现象是我这块 GPU 独有的,还是我设置、硬件或软件中的其他变量导致的?
查看原文

相似文章

也许将KV缓存卸载到RAM并不差

Reddit r/LocalLLaMA

一位用户分享了在llama.cpp中将KV缓存卸载到RAM的经验,在释放显存以便运行更大模型和上下文窗口的同时,实现了相近的速度,表明这种权衡通常是值得的。