有闲置的老旧低显存GPU吗?或许可以用来运行 Just Vision mmproj llama.cpp

Reddit r/LocalLLaMA 工具

摘要

文章建议利用旧GPU卸载llama.cpp中的mmproj组件,以提升多模态处理速度,同时不影响推理性能,作为缓慢的--no-mmproj-offload选项的替代方案。

对许多人来说,显存非常宝贵。我看到很多人推荐使用--no-mmproj-offload来节省显存,但速度极慢,尤其是在进行AI代理编码时。如果可能,添加第二个GPU仅用于mmproj,使用--mmdev CUDA1(你的GPU)。这将比--no-mmproj-offload快一个数量级,且不影响推理速度。--mmdev
查看原文

相似文章

llama.cpp - 如何在GPU上释放更多空间

Reddit r/LocalLLaMA

一则讨论如何在llama.cpp中释放GPU内存实用技巧的帖子,例如将mmproj卸载到CPU、调整KV缓存类型,同时讨论了--cache-type-k/v和--spec-draft-n-max等参数。

专家优先的llama.cpp

Reddit r/LocalLLaMA

一位开发者创建了llama.cpp的实验性分支,该分支仅将已使用的专家(expert)而非完整层卸载到显存,从而在RTX 2060 12GB等显存有限的GPU上为MoE模型带来了速度提升。作者正在寻找测试者,以验证其在其他Nvidia GPU上的性能表现。