真不敢相信我成功了!双GPU - 48GB显存 llama-cpp服务器 - R7900 + 7800XT
摘要
一位用户成功在Kubuntu 24.04上通过Docker中的Vulkan设置了一个双GPU llama-cpp服务器,使用AMD Radeon PRO和7800 XT,拥有48GB显存。
配置:Kubuntu 24.04 - AMD显卡 - R9700 AI PRO 和 7800XT(32GB + 16GB)- llama-cpp服务器 - 在Docker中堆叠设置 - Vulkan镜像。我试过ROCM,但它与RDNA4 + RDNA3混合不兼容。Vulkan似乎可行。我快速测试了一个提示,希望它稳定,因为如果稳定,我就有48GB显存可以玩了。不得不买一个新电源,但花了300美元就能利用我旧的7800XT,我觉得非常值得。
相似文章
@leopardracer: https://x.com/leopardracer/status/2055341758523883631
一位用户分享了他们搭建双GPU本地AI实验室的经验,使用了RTX 4080 Super和5060 Ti,通过llama.cpp和llama-swap运行Qwen 3.6模型,以降低API成本并实现无限制的实验。
@analogalok: 买不起2000美元的GPU这个借口已经彻底失效了。昨天我展示了如何解锁一块企业级16GB……
关于如何使用Kaggle免费的双Tesla T4 GPU(32GB显存)来运行大语言模型并支持超大上下文窗口的指南,涵盖llama.cpp中的多GPU并行策略。
@0xSero: 欢呼吧,各位6000系列爱好者。我们家里有GLM了
一套现成的Docker配置,用于在4块RTX PRO 6000 Blackwell GPU上通过vLLM部署GLM-5.2-NVFP4-REAP-469B模型,包含详细说明和配置选项。
48GB VRAM + Qwen 3.6 27B 的最佳设置
一位用户分享了在双GPU配置(RTX 4090 + RTX 3090)上使用llama.cpp运行Qwen3.6 27B (Q8_0)的优化设置,在250k上下文下实现了75-100 t/s和1500 pp。
双Radeon R9700——在llama.cpp上运行Qwen 3.6 27B Q8 MTP
关于在使用ROCm的llama.cpp上,于双AMD Radeon R9700配置下运行Qwen 3.6 27B Q8模型的技术报告,包括性能基准测试和配置详情。