标签
本文评估了双 AMD Radeon AI PRO R9700 GPU 的 AI 推理性能,并将其与 Intel Arc Pro B70 和 NVIDIA RTX 5090 进行比较,突出了成本效益和软件挑战。
使用双 RTX 3090 配置的用户发现,llama.cpp 的 `--split-mode tensor` 会在 CPU 上运行提示处理(约 400 t/s),而切换到 `--split-mode layer` 则可解锁 GPU 提示处理,速度超过 1600 t/s,且 token 生成速度仅略有下降。
探讨双RTX 5060 Ti GPU在运行Qwen 27B等大型LLM时利用率仅达50%左右的原因:内存带宽是瓶颈,逐层拆分导致空闲时间,这更像是接力赛而非并行计算。
讨论使用两张Radeon RX 9060 XT 16GB显卡组成CrossFire配置的潜在价值,可能权衡性能与成本。
对运行在双AMD Radeon 9700 GPU上的AI推理框架ROCm、Vulkan和vLLM进行比较,可能是在对大型语言模型的性能进行基准测试。
一位用户使用llama.cpp(行/张量切分)和ik_llama(图切分)在两张RTX 3080 20GB上对双GPU推理速度进行了基准测试,使用Qwen3.6-27B GGUF模型,比较了token生成和提示处理速度。
一位用户成功在Kubuntu 24.04上通过Docker中的Vulkan设置了一个双GPU llama-cpp服务器,使用AMD Radeon PRO和7800 XT,拥有48GB显存。
llama.cpp的一个分支修复了量化KV缓存中的--split-mode tensor问题,在双GPU配置上实现高达40%的速度提升,且无质量损失。