在 550B Nemotron Ultra Q3_S 上使用 P40 与 MI50 以及 RPC

Reddit r/LocalLLaMA 新闻

摘要

用户分享了使用 RPC 在两台机器上运行 550B Nemotron Ultra 模型的基准测试结果,在较旧的 AMD MI50 和 Nvidia P40 GPU 上实现了令人印象深刻的吞吐量。

大家好,我在我的 MI50 机器和 P40 机器上安装了 100Gbe 网卡,并加载了 Nemotron Ultra IQ3_S 模型到两台机器上。对于如此旧的硬件能达到这样的吞吐量,我感到非常惊讶。鉴于这些结果,我现在正考虑购买中国的 22GB RTX 2080 Ti 显卡,以增加构建中的 VRAM,并继续进行对比和实验。 MI50 硬件配置: Asus X99-E-WS(修改 BIOS 以支持大量 GPU) Intel(R) Xeon(R) CPU E5-2680 v4 @ 2.40GHz 128GB DDR4 RAM SSD 7x MI50 112GB VRAM 2x MI50 64GB VRAM(总计 176GB VRAM) P40 硬件配置: Asus X99-E-WS(修改 BIOS 以支持大量 GPU) Intel(R) Xeon(R) CPU E5-2680 v4 @ 2.40GHz 128GB DDR4 RAM(混合批次非 ECC 内存条) SSD 5x P40 120GB VRAM 内存负载: MI50 机箱 P40 机箱 基准测试结果: Context pp512 tg128 pp512+tg128 pp4096+tg128 0 54.42 6.19 21.33 52.28 8,192 53.20 6.08 20.82 50.16 32,768 47.22 5.95 19.86 45.24 65,536 41.50 5.89 18.81 40.04 126,720 34.09 5.59 16.61 33.04 启动命令: HIP_VISIBLE_DEVICES=1,0,2,3,4,5,6,7,8 \ /usr/local/bin/llama-server \ --rpc 10.10.10.2:50052 \ -m "$HOME/.lmstudio/models/unsloth/NVIDIA-Nemotron-3-Ultra-550B-A55B-GGUF/NVIDIA-Nemotron-3-Ultra-550B-A55B-UD-IQ3_S-00001-of-00007.gguf" \ -dev RPC0,RPC1,RPC2,RPC3,RPC4,ROCm0,ROCm1,ROCm2,ROCm3,ROCm4,ROCm5,ROCm6,ROCm7,ROCm8 \ -ts 1,1,1,1,1,1.3,0.65,0.65,1.3,0.65,0.65,0.65,0.65,0.65 \ -ngl 999 \ -fit off \ -sm layer \ -c 131072 \ -b 2048 \ -ub 1024 \ -fa on \ --no-mmap \ --direct-io \ -np 1 \ --host 0.0.0.0
查看原文

相似文章

6x P40运行Minimax M2.7_Q3_XL

Reddit r/LocalLLaMA

一个详细的家庭实验室搭建方案,配备6块P40 GPU运行量化后的MiniMax M2.7模型,包含硬件规格、基准测试结果以及使用llama.cpp的最佳配置。

Qwen3.6:35b UD Q4_K_M 在 Nvidia P40 上实现 80 tok/s

Reddit r/LocalLLaMA

一位用户分享在单个 Nvidia P40 上使用 TheTom 的 TurboQuant 版 llama.cpp,以 Q4_K_M 量化方式和 100k 上下文运行 Qwen3.6 35B 模型,实现了 80 tok/s,并强调了多种优化。