在 550B Nemotron Ultra Q3_S 上使用 P40 与 MI50 以及 RPC
摘要
用户分享了使用 RPC 在两台机器上运行 550B Nemotron Ultra 模型的基准测试结果,在较旧的 AMD MI50 和 Nvidia P40 GPU 上实现了令人印象深刻的吞吐量。
大家好,我在我的 MI50 机器和 P40 机器上安装了 100Gbe 网卡,并加载了 Nemotron Ultra IQ3_S 模型到两台机器上。对于如此旧的硬件能达到这样的吞吐量,我感到非常惊讶。鉴于这些结果,我现在正考虑购买中国的 22GB RTX 2080 Ti 显卡,以增加构建中的 VRAM,并继续进行对比和实验。
MI50 硬件配置:
Asus X99-E-WS(修改 BIOS 以支持大量 GPU)
Intel(R) Xeon(R) CPU E5-2680 v4 @ 2.40GHz
128GB DDR4 RAM
SSD
7x MI50 112GB VRAM
2x MI50 64GB VRAM(总计 176GB VRAM)
P40 硬件配置:
Asus X99-E-WS(修改 BIOS 以支持大量 GPU)
Intel(R) Xeon(R) CPU E5-2680 v4 @ 2.40GHz
128GB DDR4 RAM(混合批次非 ECC 内存条)
SSD
5x P40 120GB VRAM
内存负载:
MI50 机箱 P40 机箱
基准测试结果:
Context pp512 tg128 pp512+tg128 pp4096+tg128
0 54.42 6.19 21.33 52.28
8,192 53.20 6.08 20.82 50.16
32,768 47.22 5.95 19.86 45.24
65,536 41.50 5.89 18.81 40.04
126,720 34.09 5.59 16.61 33.04
启动命令:
HIP_VISIBLE_DEVICES=1,0,2,3,4,5,6,7,8 \
/usr/local/bin/llama-server \
--rpc 10.10.10.2:50052 \
-m "$HOME/.lmstudio/models/unsloth/NVIDIA-Nemotron-3-Ultra-550B-A55B-GGUF/NVIDIA-Nemotron-3-Ultra-550B-A55B-UD-IQ3_S-00001-of-00007.gguf" \
-dev RPC0,RPC1,RPC2,RPC3,RPC4,ROCm0,ROCm1,ROCm2,ROCm3,ROCm4,ROCm5,ROCm6,ROCm7,ROCm8 \
-ts 1,1,1,1,1,1.3,0.65,0.65,1.3,0.65,0.65,0.65,0.65,0.65 \
-ngl 999 \
-fit off \
-sm layer \
-c 131072 \
-b 2048 \
-ub 1024 \
-fa on \
--no-mmap \
--direct-io \
-np 1 \
--host 0.0.0.0
相似文章
6块MI50(96GB)对比6块P40(144GB),运行MiniMax M2.7 REAP 139B Q3_K_L
用户分享了在运行MiniMax M2.7 REAP 139B Q3_K_L模型时,6块AMD MI50(96GB)与6块NVIDIA P40(144GB)的基准测试对比结果,显示P40在提示处理(prompt processing)方面更快,而MI50在令牌生成(token generation)方面更快。
MI50s 上的 Qwen 3.6 27B @52.8 tps TG @1569 tps PP(无 MTP,无量化)
在 AMD MI50 GPU 上使用自定义 vllm 分支运行 Qwen 3.6 27B 的基准测试结果,实现了 52.8 tokens/s TG 和 1569 tokens/s PP,无量化或 MTP,证明了在 2018 年硬件上用于代理任务的可行性。
6x P40运行Minimax M2.7_Q3_XL
一个详细的家庭实验室搭建方案,配备6块P40 GPU运行量化后的MiniMax M2.7模型,包含硬件规格、基准测试结果以及使用llama.cpp的最佳配置。
在4块RTX 5060 Ti上,使用P2P和PP=4,对新的unslooth/Qwen3.6-27B-NVFP4在并发数为1、4、8、12和16下的基准测试
unslooth/Qwen3.6-27B-NVFP4模型在4块RTX 5060 Ti GPU上,使用点对点(P2P)和流水线并行(PP)在不同并发级别下的基准测试结果。
Qwen3.6:35b UD Q4_K_M 在 Nvidia P40 上实现 80 tok/s
一位用户分享在单个 Nvidia P40 上使用 TheTom 的 TurboQuant 版 llama.cpp,以 Q4_K_M 量化方式和 100k 上下文运行 Qwen3.6 35B 模型,实现了 80 tok/s,并强调了多种优化。