6块MI50(96GB)对比6块P40(144GB),运行MiniMax M2.7 REAP 139B Q3_K_L
摘要
用户分享了在运行MiniMax M2.7 REAP 139B Q3_K_L模型时,6块AMD MI50(96GB)与6块NVIDIA P40(144GB)的基准测试对比结果,显示P40在提示处理(prompt processing)方面更快,而MI50在令牌生成(token generation)方面更快。
大家好,如之前承诺,以下是使用6张 MI50 在 llama-bench 上运行 MiniMax M2.7 REAP 139B Q3_K_L 的结果。
内存负载:https://preview.redd.it/7tp1nhrl79ch1.png?width=1628&format=png&auto=webp&s=ada4c100e1b589ab530e5b3e7b64153533a8a3de
硬件配置:
- 主板:华硕 X99-E-WS(刷修改版 BIOS 以支持大量显卡)
- CPU:Intel(R) Xeon(R) E5-2680 v4 @ 2.40GHz
- 内存:128GB DDR4 RAM
- 硬盘:SSD
- 显卡:6x MI50,共 96GB 显存(PCIe Gen3 x8,x8,x8,x8,x8,x8)
### 测试结果
| GPU 配置 | 模型 | 测试项 | 结果 |
| --- | --- | --- | --- |
| 6x MI50 / Pro VII 16GB | MiniMax M2.7 REAP 139B Q3_K_L | pp512 | 139.27 t/s |
| 6x MI50 / Pro VII 16GB | MiniMax M2.7 REAP 139B Q3_K_L | tg128 | 24.87 t/s |
| 6x MI50 / Pro VII 16GB | MiniMax M2.7 REAP 139B Q3_K_L | pp512+tg128 | 71.12 t/s |
| 6x MI50 / Pro VII 16GB | MiniMax M2.7 REAP 139B Q3_K_L | pp4096+tg128 | 120.95 t/s |
| 6x MI50 / Pro VII 16GB | MiniMax M2.7 REAP 139B Q3_K_L | pp16384+tg128 | 117.69 t/s |
| 6x MI50 / Pro VII 16GB | MiniMax M2.7 REAP 139B Q3_K_L | pp32768+tg128 | 103.56 t/s |
| 6x MI50 / Pro VII 16GB | MiniMax M2.7 REAP 139B Q3_K_L | pp65536+tg128 | 81.99 t/s |
### 我这边最佳的启动参数如下:
```bash
HIP_VISIBLE_DEVICES=0,1,2,3,4,5 \
"$HOME/llama.cpp-hip/build-hip/bin/llama-server" \
-m "$HOME/.lmstudio/models/mradermacher/m51Lab-MiniMax-M2.7-REAP-139B-A10B-i1-GGUF/m51Lab-MiniMax-M2.7-REAP-139B-A10B.i1-Q3_K_L.gguf" \
--alias "minimax-m2.7-reap-139b-a10b-q3kl" \
-dev ROCm0,ROCm1,ROCm2,ROCm3,ROCm4,ROCm5 \
-ngl 999 \
--fit off \
--no-mmap \
--split-mode layer \
--tensor-split 1,1,1,1,1,1 \
--ctx-size 65536 \
--parallel 1 \
--cache-type-k f16 \
--cache-type-v f16 \
--batch-size 2048 \
--ubatch-size 256 \
--flash-attn on \
--jinja \
--temp 1.0 \
--top-p 0.95 \
--top-k 64 \
--min-p 0.0 \
--presence-penalty 0.0 \
--repeat-penalty 1.0 \
--host 0.0.0.0 \
--port 8080
```
### 6张 MI50 与 6张 P40 的对比
| 测试项 | 6x MI50 / Pro VII 16GB, ROCm | 6x Tesla P40 24GB, CUDA | 胜者 | 差异倍数 |
| --- | --- | --- | --- | --- |
| pp512 | 139.27 t/s | 330.66 t/s | P40 | P40 约快 2.37x |
| tg128 | 24.87 t/s | 20.49 t/s | MI50 | MI50 约快 1.21x |
| pp512+tg128 | 71.12 t/s | 80.20 t/s | P40 | P40 约快 1.13x |
| pp4096+tg128 | 120.95 t/s | 292.09 t/s | P40 | P40 约快 2.41x |
| pp16384+tg128 | 117.69 t/s | 374.48 t/s | P40 | P40 约快 3.18x |
| pp32768+tg128 | 103.56 t/s | 323.50 t/s | P40 | P40 约快 3.12x |
| pp65536+tg128 | 81.99 t/s | 233.93 t/s | P40 | P40 约快 2.85x |
有趣的是,你可以认为 MI50 相当于两块 P40 的规格:
| 规格 | AMD MI50 / Radeon Pro VII 16GB | NVIDIA Tesla P40 24GB |
| --- | --- | --- |
| 架构 | AMD Vega 20 / GCN 5 | NVIDIA Pascal / GP102 |
| 制程节点 | 7nm | 16nm |
| 单卡显存 | 16GB HBM2 | 24GB GDDR5 |
| 6卡总显存 | 96GB | 144GB |
| 单卡显存带宽 | ~1,024 GB/s | ~346 GB/s |
| 显存总线 | 4096-bit HBM2 | 384-bit GDDR5 |
| PCIe 世代 | 支持 PCIe 4.0 x16 | PCIe 3.0 x16 |
| FP32 算力 | ~13 TFLOPS | ~12 TFLOPS |
| FP16 算力 | ~26 TFLOPS | 差 / 非真正 FP16 卡 |
| FP64 算力 | ~6.5 TFLOPS | 低,约 0.37 TFLOPS |
| 张量核心 | 无 | 无 |
令我惊讶的是,我的 P40 服务器居然能与 MI50 盒子持平,仅在解码环节落后。这说明这些卡还有大量未开发的潜力。
相似文章
在 550B Nemotron Ultra Q3_S 上使用 P40 与 MI50 以及 RPC
用户分享了使用 RPC 在两台机器上运行 550B Nemotron Ultra 模型的基准测试结果,在较旧的 AMD MI50 和 Nvidia P40 GPU 上实现了令人印象深刻的吞吐量。
6x P40运行Minimax M2.7_Q3_XL
一个详细的家庭实验室搭建方案,配备6块P40 GPU运行量化后的MiniMax M2.7模型,包含硬件规格、基准测试结果以及使用llama.cpp的最佳配置。
6块 MI50 直连 PCIE 与 4块 MI50 通过 PEX8749 交换机加 2块直连 PCIE 的对比
一位用户在较老的 X99 主板上对 AMD MI50 GPU 在不同 PCIe 配置下进行基准测试,比较了直接 PCIe 连接与使用 PEX8749 交换机的情况。结果显示性能差异极小,令牌生成速度略有提升。
MI50s 上的 Qwen 3.6 27B @52.8 tps TG @1569 tps PP(无 MTP,无量化)
在 AMD MI50 GPU 上使用自定义 vllm 分支运行 Qwen 3.6 27B 的基准测试结果,实现了 52.8 tokens/s TG 和 1569 tokens/s PP,无量化或 MTP,证明了在 2018 年硬件上用于代理任务的可行性。
8-16张MI50上Minimax M3模型,峰值吞吐量19 tps
报告在8-16张MI50 GPU上运行的Minimax M3模型达到每秒19个token的峰值吞吐量。