6块MI50(96GB)对比6块P40(144GB),运行MiniMax M2.7 REAP 139B Q3_K_L

Reddit r/LocalLLaMA 新闻

摘要

用户分享了在运行MiniMax M2.7 REAP 139B Q3_K_L模型时,6块AMD MI50(96GB)与6块NVIDIA P40(144GB)的基准测试对比结果,显示P40在提示处理(prompt processing)方面更快,而MI50在令牌生成(token generation)方面更快。

大家好,如之前承诺,以下是使用6张 MI50 在 llama-bench 上运行 MiniMax M2.7 REAP 139B Q3_K_L 的结果。 内存负载:https://preview.redd.it/7tp1nhrl79ch1.png?width=1628&format=png&auto=webp&s=ada4c100e1b589ab530e5b3e7b64153533a8a3de 硬件配置: - 主板:华硕 X99-E-WS(刷修改版 BIOS 以支持大量显卡) - CPU:Intel(R) Xeon(R) E5-2680 v4 @ 2.40GHz - 内存:128GB DDR4 RAM - 硬盘:SSD - 显卡:6x MI50,共 96GB 显存(PCIe Gen3 x8,x8,x8,x8,x8,x8) ### 测试结果 | GPU 配置 | 模型 | 测试项 | 结果 | | --- | --- | --- | --- | | 6x MI50 / Pro VII 16GB | MiniMax M2.7 REAP 139B Q3_K_L | pp512 | 139.27 t/s | | 6x MI50 / Pro VII 16GB | MiniMax M2.7 REAP 139B Q3_K_L | tg128 | 24.87 t/s | | 6x MI50 / Pro VII 16GB | MiniMax M2.7 REAP 139B Q3_K_L | pp512+tg128 | 71.12 t/s | | 6x MI50 / Pro VII 16GB | MiniMax M2.7 REAP 139B Q3_K_L | pp4096+tg128 | 120.95 t/s | | 6x MI50 / Pro VII 16GB | MiniMax M2.7 REAP 139B Q3_K_L | pp16384+tg128 | 117.69 t/s | | 6x MI50 / Pro VII 16GB | MiniMax M2.7 REAP 139B Q3_K_L | pp32768+tg128 | 103.56 t/s | | 6x MI50 / Pro VII 16GB | MiniMax M2.7 REAP 139B Q3_K_L | pp65536+tg128 | 81.99 t/s | ### 我这边最佳的启动参数如下: ```bash HIP_VISIBLE_DEVICES=0,1,2,3,4,5 \ "$HOME/llama.cpp-hip/build-hip/bin/llama-server" \ -m "$HOME/.lmstudio/models/mradermacher/m51Lab-MiniMax-M2.7-REAP-139B-A10B-i1-GGUF/m51Lab-MiniMax-M2.7-REAP-139B-A10B.i1-Q3_K_L.gguf" \ --alias "minimax-m2.7-reap-139b-a10b-q3kl" \ -dev ROCm0,ROCm1,ROCm2,ROCm3,ROCm4,ROCm5 \ -ngl 999 \ --fit off \ --no-mmap \ --split-mode layer \ --tensor-split 1,1,1,1,1,1 \ --ctx-size 65536 \ --parallel 1 \ --cache-type-k f16 \ --cache-type-v f16 \ --batch-size 2048 \ --ubatch-size 256 \ --flash-attn on \ --jinja \ --temp 1.0 \ --top-p 0.95 \ --top-k 64 \ --min-p 0.0 \ --presence-penalty 0.0 \ --repeat-penalty 1.0 \ --host 0.0.0.0 \ --port 8080 ``` ### 6张 MI50 与 6张 P40 的对比 | 测试项 | 6x MI50 / Pro VII 16GB, ROCm | 6x Tesla P40 24GB, CUDA | 胜者 | 差异倍数 | | --- | --- | --- | --- | --- | | pp512 | 139.27 t/s | 330.66 t/s | P40 | P40 约快 2.37x | | tg128 | 24.87 t/s | 20.49 t/s | MI50 | MI50 约快 1.21x | | pp512+tg128 | 71.12 t/s | 80.20 t/s | P40 | P40 约快 1.13x | | pp4096+tg128 | 120.95 t/s | 292.09 t/s | P40 | P40 约快 2.41x | | pp16384+tg128 | 117.69 t/s | 374.48 t/s | P40 | P40 约快 3.18x | | pp32768+tg128 | 103.56 t/s | 323.50 t/s | P40 | P40 约快 3.12x | | pp65536+tg128 | 81.99 t/s | 233.93 t/s | P40 | P40 约快 2.85x | 有趣的是,你可以认为 MI50 相当于两块 P40 的规格: | 规格 | AMD MI50 / Radeon Pro VII 16GB | NVIDIA Tesla P40 24GB | | --- | --- | --- | | 架构 | AMD Vega 20 / GCN 5 | NVIDIA Pascal / GP102 | | 制程节点 | 7nm | 16nm | | 单卡显存 | 16GB HBM2 | 24GB GDDR5 | | 6卡总显存 | 96GB | 144GB | | 单卡显存带宽 | ~1,024 GB/s | ~346 GB/s | | 显存总线 | 4096-bit HBM2 | 384-bit GDDR5 | | PCIe 世代 | 支持 PCIe 4.0 x16 | PCIe 3.0 x16 | | FP32 算力 | ~13 TFLOPS | ~12 TFLOPS | | FP16 算力 | ~26 TFLOPS | 差 / 非真正 FP16 卡 | | FP64 算力 | ~6.5 TFLOPS | 低,约 0.37 TFLOPS | | 张量核心 | 无 | 无 | 令我惊讶的是,我的 P40 服务器居然能与 MI50 盒子持平,仅在解码环节落后。这说明这些卡还有大量未开发的潜力。
查看原文

相似文章

6x P40运行Minimax M2.7_Q3_XL

Reddit r/LocalLLaMA

一个详细的家庭实验室搭建方案,配备6块P40 GPU运行量化后的MiniMax M2.7模型,包含硬件规格、基准测试结果以及使用llama.cpp的最佳配置。