6块 MI50 直连 PCIE 与 4块 MI50 通过 PEX8749 交换机加 2块直连 PCIE 的对比
摘要
一位用户在较老的 X99 主板上对 AMD MI50 GPU 在不同 PCIe 配置下进行基准测试,比较了直接 PCIe 连接与使用 PEX8749 交换机的情况。结果显示性能差异极小,令牌生成速度略有提升。
我真的很兴奋分享这个。在 X99-E-WS 主板上……虽然老旧且只支持 PCIE 3.0,但我认为对于我试图做的事情(3台机器共享1TB显存)来说,它仍然相当有能力。该主板有七个物理 PCIe x16 插槽,通过板载 PEX8747 PCIe 3.0 交换机共享,配合 40 通道的 CPU 并插满所有七个插槽时,主板支持 x16/x8/x8/x8/x8/x8/x8 配置。我测试的是在 x16 插槽上插入一张 PEX8749 卡,让 4 块 MI50 通过该交换机运行,从而释放出 3 个 PCIE 插槽用于额外的显卡。网上关于使用 PEX8749 卡的数据很少,Claude/ChatGPT 给我的答案关于这是否会提高或降低 tg/pp 速度也相互矛盾,所以我决定直接测试前后对比。
硬件:Asus X99-E-WS(修改 BIOS 以支持大量 GPU)Intel(R) Xeon(R) CPU E5-2680 v4 @ 2.40GHz 128GB DDR4 RAM SSD Model: dervig/m51Lab-MiniMax-M2.7-REAP-139B-A10B @ Q3_L
以下是结果:
测试 6× MI50 全部直连 4× PLX + 2× 直连 差异 变化
pp512 139.27 138.24 −1.03 −0.74%
tg128 24.87 25.55 +0.68 +2.73%
pp512+tg128 71.12 72.47 +1.35 +1.90%
pp4096+tg128 120.95 120.96 +0.01 +0.01%
pp16384+tg128 117.69 117.27 −0.42 −0.36%
pp32768+tg128 103.56 103.64 +0.08 +0.08%
pp65536+tg128 81.99 82.67 +0.68 +0.83%
我多次运行 llama bench,令人惊讶的是 tg 总是稍好一点,提升 0.8% 到 2.8%,而 pp 速度损失小于 1%。
相似文章
6块MI50(96GB)对比6块P40(144GB),运行MiniMax M2.7 REAP 139B Q3_K_L
用户分享了在运行MiniMax M2.7 REAP 139B Q3_K_L模型时,6块AMD MI50(96GB)与6块NVIDIA P40(144GB)的基准测试对比结果,显示P40在提示处理(prompt processing)方面更快,而MI50在令牌生成(token generation)方面更快。
在 550B Nemotron Ultra Q3_S 上使用 P40 与 MI50 以及 RPC
用户分享了使用 RPC 在两台机器上运行 550B Nemotron Ultra 模型的基准测试结果,在较旧的 AMD MI50 和 Nvidia P40 GPU 上实现了令人印象深刻的吞吐量。
MI50s 上的 Qwen 3.6 27B @52.8 tps TG @1569 tps PP(无 MTP,无量化)
在 AMD MI50 GPU 上使用自定义 vllm 分支运行 Qwen 3.6 27B 的基准测试结果,实现了 52.8 tokens/s TG 和 1569 tokens/s PP,无量化或 MTP,证明了在 2018 年硬件上用于代理任务的可行性。
8-16张MI50上Minimax M3模型,峰值吞吐量19 tps
报告在8-16张MI50 GPU上运行的Minimax M3模型达到每秒19个token的峰值吞吐量。
我实测了 CMP170HX
对英伟达 CMP170HX 矿卡改作 64GB 显存 AI 推理加速器的实测基准测试,表明它们能以可用速度运行大型本地 LLM(如 DeepSeek V4-Flash 和 gpt-oss-120B),但存在 Ampere 级吞吐量和 PCIe Gen2 x4 连接方面的注意事项。