6块 MI50 直连 PCIE 与 4块 MI50 通过 PEX8749 交换机加 2块直连 PCIE 的对比

Reddit r/LocalLLaMA 新闻

摘要

一位用户在较老的 X99 主板上对 AMD MI50 GPU 在不同 PCIe 配置下进行基准测试,比较了直接 PCIe 连接与使用 PEX8749 交换机的情况。结果显示性能差异极小,令牌生成速度略有提升。

我真的很兴奋分享这个。在 X99-E-WS 主板上……虽然老旧且只支持 PCIE 3.0,但我认为对于我试图做的事情(3台机器共享1TB显存)来说,它仍然相当有能力。该主板有七个物理 PCIe x16 插槽,通过板载 PEX8747 PCIe 3.0 交换机共享,配合 40 通道的 CPU 并插满所有七个插槽时,主板支持 x16/x8/x8/x8/x8/x8/x8 配置。我测试的是在 x16 插槽上插入一张 PEX8749 卡,让 4 块 MI50 通过该交换机运行,从而释放出 3 个 PCIE 插槽用于额外的显卡。网上关于使用 PEX8749 卡的数据很少,Claude/ChatGPT 给我的答案关于这是否会提高或降低 tg/pp 速度也相互矛盾,所以我决定直接测试前后对比。 硬件:Asus X99-E-WS(修改 BIOS 以支持大量 GPU)Intel(R) Xeon(R) CPU E5-2680 v4 @ 2.40GHz 128GB DDR4 RAM SSD Model: dervig/m51Lab-MiniMax-M2.7-REAP-139B-A10B @ Q3_L 以下是结果: 测试 6× MI50 全部直连 4× PLX + 2× 直连 差异 变化 pp512 139.27 138.24 −1.03 −0.74% tg128 24.87 25.55 +0.68 +2.73% pp512+tg128 71.12 72.47 +1.35 +1.90% pp4096+tg128 120.95 120.96 +0.01 +0.01% pp16384+tg128 117.69 117.27 −0.42 −0.36% pp32768+tg128 103.56 103.64 +0.08 +0.08% pp65536+tg128 81.99 82.67 +0.68 +0.83% 我多次运行 llama bench,令人惊讶的是 tg 总是稍好一点,提升 0.8% 到 2.8%,而 pp 速度损失小于 1%。
查看原文

相似文章

我实测了 CMP170HX

Reddit r/LocalLLaMA

对英伟达 CMP170HX 矿卡改作 64GB 显存 AI 推理加速器的实测基准测试,表明它们能以可用速度运行大型本地 LLM(如 DeepSeek V4-Flash 和 gpt-oss-120B),但存在 Ampere 级吞吐量和 PCIe Gen2 x4 连接方面的注意事项。