对于双GPU,在PCIe 5.0 x8/x4与x8/x8模式下运行时,推理速度会有很大影响吗?
摘要
一位用户询问在PCIe 5.0 x8/x4与x8/x8模式下运行双GPU是否会对LLM推理速度产生显著影响。
我购买了Biostar Z890 Valkyrie主板,因为它在打折,并且有三个连接到CPU的PCIe 5.0插槽(x16、x8/x8或x8/x4/x4),我认为这对于运行双GPU进行LLM推理非常棒。问题是现在我想在底部PCIe插槽中添加一个SATA扩展卡,但这会将中间插槽降速到x4。如果我以x8/x4模式运行两个GPU,当模型完全加载到VRAM中以及需要部分卸载时,推理性能是否会受到影响?
相似文章
比较 llama.cpp 行/张量分割与 ik_llama 图分割的双GPU推理速度
一位用户使用llama.cpp(行/张量切分)和ik_llama(图切分)在两张RTX 3080 20GB上对双GPU推理速度进行了基准测试,使用Qwen3.6-27B GGUF模型,比较了token生成和提示处理速度。
双GPU下流水线与张量并行的llama.cpp中测量PCIe传输
在双GPU下使用流水线和张量并行运行llama.cpp时的PCIe传输性能分析。
我意外地用一条隐藏的PCIe 2.0 x4插槽削弱了4x RTX 3090 LLM设备的性能,修复后使Mistral 128B的性能翻倍。
用户发现,Threadripper 工作站主板上一处隐藏的 PCIe 2.0 x4 电气限制导致四块 RTX 3090 中的一块性能受限,从而影响了多 GPU 大语言模型推理性能。通过调整插槽布局并切换至张量分裂模式,Mistral 128B 的吞吐量从约 11 tok/s 翻倍至约 24.7 tok/s。
NVLink 何时值得使用?
在双 RTX 3090 上测试 NVLink 用于 AI 推理和训练,发现张量并行提示处理(30%)和 FSDP 训练(3 倍)有显著加速,但对令牌生成或分层推理影响极小。
我比较了这里使用的主要GPU/机器的所有规格,因为带宽不是一切。你们有些人需要认清现实。
作者比较了用于LLM推理的各种GPU,批判了常见的基准测试,并强调了预填充性能比生成速度更重要,针对不同预算和使用场景给出了建议。