对于双GPU,在PCIe 5.0 x8/x4与x8/x8模式下运行时,推理速度会有很大影响吗?

Reddit r/LocalLLaMA 新闻

摘要

一位用户询问在PCIe 5.0 x8/x4与x8/x8模式下运行双GPU是否会对LLM推理速度产生显著影响。

我购买了Biostar Z890 Valkyrie主板,因为它在打折,并且有三个连接到CPU的PCIe 5.0插槽(x16、x8/x8或x8/x4/x4),我认为这对于运行双GPU进行LLM推理非常棒。问题是现在我想在底部PCIe插槽中添加一个SATA扩展卡,但这会将中间插槽降速到x4。如果我以x8/x4模式运行两个GPU,当模型完全加载到VRAM中以及需要部分卸载时,推理性能是否会受到影响?
查看原文

相似文章

NVLink 何时值得使用?

Hacker News Top

在双 RTX 3090 上测试 NVLink 用于 AI 推理和训练,发现张量并行提示处理(30%)和 FSDP 训练(3 倍)有显著加速,但对令牌生成或分层推理影响极小。