DDR4/PCIe4 对比 DDR5/PCIe5 在 LLM 中的表现——我在预训练场景做了基准测试,大家怎么看?
摘要
作者在 Vast.ai 上对比 DDR4/PCIe4 与 DDR5/PCIe5 两套机器进行 LLM 预训练基准测试,发现 DDR5/PCIe5 快约 15-20%,但在当前内存价格下,同样的预算不如买第二块 GPU 换来约 50% 的额外吞吐,文章引发关于是否该提前升级 DDR5/PCIe5 的讨论。
大家好。我最近在一次预训练任务上做了对比 DDR4/PCIe4 和 DDR5/PCIe5 在 AI 工作站上表现的实验,想听听大家的看法。首先,作为我测试结果的总结(代码见:https://github.com/Any-Winter-4079/DDR4-PCIe-4-vs-DDR5-PCIe-5-for-CUDA-training ),我在 Vast.ai 上租了两台机器:一台是 H12SSL-i 主板、EPYC 7352 处理器、192 GB 内存,当然使用的是 PCIe4(26.3 GB/s);另一台是 WRX90E-SAGE SE 主板、9975WX 处理器、256 GB DDR5 内存以及 PCIe5(54.3 GB/s)。在 GPU 数量相同的情况下,DDR5/PCIe5 的预训练速度快约 15-20%(具体取决于是否计入验证和其他开销)。不过,按照当前的内存价格,256 GB DDR5 内存(6400 MT/s)的费用足够买一整块(额外的)RTX PRO 6000 WS/Max-Q,此时对比结果明显倾向于 DDR4/PCIe4(配 2 块 GPU)——在成本相近的情况下,比单 GPU 多出约 50% 的吞吐量。
在我心目中,选择 DDR4/PCIe4 并没有太多缺点,但确实存在一些隐患:至少其中一部分 DDR4/PCIe4 主板已经比较老旧,一旦需要更换并不容易买到(例如我使用的 H12SSL-i,现在只能找到翻新机出售,谁知道几年后还能不能买到零售版);新的 GPU(即 NVIDIA 的新代产品)可能会与旧主板不兼容(也就是说,虽然 PCIe 向后兼容,但主板的 BIOS/UEFI 在 POST 阶段有时会与新 GPU 出现问题,例如一些较老的 PCIe3 主板已经在识别 Blackwell 显卡时出现困难,未来 PCIe4 主板面对更新的显卡可能也会出现类似情况)。这意味着,如果将来想买一块更新的 GPU,整个工作站可能都无法满足需求。
如果不得不硬着头皮承受内存价格,那么关键问题就是:什么时候入手?在我看来,现在的价格**糟糕透顶**,但当初 RTX PRO 6000 的价格也一样糟糕,而现在的情况是(价格又涨得更高了)。如果是预训练,我依然会选择 DDR4/PCIe4;但我猜测在推理场景下,DDR5/PCIe5 带来的提升可能远不止预训练时的 15-20%。另外,我们可能很快会采用一些新技术,比如在运行时将专家/数据动态加载进模型中,这同样会更受益于更快的 DDR/PCIe 速度。
考虑到这些,我很好奇是否有人做过相关基准测试,以及大家对此的看法。目前你们会选择继续观望 DDR5 而选 PCIe4,还是早早投入 DDR5?
内存方面还有另一个问题,就是内存通道数和每通道的 DIMM 数量,因为如果你想走“省钱”路线,比如只买 192 或 256 GB 的 DDR5、8 通道、每通道 1 根 DIMM(例如用 8x32 组成 256 GB),之后等预算充足再升级到 512 GB,那就意味着你必须把内存全部换掉(因为所有插槽都被占满了,需要换成新的 8x64 才能组成 512 GB)。而如果你只用更少的 DIMM,比如 4x64 组成 256 GB(留出 4 个插槽空着),那么你只能获得一半的带宽,因为只填充了 4 个通道。也许每通道支持双 DIMM 的机器才是这个问题的答案(既能填满 8x32 获得完整带宽,之后又能扩展一组 8x32 达到 512 GB),但总的来说这也是个棘手的问题。
所以,你们是怎么做的/目前在用什么配置?最近有没有人为了预训练、微调、强化学习、推理——无论你的使用场景是什么——购买了新工作站或升级设备,也遇到了这个两难选择?你们是选择看起来比较合理的 DDR4/PCIe4,还是投入 DDR5/PCIe5,如果是后者,原因是什么?我对所有使用场景和观点都很感兴趣!
相似文章
我比较了这里使用的主要GPU/机器的所有规格,因为带宽不是一切。你们有些人需要认清现实。
作者比较了用于LLM推理的各种GPU,批判了常见的基准测试,并强调了预填充性能比生成速度更重要,针对不同预算和使用场景给出了建议。
对于双GPU,在PCIe 5.0 x8/x4与x8/x8模式下运行时,推理速度会有很大影响吗?
一位用户询问在PCIe 5.0 x8/x4与x8/x8模式下运行双GPU是否会对LLM推理速度产生显著影响。
哪些硬件升级级别感觉更有意义?
作者就如何配置内存升级以最大化推理设备上的AI模型多样性征求建议,重点强调容量而非速度。
比较 llama.cpp 行/张量分割与 ik_llama 图分割的双GPU推理速度
一位用户使用llama.cpp(行/张量切分)和ik_llama(图切分)在两张RTX 3080 20GB上对双GPU推理速度进行了基准测试,使用Qwen3.6-27B GGUF模型,比较了token生成和提示处理速度。
更多GPU还是更小缓存?张量并行与KV压缩在内存受限LLM服务中的比较
本文比较了张量并行和KV缓存压缩技术在内存受限LLM服务中的应用,发现压缩通常更经济,并讨论了基于模型大小与设备内存相对关系的决策规则。