再加一张GPU就获得近乎线性的扩展?有点奇怪
摘要
一位用户报告称,在使用Qwen模型进行推理时,添加第二张RTX 3090后实现了近乎线性的性能扩展,在没有NVLink的情况下,解码TPS提升了约1.8倍。
单流基准测试 (club-3090) 模型: qwen3.6-27b-autoround-int4 **之前:** 1x3090 \*他们针对单张3090的默认脚本方案'\*s *(4位量化与4位KV缓存, mtp=2)* NARRATIVE decode\_TPS: 平均值 = **53** 标准差 = **0.6** CODE decode\_TPS: 平均值 = **62** 标准差= **1.4** **之后:** 2x3090 *他们针对双3090的默认脚本方案 (4位量化与8位KV缓存, mpt=3)* NARRATIVE decode\_TPS: 平均值= **94** 标准差= **1.3** CODE decode\_TPS: 平均值= **120** 标准差= **2.1** 这是在无NVLink的情况下运行的,主板为8x/8x,不知为何P2P已自动启用(无需驱动破解),张量并行度 = 2 我真的很惊讶,性能几乎实现了线性扩展。在Agent模式(VSCode)下编辑大型代码文件时,我仍然遇到奇怪的解析错误(但和之前不同),强制模型使用CLI编辑工具比VSCode的Agent模式可靠得多。我很可能会转而使用他们的8位权重模型方案。
相似文章
NVLink 何时值得使用?
在双 RTX 3090 上测试 NVLink 用于 AI 推理和训练,发现张量并行提示处理(30%)和 FSDP 训练(3 倍)有显著加速,但对令牌生成或分层推理影响极小。
在 2x3090 NVLINK 上对 Qwen 3.6 27B MTP 进行基准测试
对 Qwen 3.6 27B MTP 在 4 张 RTX 3090 GPU 上的基准分析表明,基于 NVLink 的张量并行相较于 PCIe 配置可实现显著的吞吐量提升(最高达 +53%)。
@superalesha: https://x.com/superalesha/status/2077437741915312221
作者分享了在四张RTX 3090本地设备上六个月的测量数据,结果表明对于适配较少显卡的模型,数据并行通常优于张量并行,吞吐量差异可达3.4倍。
NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B 在双RTX 3090上
关于在双RTX 3090上使用vLLM运行量化后的NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B模型的详细指南,支持完整的262K上下文,实现高推理速度且无需CPU卸载。
2 x 5070ti Qwen 27B 完整配置/统计
技术帖分享了在 2x RTX 5070 Ti GPU 上使用 vLLM cu129-nightly 运行 Qwen 27B 的性能数据,解码速度最高可达 94-87 tps,GPU KV 缓存达 170k。