再加一张GPU就获得近乎线性的扩展?有点奇怪

Reddit r/LocalLLaMA 新闻

摘要

一位用户报告称,在使用Qwen模型进行推理时,添加第二张RTX 3090后实现了近乎线性的性能扩展,在没有NVLink的情况下,解码TPS提升了约1.8倍。

单流基准测试 (club-3090) 模型: qwen3.6-27b-autoround-int4 **之前:** 1x3090 \*他们针对单张3090的默认脚本方案'\*s *(4位量化与4位KV缓存, mtp=2)* NARRATIVE decode\_TPS: 平均值 = **53** 标准差 = **0.6** CODE decode\_TPS: 平均值 = **62** 标准差= **1.4** **之后:** 2x3090 *他们针对双3090的默认脚本方案 (4位量化与8位KV缓存, mpt=3)* NARRATIVE decode\_TPS: 平均值= **94** 标准差= **1.3** CODE decode\_TPS: 平均值= **120** 标准差= **2.1** 这是在无NVLink的情况下运行的,主板为8x/8x,不知为何P2P已自动启用(无需驱动破解),张量并行度 = 2 我真的很惊讶,性能几乎实现了线性扩展。在Agent模式(VSCode)下编辑大型代码文件时,我仍然遇到奇怪的解析错误(但和之前不同),强制模型使用CLI编辑工具比VSCode的Agent模式可靠得多。我很可能会转而使用他们的8位权重模型方案。
查看原文

相似文章

NVLink 何时值得使用?

Hacker News Top

在双 RTX 3090 上测试 NVLink 用于 AI 推理和训练,发现张量并行提示处理(30%)和 FSDP 训练(3 倍)有显著加速,但对令牌生成或分层推理影响极小。

2 x 5070ti Qwen 27B 完整配置/统计

Reddit r/LocalLLaMA

技术帖分享了在 2x RTX 5070 Ti GPU 上使用 vLLM cu129-nightly 运行 Qwen 27B 的性能数据,解码速度最高可达 94-87 tps,GPU KV 缓存达 170k。