再加一张GPU就获得近乎线性的扩展?有点奇怪
摘要
一位用户报告称,在使用Qwen模型进行推理时,添加第二张RTX 3090后实现了近乎线性的性能扩展,在没有NVLink的情况下,解码TPS提升了约1.8倍。
单流基准测试 (club-3090) 模型: qwen3.6-27b-autoround-int4 **之前:** 1x3090 \*他们针对单张3090的默认脚本方案'\*s *(4位量化与4位KV缓存, mtp=2)* NARRATIVE decode\_TPS: 平均值 = **53** 标准差 = **0.6** CODE decode\_TPS: 平均值 = **62** 标准差= **1.4** **之后:** 2x3090 *他们针对双3090的默认脚本方案 (4位量化与8位KV缓存, mpt=3)* NARRATIVE decode\_TPS: 平均值= **94** 标准差= **1.3** CODE decode\_TPS: 平均值= **120** 标准差= **2.1** 这是在无NVLink的情况下运行的,主板为8x/8x,不知为何P2P已自动启用(无需驱动破解),张量并行度 = 2 我真的很惊讶,性能几乎实现了线性扩展。在Agent模式(VSCode)下编辑大型代码文件时,我仍然遇到奇怪的解析错误(但和之前不同),强制模型使用CLI编辑工具比VSCode的Agent模式可靠得多。我很可能会转而使用他们的8位权重模型方案。
相似文章
NVLink 何时值得使用?
在双 RTX 3090 上测试 NVLink 用于 AI 推理和训练,发现张量并行提示处理(30%)和 FSDP 训练(3 倍)有显著加速,但对令牌生成或分层推理影响极小。
在 2x3090 NVLINK 上对 Qwen 3.6 27B MTP 进行基准测试
对 Qwen 3.6 27B MTP 在 4 张 RTX 3090 GPU 上的基准分析表明,基于 NVLink 的张量并行相较于 PCIe 配置可实现显著的吞吐量提升(最高达 +53%)。
我刚刚从MacBook M5 pro 48 GB换到了RTX3090
一位软件开发者分享了从MacBook换到RTX3090 Linux设置来运行AI模型的经历,使用Qwen 3.8 27B实现了显著更高的推理速度,并可能取代他的Claude订阅。
@superalesha: https://x.com/superalesha/status/2077437741915312221
作者分享了在四张RTX 3090本地设备上六个月的测量数据,结果表明对于适配较少显卡的模型,数据并行通常优于张量并行,吞吐量差异可达3.4倍。
双RTX 3090 + EPYC主机运行qwen3.8-flash-next,速度约38令牌/秒
用户描述了一个硬件配置,包括双RTX 3090显卡和AMD EPYC CPU,用于运行Qwen3-Flash-Next模型(使用llama.cpp),单流推理速度达到38令牌/秒。用户寻求建议,是否应该添加第三块GPU或升级CPU以提高性能,特别是对于运行多个并行代理。