探寻4x 3090的甜点
摘要
一位用户分享了在运行Qwen3.6-27B与vLLM的4x RTX 3090平台上进行的功耗限制测试,发现220W是在最小化吞吐量损失下实现峰值效率的甜点。
https://preview.redd.it/8o43bjhe9d1h1.png?width=5346&format=png&auto=webp&s=1c87c2ee8b8ffff43495f543266056b0e26d3947 在另一篇文章中,有人询问了我4x 3090设置下的功耗情况,因此我分享一次完整测试的结果,以了解效率曲线。参考了这篇[博客文章](https://himeshp.blogspot.com/2025/03/vllm-performance-benchmarks-4x-rtx-3090.html)(非本人所写)。
配置:
* GPU:4x RTX 3090(Dell OEM、EVGA XC3、2x ASUS Strix)
* PCIe拓扑:Gen 3(分叉:x16 / x8 / x8 / x4)
* 模型:Qwen3.6-27B(FP16)
* 后端:vLLM v0.20.2(TP=4)
|功耗限制 (W)|输出 (t/s)|提示处理 (t/s)|总吞吐量 (t/s)|效率 (t/joule)|
|:-|:-|:-|:-|:-|
|350/390(无限制)|29|239|269|0.77|
|300|29|238|268|0.89|
|275|29|236|265|0.96|
|250|29|232|261|1.04|
|**220**|**27**|**220**|**248**|**1.13**|
|200|24|196|221|1.11|
要点:
1. 220W甜点:峰值效率(与博文结论一致)
2. 收益递减:将限制提高到250W以上时,收益递减
希望这对大家有帮助。欢迎提问。我对Qwen 3.6 27B作为日常使用非常满意,不过仍然想知道在这个平台上能否运行更好/更大的模型。据我所知,最好的选择是Q2量化的DSv4——不过不确定是否完全支持。
额外背景:这是一个开放式搭建,放在通用矿机框架上。我使用10个TL-C12C-S风扇进行散热(GPU两侧各5个,垂直放置)。我最近刚完成搭建,欢迎提出改进建议。
编辑:在表格中添加了提示处理列。
相似文章
@Snixtp: 针对单张 RTX 3090 的更多能效测试 长文速读:- 我在单张 RTX 3090 上测试了 8 个本地大语言模型(LLM),功率限制从 100W 到 45…
本文展示了 8 个本地大语言模型在 RTX 3090 上的基准测试结果,显示功率能效在约 225W 时达到峰值,而在满功率下收益递减。
双3090配置:Qwen 3.6 27B 上从 400 pp tokens/s 提升到 1600 pp tokens/s... 但 tps 略降。
使用双 RTX 3090 配置的用户发现,llama.cpp 的 `--split-mode tensor` 会在 CPU 上运行提示处理(约 400 t/s),而切换到 `--split-mode layer` 则可解锁 GPU 提示处理,速度超过 1600 t/s,且 token 生成速度仅略有下降。
Qwen3.6-35B-A3B APEX 在单张 RTX 3090 上——充分发挥其潜力
在 RTX 3090 上运行 Qwen3.6-35B-A3B APEX 模型的详细指南:比较两个 llama.cpp 分支及量化方法,以达到最佳速度与质量。
48GB VRAM + Qwen 3.6 27B 的最佳设置
一位用户分享了在双GPU配置(RTX 4090 + RTX 3090)上使用llama.cpp运行Qwen3.6 27B (Q8_0)的优化设置,在250k上下文下实现了75-100 t/s和1500 pp。
在 2x3090 NVLINK 上对 Qwen 3.6 27B MTP 进行基准测试
对 Qwen 3.6 27B MTP 在 4 张 RTX 3090 GPU 上的基准分析表明,基于 NVLink 的张量并行相较于 PCIe 配置可实现显著的吞吐量提升(最高达 +53%)。