探寻4x 3090的甜点

Reddit r/LocalLLaMA 工具

摘要

一位用户分享了在运行Qwen3.6-27B与vLLM的4x RTX 3090平台上进行的功耗限制测试,发现220W是在最小化吞吐量损失下实现峰值效率的甜点。

https://preview.redd.it/8o43bjhe9d1h1.png?width=5346&format=png&auto=webp&s=1c87c2ee8b8ffff43495f543266056b0e26d3947 在另一篇文章中,有人询问了我4x 3090设置下的功耗情况,因此我分享一次完整测试的结果,以了解效率曲线。参考了这篇[博客文章](https://himeshp.blogspot.com/2025/03/vllm-performance-benchmarks-4x-rtx-3090.html)(非本人所写)。 配置: * GPU:4x RTX 3090(Dell OEM、EVGA XC3、2x ASUS Strix) * PCIe拓扑:Gen 3(分叉:x16 / x8 / x8 / x4) * 模型:Qwen3.6-27B(FP16) * 后端:vLLM v0.20.2(TP=4) |功耗限制 (W)|输出 (t/s)|提示处理 (t/s)|总吞吐量 (t/s)|效率 (t/joule)| |:-|:-|:-|:-|:-| |350/390(无限制)|29|239|269|0.77| |300|29|238|268|0.89| |275|29|236|265|0.96| |250|29|232|261|1.04| |**220**|**27**|**220**|**248**|**1.13**| |200|24|196|221|1.11| 要点: 1. 220W甜点:峰值效率(与博文结论一致) 2. 收益递减:将限制提高到250W以上时,收益递减 希望这对大家有帮助。欢迎提问。我对Qwen 3.6 27B作为日常使用非常满意,不过仍然想知道在这个平台上能否运行更好/更大的模型。据我所知,最好的选择是Q2量化的DSv4——不过不确定是否完全支持。 额外背景:这是一个开放式搭建,放在通用矿机框架上。我使用10个TL-C12C-S风扇进行散热(GPU两侧各5个,垂直放置)。我最近刚完成搭建,欢迎提出改进建议。 编辑:在表格中添加了提示处理列。
查看原文

相似文章

48GB VRAM + Qwen 3.6 27B 的最佳设置

Reddit r/LocalLLaMA

一位用户分享了在双GPU配置(RTX 4090 + RTX 3090)上使用llama.cpp运行Qwen3.6 27B (Q8_0)的优化设置,在250k上下文下实现了75-100 t/s和1500 pp。