@Snixtp: 针对单张 RTX 3090 的更多能效测试 长文速读:- 我在单张 RTX 3090 上测试了 8 个本地大语言模型(LLM),功率限制从 100W 到 45…
摘要
本文展示了 8 个本地大语言模型在 RTX 3090 上的基准测试结果,显示功率能效在约 225W 时达到峰值,而在满功率下收益递减。
针对单张 RTX 3090 的更多能效测试
长文速读:
- 我在单张 RTX 3090 上测试了 8 个本地大语言模型(LLM),功率限制范围从 100W 到 450W。
- 在整个测试集中,最佳能效始终出现在 225W 至 250W 区间。
- 在 225W 功率下,显卡平均输出速度为 90.4 tok/s,能效比为 0.4167 tok/s/W。
- 在 450W 功率下,速度提升至 107.1 tok/s,但能效比下降至 0.2731 tok/s/W。
- 因此,最大功耗仅带来了约 16.7 tok/s 的速度提升,却多消耗了约 184W 的电力。
相似文章
探寻4x 3090的甜点
一位用户分享了在运行Qwen3.6-27B与vLLM的4x RTX 3090平台上进行的功耗限制测试,发现220W是在最小化吞吐量损失下实现峰值效率的甜点。
为最大化StrixHalo性能而折腾(+NVLink双eGPU 3090改造)
用户详细介绍了对配备双RTX 3090 eGPU和NVLink的AMD Strix Halo系统进行改造和基准测试的过程,发现对密集模型的LLM推理速度有所提升,尤其是使用vLLM时,并讨论了能效权衡。
双3090配置:Qwen 3.6 27B 上从 400 pp tokens/s 提升到 1600 pp tokens/s... 但 tps 略降。
使用双 RTX 3090 配置的用户发现,llama.cpp 的 `--split-mode tensor` 会在 CPU 上运行提示处理(约 400 t/s),而切换到 `--split-mode layer` 则可解锁 GPU 提示处理,速度超过 1600 t/s,且 token 生成速度仅略有下降。
@ItsmeAjayKV:过去7天我在家庭实验室运行的本地LLM分析。MoE模型现在统治了我的3090。使用最多的模型:@thinkymachine…
一位用户分享了在家庭实验室运行本地LLM的7天统计数据,指出MoE模型主导了其RTX 3090,其中Inkling-small和Ling-3.0-flash表现出色,并计划开源其仪表盘。
[基准测试] 5090RTX:提示解析、Token 生成与功耗等级
一位用户使用 llama.cpp 对 Nvidia 5090 RTX GPU 进行 LLM 推理基准测试,测量了不同功耗水平下的提示处理和 token 生成情况,发现提示处理对功耗限制更为敏感,而 token 生成相对不敏感,并指出了与 4090 RTX 的差异。