RTX 5090(600/475/400W)与 RTX 6000 PRO MaxQ(325W)以及 RTX 6000 PRO WS/SE(600W)完整算力(Anima)小对比
摘要
一位用户对 RTX 5090 和 RTX 6000 PRO 系列 GPU 进行 AI 扩散任务基准测试,比较不同功耗限制下的性能,展示了速度与功耗之间的权衡。
大家好,希望你们一切顺利!卖掉一些显卡后,我入手了一块 RTX 6000 PRO MaxQ,其功耗限制范围为 250W 到 325W。我手头还有一块 RTX 5090,功耗限制范围为 400W 到 600W。既然有这些硬件,而且我喜欢做扩散计算(txt2img、txt2video、img2img 等),就想对比一下。另外我还在 RunPod 上租了一块 RTX 6000 PRO WS 版,它的功耗限制范围是 150W 到 600W(没错,比 MaxQ 还低)。重要提示:我对 RTX 5090 和 RTX 6000 PRO MaxQ 进行了降压 + 超频。对于 RunPod 上租的 GPU,我无法修改频率或功耗。所以这次测试,我设置了如下软件环境:
* Torch 2.12.0.dev20260310+cu130(用于 5090 和 6000 PRO MaxQ)
* Torch 2.12.0+cu130 稳定版(用于 6000 PRO WS)
* Sageattention 2.1(基于 commit e9b072f0fc2682f104abbda306af3d42fc33b969),在 CUDA 13.1 上自编译
* Forge neo(基于 commit 91c2e0adbefd06bc3475da34fbdb21a4c5736faa)
* 安装了 RTX 超分扩展([https://github.com/Haoming02/sd-forge-nvidia-vfx](https://github.com/Haoming02/sd-forge-nvidia-vfx))和额外采样器扩展([https://github.com/Panchovix/sd\_forge\_neo\_extra\_samplers](https://github.com/Panchovix/sd_forge_neo_extra_samplers))
我使用了以下采样器和步数设置:
[采样器设置图片](https://preview.redd.it/ood1t2p6yj3h1.png?width=1854&format=png&auto=webp&s=c55b8e494a597ff715d857668f666d1c0fb9fb46)
文本描述:
* EXP Heun 2 x0 SDE 前 25 步
* ER SDE 10 步高分辨率传递
* 放大 1.5 倍
* 分辨率 896x1088
* 批量大小 4
* CFG 5
* Shift 3
* 降噪强度:0.2
* 放大算法:NVIDIA Ultra
* 种子:999999999
使用的提示词:
正面:masterpiece, high quality, score_7, '@' \(orange maru\), sfw, 1girl, solo, fully clothed, cynthia \(sygna suit\) \(aura\) \(pokemon\), pokemon masters ex, blonde hair, long hair, ponytail, hair over one eye, grey eyes, :|, full body, blurry background
负面:worst quality, low quality, bad anatomy, (jpeg artifacts:0.8), watermark, sketch, no pupils,
硬件方面,我使用无头模式运行(通过 LACT):
* RTX 5090:
* 最大核心频率 2930MHz
* 核心频率偏移 1000MHz
* VRAM 频率偏移 +4400MHz(总计 16000MHz)
* 功耗:400W、475W、600W
* RTX 6000 PRO MaxQ:
* 核心频率偏移 550
* 无最大核心频率限制
* VRAM 频率偏移 +5270MHz(总计 16000MHz)
* 功耗:325W
* RTX 6000 PRO WS:
* 默认设置
* 功耗:600W
根据以上数据,得到以下结果:
| GPU | 功耗 | 备注 | 时间 | 对比基线 |
|:-|:-|:-|:-|:-|
| RTX 5090 | 600W | 基线(OC + 降压) | 36s | - |
| RTX 6000 PRO SE/WS | 600W | 未调校 | 39s | -8.3% |
| RTX 5090 | 475W | 降压+超频 | 42s | -16.7% |
| RTX 6000 PRO MaxQ | 325W | 超频 | 48s | -33.3% |
| RTX 5090 | 400W | 降压+超频 | 48s | -33.3% |
或者以 5090 在 400W 作为基线:
| GPU | 功耗 | 备注 | 时间 | 比基线快 |
|:-|:-|:-|:-|:-|
| RTX 5090 | 400W | 基线(OC + 降压) | 48s | - |
| RTX 6000 PRO MaxQ | 325W | 超频 | 48s | 0% |
| RTX 5090 | 475W | 降压+超频 | 42s | +12.5% |
| RTX 6000 PRO WS/SE | 600W | 未调校 | 39s | +18.8% |
| RTX 5090 | 600W | 降压+超频 | 36s | +25.0% |
运行此任务时,显卡的核心频率大致如下:
* 5090 600W:~2500MHz
* 5090 475W:~2100MHz
* 6000 PRO WS/SE 600W:~2200MHz
* 5090 400W:~1800MHz
* 6000 PRO MaxQ:1400-1500MHz
如你所见,RTX 5090 比 6000 MaxQ 快 25%,但功耗高出 84%。与此同时,未调校的 6000 PRO WS/SE 快 18.8%,功耗也同样高出 84%。不过理论上,如果对 WS/SE 进行降压+超频,它会比 5090 更快。最后,6000 PRO MaxQ 在仅用 75% 功耗的情况下达到了与 5090 相同的性能,这对于功耗受限如此严重来说相当令人印象深刻。如果有人拥有调校后的 6000 PRO/WS 并且愿意做此测试,请告诉我!
相似文章
RTX Pro 4500 Blackwell 性能实测
一位用户分享了将 Nvidia RTX Pro 4500 Blackwell 32GB GPU 与 RTX 5060 Ti 16GB 进行 AI 推理性能对比的基准测试结果,显示根据模型大小和量化水平,速度提升了 1.6 到 6 倍。
[基准测试] 5090RTX:提示解析、Token 生成与功耗等级
一位用户使用 llama.cpp 对 Nvidia 5090 RTX GPU 进行 LLM 推理基准测试,测量了不同功耗水平下的提示处理和 token 生成情况,发现提示处理对功耗限制更为敏感,而 token 生成相对不敏感,并指出了与 4090 RTX 的差异。
运行8x RTX PRO 6000的实用指南
本文提供了运行8x NVIDIA RTX PRO 6000 Blackwell GPU处理AI工作负载的实用指南,重点介绍高并发推理、模型集群和70B微调,同时与更昂贵的数据中心解决方案进行性能比较。
1块RTX Pro 6000还是2台DGX Spark
针对AI计算任务,对单块RTX Pro 6000 GPU与两台DGX Spark系统进行比较。
@Snixtp: 针对单张 RTX 3090 的更多能效测试 长文速读:- 我在单张 RTX 3090 上测试了 8 个本地大语言模型(LLM),功率限制从 100W 到 45…
本文展示了 8 个本地大语言模型在 RTX 3090 上的基准测试结果,显示功率能效在约 225W 时达到峰值,而在满功率下收益递减。