RTX 5090(600/475/400W)与 RTX 6000 PRO MaxQ(325W)以及 RTX 6000 PRO WS/SE(600W)完整算力(Anima)小对比

Reddit r/LocalLLaMA 新闻

摘要

一位用户对 RTX 5090 和 RTX 6000 PRO 系列 GPU 进行 AI 扩散任务基准测试,比较不同功耗限制下的性能,展示了速度与功耗之间的权衡。

大家好,希望你们一切顺利!卖掉一些显卡后,我入手了一块 RTX 6000 PRO MaxQ,其功耗限制范围为 250W 到 325W。我手头还有一块 RTX 5090,功耗限制范围为 400W 到 600W。既然有这些硬件,而且我喜欢做扩散计算(txt2img、txt2video、img2img 等),就想对比一下。另外我还在 RunPod 上租了一块 RTX 6000 PRO WS 版,它的功耗限制范围是 150W 到 600W(没错,比 MaxQ 还低)。重要提示:我对 RTX 5090 和 RTX 6000 PRO MaxQ 进行了降压 + 超频。对于 RunPod 上租的 GPU,我无法修改频率或功耗。所以这次测试,我设置了如下软件环境: * Torch 2.12.0.dev20260310+cu130(用于 5090 和 6000 PRO MaxQ) * Torch 2.12.0+cu130 稳定版(用于 6000 PRO WS) * Sageattention 2.1(基于 commit e9b072f0fc2682f104abbda306af3d42fc33b969),在 CUDA 13.1 上自编译 * Forge neo(基于 commit 91c2e0adbefd06bc3475da34fbdb21a4c5736faa) * 安装了 RTX 超分扩展([https://github.com/Haoming02/sd-forge-nvidia-vfx](https://github.com/Haoming02/sd-forge-nvidia-vfx))和额外采样器扩展([https://github.com/Panchovix/sd\_forge\_neo\_extra\_samplers](https://github.com/Panchovix/sd_forge_neo_extra_samplers)) 我使用了以下采样器和步数设置: [采样器设置图片](https://preview.redd.it/ood1t2p6yj3h1.png?width=1854&format=png&auto=webp&s=c55b8e494a597ff715d857668f666d1c0fb9fb46) 文本描述: * EXP Heun 2 x0 SDE 前 25 步 * ER SDE 10 步高分辨率传递 * 放大 1.5 倍 * 分辨率 896x1088 * 批量大小 4 * CFG 5 * Shift 3 * 降噪强度:0.2 * 放大算法:NVIDIA Ultra * 种子:999999999 使用的提示词: 正面:masterpiece, high quality, score_7, '@' \(orange maru\), sfw, 1girl, solo, fully clothed, cynthia \(sygna suit\) \(aura\) \(pokemon\), pokemon masters ex, blonde hair, long hair, ponytail, hair over one eye, grey eyes, :|, full body, blurry background 负面:worst quality, low quality, bad anatomy, (jpeg artifacts:0.8), watermark, sketch, no pupils, 硬件方面,我使用无头模式运行(通过 LACT): * RTX 5090: * 最大核心频率 2930MHz * 核心频率偏移 1000MHz * VRAM 频率偏移 +4400MHz(总计 16000MHz) * 功耗:400W、475W、600W * RTX 6000 PRO MaxQ: * 核心频率偏移 550 * 无最大核心频率限制 * VRAM 频率偏移 +5270MHz(总计 16000MHz) * 功耗:325W * RTX 6000 PRO WS: * 默认设置 * 功耗:600W 根据以上数据,得到以下结果: | GPU | 功耗 | 备注 | 时间 | 对比基线 | |:-|:-|:-|:-|:-| | RTX 5090 | 600W | 基线(OC + 降压) | 36s | - | | RTX 6000 PRO SE/WS | 600W | 未调校 | 39s | -8.3% | | RTX 5090 | 475W | 降压+超频 | 42s | -16.7% | | RTX 6000 PRO MaxQ | 325W | 超频 | 48s | -33.3% | | RTX 5090 | 400W | 降压+超频 | 48s | -33.3% | 或者以 5090 在 400W 作为基线: | GPU | 功耗 | 备注 | 时间 | 比基线快 | |:-|:-|:-|:-|:-| | RTX 5090 | 400W | 基线(OC + 降压) | 48s | - | | RTX 6000 PRO MaxQ | 325W | 超频 | 48s | 0% | | RTX 5090 | 475W | 降压+超频 | 42s | +12.5% | | RTX 6000 PRO WS/SE | 600W | 未调校 | 39s | +18.8% | | RTX 5090 | 600W | 降压+超频 | 36s | +25.0% | 运行此任务时,显卡的核心频率大致如下: * 5090 600W:~2500MHz * 5090 475W:~2100MHz * 6000 PRO WS/SE 600W:~2200MHz * 5090 400W:~1800MHz * 6000 PRO MaxQ:1400-1500MHz 如你所见,RTX 5090 比 6000 MaxQ 快 25%,但功耗高出 84%。与此同时,未调校的 6000 PRO WS/SE 快 18.8%,功耗也同样高出 84%。不过理论上,如果对 WS/SE 进行降压+超频,它会比 5090 更快。最后,6000 PRO MaxQ 在仅用 75% 功耗的情况下达到了与 5090 相同的性能,这对于功耗受限如此严重来说相当令人印象深刻。如果有人拥有调校后的 6000 PRO/WS 并且愿意做此测试,请告诉我!
查看原文

相似文章

RTX Pro 4500 Blackwell 性能实测

Reddit r/LocalLLaMA

一位用户分享了将 Nvidia RTX Pro 4500 Blackwell 32GB GPU 与 RTX 5060 Ti 16GB 进行 AI 推理性能对比的基准测试结果,显示根据模型大小和量化水平,速度提升了 1.6 到 6 倍。

[基准测试] 5090RTX:提示解析、Token 生成与功耗等级

Reddit r/LocalLLaMA

一位用户使用 llama.cpp 对 Nvidia 5090 RTX GPU 进行 LLM 推理基准测试,测量了不同功耗水平下的提示处理和 token 生成情况,发现提示处理对功耗限制更为敏感,而 token 生成相对不敏感,并指出了与 4090 RTX 的差异。

运行8x RTX PRO 6000的实用指南

Hacker News Top

本文提供了运行8x NVIDIA RTX PRO 6000 Blackwell GPU处理AI工作负载的实用指南,重点介绍高并发推理、模型集群和70B微调,同时与更昂贵的数据中心解决方案进行性能比较。