RTX Pro 4500 Blackwell 性能实测

Reddit r/LocalLLaMA 产品

摘要

一位用户分享了将 Nvidia RTX Pro 4500 Blackwell 32GB GPU 与 RTX 5060 Ti 16GB 进行 AI 推理性能对比的基准测试结果,显示根据模型大小和量化水平,速度提升了 1.6 到 6 倍。

# RTX Pro 4500 Blackwell 大约一个月前,我向 Reddit 的网友们寻求升级建议,关于下一步如何升级以下 AI 服务器: >AMD Ryzen 7 7700 CPU ​Corsair Vengeance RGB DDR5 5600MHz 32GB (2x16) ​RTX 5060 Ti 16GB 起初我考虑将系统内存升级到 96GB,以运行更大的 MoE 模型,但反馈明确指向“VRAM 为王,不容置疑”。说实话,100B 参数级别的模型规模目前并不常见。因此我决定升级显卡。将显卡升级为 RTX Pro 4500 Blackwell 32GB 显然是正确的选择——模型完全载入 VRAM,上下文更大且无需 KV 量化,体验好得多。这是一款面向专业用途的坚固显卡,我在 Reddit 上还没看到多少相关数据。因此,我想在这里分享一些性能数据,供可能对这款显卡感兴趣的人参考。 # RTX 5060 Ti 16GB vs RTX Pro 4500 Blackwell 32GB 由于我是从 RTX 5060 Ti 16GB 升级到 RTX Pro 4500 Blackwell 32GB,因此主要围绕两者进行对比。从规格上看,RTX Pro 4500 32GB 的速度大约是 RTX 5060 Ti 16GB 的两倍。在对比基本能完全放入 16GB VRAM 的稠密模型时,提示处理速度接近两倍,而 Token 生成速度快约 1.6-1.8 倍。对于无法完全放入 16GB VRAM 的 MoE 模型,差异更大。由于同一个模型现在能完全放入 32GB VRAM,因此在 Token 生成时无需访问系统内存,从而获得了额外的性能提升。提示处理速度快 3 到 6 倍,Token 生成速度快 1.8 到 2.6 倍。这些性能数据均基于相同的模型和量化配置。 |Model|Size (GB)|5060Ti (pp512)|5060Ti (tg128)|Pro 4500 Blackwell (pp512)|Pro 4500 Blackwell (tg128)|PP|TG| |:-|:-|:-|:-|:-|:-|:-|:-| |qwen36 27B IQ4\_XS|14.37|997.28 ± 14.35|25.13 ± 0.01|2022.54 ± 35.19|45.19 ± 0.50|2x|1.8x| |qwen36 35B.A3B MXFP4|20.21|926.47 ± 88.11|70.94 ± 1.31|5507.10 ± 101.16|159.81 ± 1.10|5.95x|2.25x| |gemma4 26B.A4B MXFP4|15.47|1307.35 ± 37.64|56.82 ± 0.26|7177.80 ± 103.91|144.74 ± 0.60|5.49x|2.55x| |ernie45 21B.A3B MXFP4|11.52|5214.56 ± 8.01|130.61 ± 2.05|10051.74 ± 174.12|214.73 ± 0.81|1.93x|1.64x| |Nemotron Cascade 2 30B.A3B MXFP4|18.65|1470.95 ± 14.16|63.22 ± 0.64|6709.37 ± 68.03|147.07 ± 2.46|4.56x|2.33x| |Tesselate OmniCoder 9B Q8|8.86|3287.54 ± 44.43|45.68 ± 0.17|6288.52 ± 166.39|83.98 ± 0.35|1.91x|1.84| |qwen35 4B Q4\_K|2.70|4802.47 ± 217.58|107.94 ± 1.46|9113.67 ± 692.41|180.27 ± 0.14|1.90x|1.67x| |qwen35 9B UD Q4\_K\_XL|5.55|3115.93 ± 93.61|68.33 ± 0.34|5990.62 ± 255.66|119.69 ± 1.61|1.92x|1.75x| |GLM 4.7 Flash MXFP4|15.79|2063.49 ± 28.97|81.43 ± 1.23|6520.56 ± 120.91|149.59 ± 0.61|3.16x|1.84x| (虽然没人谈论 Ernie,但它非常适合摘要提取、实体抽取等类似场景,在聊天方面不是最佳,但在数据处理上表现出色,且速度极快。) 所有测试均使用 Llama.cpp b9007,且为“快乐”数据——短上下文,使用 llama bench,模型量化尽可能使用 Unsloth 版本。以下两个示例: >./llama-bench -m /.../unsloth\_Qwen3.6-27B-IQ4\_XS.gguf -t 8 -p 512 -b 512 -ub 512 --flash-attn 1 -fitt 1024 ​./llama-bench -m /.../unsloth\_Qwen3.6-35B-A3B-MXFP4\_MOE.gguf -t 8 -p 512 -ub 512 -b 512 --flash-attn 1 # 比较量化与 NVFP4/MXFP4 我还想看看如何利用额外的 VRAM,对比不同量化级别,以及现在 Llama.cpp 除了 MXFP4 之外还支持 NVFP4,我想看看区别何在。性能方面,NVFP4 和 MXFP4 达到了良好的平衡,表现优于 Q6\_K 和 Q5\_K。我还运行了其他基准测试,看看不同量化对“智能”的影响。这方面还有很多工作要做,但初步结论是,NVFP4 与 Q6\_K 之间、或 MXFP4 与 Q5\_K 之间的智能下降并不明显。如果有好的 NVFP4 选项,就没有实际必要使用 Q6 或 Q5;如果没有,MXFP4 也相当不错。不过需要指出的是,NVFP4/MXFP4 的好坏取决于转换过程是否为 NVFP4/MXFP4 进行了优化,而且如果模型本身使用了量化感知训练,效果也会更好。未经优化的 FP16 到 MXFP4/NVFP4 的“生硬”转换,其质量会低于 Q4\_K\_M。Nvidia 有时会在 Hugging Face 上发布优化的 NVFP4 量化版本,这是获取高质量转换的一个好来源。 (以下测试使用 Llama.cpp b9234。) |Model|Size (GB)|pp512|tg128|pp %|tg %| |:-|:-|:-|:-|:-|:-| |qwen36 27B IQ4\_XS|14.37|2022.54 ± 35.19|45.19 ± 0.50|129|137| |qwen36 27B NVFP4|18.29|2726.32 ± 56.68|41.15 ± 0.55|173|125| |qwen36 27B Q6\_K|20.97|1571.16 ± 21.91|32.87 ± 0.01|-|-| |qwen36moe 35B.A3B MXFP4|20.21|5507.10 ± 101.16|159.81 ± 1.10|118|99| |qwen36moe 35B.A3B Q5\_K|24.76|4678.36 ± 72.83|160.64 ± 6.17|-|-| 实际使用中,像 Qwen 3.6 35B-A3B MXFP4 这样的模型,在 128k 上下文和 32k 实际内容下,提示处理速度约为 4500,Token 生成速度约为 144。 # 与 RTX 5090 对比 显而易见的问题是与 RTX 5090 的对比:价格与 RTX Pro 4500 Blackwell 接近,但纸面性能是后者的两倍。然而,这是一场游戏显卡(非 24/7 设计)与专业显卡(专为 24/7 使用打造,配备 ECC 内存纠错、更好的能效和散热管理)之间的较量,面向不同的使用场景和客户群体。实际测试中,使用 Qwen 3.6 27B 的 Q6\_K 量化、30K token,RTX 5090 在 400W 和 600W 功耗下比 RTX Pro 4500 Blackwell 快约 60% 到 70%,而 4500 运行在 200W。测试还表明,从 400W 提升到 600W 的最后 200W 仅使 Token 生成性能提升约 7%。因此,多出的 200W 功耗几乎榨不出多少性能。从能效角度考虑,将 RTX 5090 的功耗限制在 400-450W 是合理的。简而言之,在 2 倍功耗下,5090 比 4500 快 60%;在 3 倍功耗下,快 70%。如果性能压倒一切,RTX 5090 是明确胜者;但若功耗、噪音和散热很重要,且需要 24/7 运行,那么 RTX Pro 4500 Blackwell 是 Nvidia 显卡中能效表现最好的之一,仅次于 RTX Pro 6000 Blackwell Max-Q 版本(后者价格完全不同)。如果你打算在(家庭)办公室环境中连续数周 24/7 运行,同时还需要工作和开会,RTX Pro 4500 Blackwell 是非常可靠的显卡,我使用一个月以来相当满意。(对比所用的 RTX 5090 测试数据见评论区的链接。)
查看原文

相似文章

RTX Pro 4500 Blackwell - Qwen 3.6 27B?

Reddit r/LocalLLaMA

一位开发者分享了在搭载 NVIDIA RTX Pro 4500 Blackwell 显卡的服务器上,使用 llama.cpp 运行 Qwen3.6-27B 模型的本地推理基准测试数据及 systemd 配置。该帖文征集了提升吞吐量的优化建议,并探讨了更大模型的潜在应用场景。

运行8x RTX PRO 6000的实用指南

Hacker News Top

本文提供了运行8x NVIDIA RTX PRO 6000 Blackwell GPU处理AI工作负载的实用指南,重点介绍高并发推理、模型集群和70B微调,同时与更昂贵的数据中心解决方案进行性能比较。

RTX 5000 PRO (48GB) 到货了,比我想象的要好。

Reddit r/LocalLLaMA

一位用户分享了购买和设置 RTX 5000 Pro (48GB) GPU 用于本地 LLM 推理的体验,在使用 Qwen3.6-27B-FP8 时获得了令人印象深刻的提示处理速度和 token 生成,并将其与 Mac Studio 和 RTX 5090 等替代方案进行了比较。

RTX PRO 5500 Blackwell (84GB) 发布

Reddit r/LocalLLaMA

NVIDIA 发布 RTX PRO 5500 Blackwell 工作站版,这是一款专业 GPU,配备 84GB GDDR7 显存,专为企业的 AI 和图形工作负载而设计。