Blackwell 与 PDL 性能提升

Reddit r/LocalLLaMA 工具

摘要

Llama.cpp 现已支持适用于 Blackwell GPU 的 Nvidia 程序化依赖启动 (PDL),在 Token 生成时可带来 5-10% 的性能提升。该功能默认未启用,需通过编译标志开启。

Llama.cpp 近期引入了对程序化依赖启动 (PDL) 的支持,这是 Nvidia GPU(计算能力 >= 90,不包括 ADA)如 Blackwell 的新特性。(参见 PR 22522。)简言之,PDL 能更高效地执行内核,从而提升性能。目前该功能默认未启用,如果你不了解它,很可能就会错过。要启用 PDL,需要使用 **-D GGML\_CUDA\_PDL=ON** 编译标志来构建 Llama.cpp,且目前并非所有内核都支持 PDL,未来随着更多内核启用 PDL,性能还有进一步提升空间。(如果后期需要禁用 PDL,可以在启动 llama.cpp 前执行 **export GGML\_CUDA\_PDL=0**。) # 基准测试 |模型|pp512|tg128|pp512 @ PDL|tg128 @ PDL|预填充提升 %|生成提升 %| |:-|:-|:-|:-|:-|:-|:-| |Qwen 3.6 35B.A3B MXFP4|5412.39 ± 62.58 |172.72 ± 3.94 |5416.55 ± 58.92 |183.03 ± 0.93 |0|5.97 | |Qwen 3.6 35B.A3B UD-Q5\_K\_XL|4564.77 ± 47.55 |162.24 ± 6.67 |4582.22 ± 45.65 |177.11 ± 1.29 |0|9.17 | |Gemma 4 26B.A4B NVFP4|6728.74 ± 89.56 |107.39 ± 2.44 |6850.46 ± 97.86 |112.71 ± 0.38 |1.8|4.95 | |Qwen 3.6 27B NVFP4|2687.16 ± 70.18|41.31 ± 0.03|2708.97 ± 55.56|42.22 ± 0.05|0|2.2| (所有测试均使用 b9282 运行,结果为在 RTX Pro 4500 Blackwell 32GB 上两次测试中的最佳值。) # 结论 预填充阶段几乎没有差异,但根据上述测试,Token 生成平均有 5% 到 6% 的性能提升。根据 PR,Token 生成预计有 4% 到 10% 的改进。如前所述,构建时该功能默认未启用,如果你使用的是 Blackwell,这相当于一个免费性能提升,值得一试。
查看原文

相似文章

Llama.cpp PR 带来 8% 速度提升

Reddit r/LocalLLaMA

一个 llama.cpp PR 将采样从 CPU 移至 GPU,在 RTX 5090 上为 Qwen3.6-35B 推理带来 8% 的 token 速度提升,在 Tesla P40 上约为 4%。