停止浪费电力

Reddit r/LocalLLaMA 工具

摘要

作者展示了如何在通过 llama.cpp 运行量化 Qwen 模型时,在不牺牲推理速度的前提下,将 RTX 4090 的功耗降低高达 40%。通过 nvidia-smi 限制 GPU 功耗上限并调整 llama-server 参数,用户可显著降低发热与噪音,并延长硬件使用寿命。

在我的 RTX 4090 上运行 llama.cpp 的参数如下:llama-server -m ~/Projects/llm/models/Qwen3.6-27B-UD-Q4_K_XL.gguf --flash-attn on -ngl all -ctk q4_0 -ctv q4_0 -t 32 -c 262144。功耗上限通过 sudo nvidia-smi -pl N 设置。据我观察,GPU 会持续触及功耗上限,因此该数值即可代表实际功耗。你可以在不损失性能的情况下将功耗降低 40%(同时也能降低主机噪音与发热,并延长 GPU 寿命)。
查看原文

相似文章

RTX Pro 4500 Blackwell - Qwen 3.6 27B?

Reddit r/LocalLLaMA

一位开发者分享了在搭载 NVIDIA RTX Pro 4500 Blackwell 显卡的服务器上,使用 llama.cpp 运行 Qwen3.6-27B 模型的本地推理基准测试数据及 systemd 配置。该帖文征集了提升吞吐量的优化建议,并探讨了更大模型的潜在应用场景。

Llama.cpp PR 带来 8% 速度提升

Reddit r/LocalLLaMA

一个 llama.cpp PR 将采样从 CPU 移至 GPU,在 RTX 5090 上为 Qwen3.6-35B 推理带来 8% 的 token 速度提升,在 Tesla P40 上约为 4%。

Qwen 3.6 27B 在 llama.cpp 中的标志/设置

Reddit r/LocalLLaMA

一位用户分享了他们在 RTX 5090 上运行 Qwen 3.6 27B 的 llama.cpp 服务器配置,达到了 80-100 t/s 的速度,并向社区询问其他设置和技巧。