解决:当服务器窗口未聚焦时,Windows上的LLM推理速度降低2-3倍
摘要
由于CPU调度延迟,当服务器窗口未聚焦时,Windows上的LLM推理速度降低2-3倍;以分离/无头模式运行服务器解决了这个问题,并保持性能一致。
解决方法:以分离/无头模式运行服务器,而不是将其附加到控制台窗口。RTX 5090, ~27B NVFP4模型通过ninfer: 终端聚焦时:130–200 tok/s 终端未聚焦时:50–60 tok/s 点击终端 → 立即恢复到130+ tok/s 一开始我以为是GPU降频,但GPU不是问题所在。在慢速运行时:SM时钟实际上更高:2550–2600 MHz 对比 2100–2200 MHz 功率限制相同:400 W 没有PCIe电源状态下降 decode-host保持在约390–494 µs 主要差异在于wait:wait tok/s 未聚焦 38–41 ms 50–60 聚焦 16–17 ms 130–220 所以GPU并没有变慢。服务循环只是在CPU端被延迟。以分离模式运行服务器(docker run -d / headless)解决了这个问题:wait保持在约17 ms,吞吐量保持在约130–200 tok/s,无论哪个窗口聚焦。我还在原生Windows构建上复现了同样的问题,所以这不是WSL2特定的。似乎是Windows前台/后台CPU调度行为的一种。有人在Windows 11上本地LLM推理时遇到过这个吗?
相似文章
@h100envy: 前vLLM核心贡献者用34分钟解释如何将LLM推理成本降低10倍——比$3000的推理优化训练营更有效
一位前vLLM核心贡献者解释了如何通过LMCache将KV缓存卸载到CPU/SSD/远程存储,从而使LLM推理成本降低10倍,这一技术已被彭博等生产环境采用。
我终于从Windows切换到Linux,并获得了30-50%的速度提升。
用户从Windows切换到Linux,并将llamacpp替换为vllm,在AI推理中实现了30-50%的速度提升。
WebLLM: 高性能浏览器内LLM推理引擎
WebLLM是一个高性能的浏览器内LLM推理引擎,它利用WebGPU进行硬件加速,并且完全兼容OpenAI API,使得开源语言模型可以在本地运行。
深入vLLM:高吞吐量LLM推理系统剖析(2025)
深入探讨vLLM用于高吞吐量LLM推理的架构与组件,涵盖调度、分页注意力、连续批处理、高级特性、扩展、服务及基准测试。
如果你只是自己使用模型而不对外提供服务,vLLM 真的值得用吗?
一名用户讨论了在 AMD 硬件上进行本地单用户推理时,使用 vLLM 与 llama.cpp 之间的权衡,质疑在非企业级环境中 vLLM 的性能优势是否足以弥补其带来的复杂性。