解决:当服务器窗口未聚焦时,Windows上的LLM推理速度降低2-3倍

Reddit r/LocalLLaMA 新闻

摘要

由于CPU调度延迟,当服务器窗口未聚焦时,Windows上的LLM推理速度降低2-3倍;以分离/无头模式运行服务器解决了这个问题,并保持性能一致。

解决方法:以分离/无头模式运行服务器,而不是将其附加到控制台窗口。RTX 5090, ~27B NVFP4模型通过ninfer: 终端聚焦时:130–200 tok/s 终端未聚焦时:50–60 tok/s 点击终端 → 立即恢复到130+ tok/s 一开始我以为是GPU降频,但GPU不是问题所在。在慢速运行时:SM时钟实际上更高:2550–2600 MHz 对比 2100–2200 MHz 功率限制相同:400 W 没有PCIe电源状态下降 decode-host保持在约390–494 µs 主要差异在于wait:wait tok/s 未聚焦 38–41 ms 50–60 聚焦 16–17 ms 130–220 所以GPU并没有变慢。服务循环只是在CPU端被延迟。以分离模式运行服务器(docker run -d / headless)解决了这个问题:wait保持在约17 ms,吞吐量保持在约130–200 tok/s,无论哪个窗口聚焦。我还在原生Windows构建上复现了同样的问题,所以这不是WSL2特定的。似乎是Windows前台/后台CPU调度行为的一种。有人在Windows 11上本地LLM推理时遇到过这个吗?
查看原文

相似文章

WebLLM: 高性能浏览器内LLM推理引擎

Hacker News Top

WebLLM是一个高性能的浏览器内LLM推理引擎,它利用WebGPU进行硬件加速,并且完全兼容OpenAI API,使得开源语言模型可以在本地运行。