我终于从Windows切换到Linux,并获得了30-50%的速度提升。

Reddit r/LocalLLaMA 新闻

摘要

用户从Windows切换到Linux,并将llamacpp替换为vllm,在AI推理中实现了30-50%的速度提升。

这太棒了。我所做的只是从Windows上的llamacpp切换到Linux上的vllm。
查看原文

相似文章

Llama.cpp PR 带来 8% 速度提升

Reddit r/LocalLLaMA

一个 llama.cpp PR 将采样从 CPU 移至 GPU,在 RTX 5090 上为 Qwen3.6-35B 推理带来 8% 的 token 速度提升,在 Tesla P40 上约为 4%。