问题:为什么 vLLM 的预填充速度远超其他推理引擎?

Reddit r/LocalLLaMA 工具

摘要

用户分享了基准测试结果,显示 vLLM 的预填充性能显著快于 llama.cpp 和其他引擎,并质疑这种速度差异背后的技术原因。

我最近才在一台 4 x 48GB 4090 系统上开始使用一些 vLLM 的分支版本。DS4F - 约 5000pp/180tg (DSpark) Qwen3.8 Flash next - 约 7500pp/135tg (MTP) 这太惊人了,就像把 API 搬到了我家里。但这也真的很难回去了。奇怪的是,我们在 llama.cpp 或 ik_llama 中从未接近过这样的预填充数字。外界传言 vLLM 在单请求速度上差不多,但这显然不是真的。一定存在巨大的差异,使得在 llama.cpp 和许多其他推理引擎中达到这样的速度成为不可逾越的障碍。有人确切知道这是什么吗?编辑:这些结果来自我的基准测试脚本,该脚本实际上计时的是响应时间,而不是 vLLM 日志。而且它们不是缓存命中。我的基准测试脚本故意打破缓存。实际的缓存命中,我也测量了,大约是 20k-100k+。
查看原文

相似文章