问题:为什么 vLLM 的预填充速度远超其他推理引擎?
摘要
用户分享了基准测试结果,显示 vLLM 的预填充性能显著快于 llama.cpp 和其他引擎,并质疑这种速度差异背后的技术原因。
我最近才在一台 4 x 48GB 4090 系统上开始使用一些 vLLM 的分支版本。DS4F - 约 5000pp/180tg (DSpark) Qwen3.8 Flash next - 约 7500pp/135tg (MTP) 这太惊人了,就像把 API 搬到了我家里。但这也真的很难回去了。奇怪的是,我们在 llama.cpp 或 ik_llama 中从未接近过这样的预填充数字。外界传言 vLLM 在单请求速度上差不多,但这显然不是真的。一定存在巨大的差异,使得在 llama.cpp 和许多其他推理引擎中达到这样的速度成为不可逾越的障碍。有人确切知道这是什么吗?编辑:这些结果来自我的基准测试脚本,该脚本实际上计时的是响应时间,而不是 vLLM 日志。而且它们不是缓存命中。我的基准测试脚本故意打破缓存。实际的缓存命中,我也测量了,大约是 20k-100k+。
相似文章
如果你只是自己使用模型而不对外提供服务,vLLM 真的值得用吗?
一名用户讨论了在 AMD 硬件上进行本地单用户推理时,使用 vLLM 与 llama.cpp 之间的权衡,质疑在非企业级环境中 vLLM 的性能优势是否足以弥补其带来的复杂性。
@_avichawla: LLM推理中的预填充与解码。你是否注意到,LLM的第一个令牌总是需要片刻才出现…
解释LLM推理的两个阶段——预填充和解码,详细说明GPU瓶颈如何从预填充时的计算受限转变为解码时的内存受限,以及KV缓存的重要性。
预填充 vs. 解码与本地大语言模型的投资回报率:预填充被低估了吗?
一项分析对比了大语言模型推理中的预填充与解码阶段,探讨在本地大语言模型部署中,预填充在投资回报率方面是否未被充分重视。
深入vLLM:高吞吐量LLM推理系统剖析(2025)
深入探讨vLLM用于高吞吐量LLM推理的架构与组件,涵盖调度、分页注意力、连续批处理、高级特性、扩展、服务及基准测试。
@no_stp_on_snek: 当所有人都在讨论 @SpaceXAI、@AnthropicAI 和 @OpenAI 的更新(但 @GoogleAI 呢?)... 我去测试了…
Unsloth 的 NVFP4 量化模型在 vLLM 和 llama.cpp 之间推理性能的详细比较,重点说明了 vLLM 在预填充速度上的优势,但 llama.cpp 在单流智能体工作负载中的解码和缓存优势。