@junupark_: 新笔记: 深入了解 nano-vllm-v1 这可以看作是我上一篇关于 nano-vllm 的笔记的第二部分。在这篇笔记中,我探讨了…
摘要
这篇笔记解释了在 nano-vllm-v1 中分块预填充(chunked prefill)和混合批处理(mixed batching)的实现,并与前一版本进行了性能基准测试。
查看缓存全文
缓存时间: 2026/07/28 10:26
new note: inside nano-vllm-v1
这可以看作是我之前关于 nano-vllm 笔记的第二部分。在这篇笔记中,我将介绍两个核心思想——分块预填充与混合批处理(预填充和解码可以在同一个步骤中调度)——以及它们在代码层面的实现方式。 我还将 nano-vllm 与 nano-vllm-v1 进行了基准测试对比,以观察调度行为如何影响端到端性能。
笔记链接:https://github.com/junuxyz/mlsys-notes/blob/main/notes/vllm/inside-nano-vllm-v1.md 基准测试仓库链接:https://github.com/junuxyz/nano-vllm-bench
junuxyz/mlsys-notes
来源:https://github.com/junuxyz/mlsys-notes
mlsys-notes
用于理解现代机器学习系统的学习笔记与实验。
目前专注于 LLM 服务系统与推理优化。
笔记
推理引擎
分布式
硬件
扩散模型
实验
- microengine:一个极简的推理引擎
- tinyorca (https://github.com/junuxyz/tinyorca):ORCA 论文的最小化实现 (https://www.usenix.org/system/files/osdi22-yu.pdf)
- tiny-speculators (https://github.com/junuxyz/tiny-speculators):从头实现的推测解码模型训练
相似文章
@junupark_:新文章:深入 nano-vLLM。虽然 v0 架构现在有点过时,但仍然认为这个仓库是优化…
@junupark_ 的新文章提供了 nano-vLLM(一个 LLM 推理引擎)的端到端代码讲解,并计划介绍诸如 Eagle3 和 dFlash 之类的投机解码技术。
@no_stp_on_snek: 当所有人都在讨论 @SpaceXAI、@AnthropicAI 和 @OpenAI 的更新(但 @GoogleAI 呢?)... 我去测试了…
Unsloth 的 NVFP4 量化模型在 vLLM 和 llama.cpp 之间推理性能的详细比较,重点说明了 vLLM 在预填充速度上的优势,但 llama.cpp 在单流智能体工作负载中的解码和缓存优势。
vllm-project/vllm v0.21.0rc1
vLLM v0.21.0rc1 是高性能大语言模型推理和服务库的预发布更新,主要功能包括针对吞吐量、量化以及硬件支持的优化。
@athleticKoder:一篇关于LLM推理原理的1600字笔记,涵盖:1. 注意力机制——token交互的唯一场所 2. KV缓存——为何...
一篇详细阐述LLM推理关键概念的推文:注意力机制、KV缓存、分块预填充以及批处理技术,包括vLLM和SGLang中使用的连续批处理。
@_avichawla: LLM推理中的预填充与解码。你是否注意到,LLM的第一个令牌总是需要片刻才出现…
解释LLM推理的两个阶段——预填充和解码,详细说明GPU瓶颈如何从预填充时的计算受限转变为解码时的内存受限,以及KV缓存的重要性。