@junupark_: 新笔记: 深入了解 nano-vllm-v1 这可以看作是我上一篇关于 nano-vllm 的笔记的第二部分。在这篇笔记中,我探讨了…

X AI KOLs Timeline 工具

摘要

这篇笔记解释了在 nano-vllm-v1 中分块预填充(chunked prefill)和混合批处理(mixed batching)的实现,并与前一版本进行了性能基准测试。

新笔记:深入了解 nano-vllm-v1 这可以看作是我上一篇关于 nano-vllm 的笔记的第二部分。在这篇笔记中,我详细介绍了两个主要概念——分块预填充(chunked prefill)和混合批处理(mixed batching,即预填充和解码可以在同一步骤中调度)——以及它们在代码层面的实现方式。 另外,还对 nano-vllm 和 nano-vllm-v1 进行了基准测试,以观察调度行为如何影响端到端性能。 笔记链接:https://github.com/junuxyz/mlsys-notes/blob/main/notes/vllm/inside-nano-vllm-v1.md… 基准测试仓库链接:https://github.com/junuxyz/nano-vllm-bench…
查看原文
查看缓存全文

缓存时间: 2026/07/28 10:26

new note: inside nano-vllm-v1

这可以看作是我之前关于 nano-vllm 笔记的第二部分。在这篇笔记中,我将介绍两个核心思想——分块预填充与混合批处理(预填充和解码可以在同一个步骤中调度)——以及它们在代码层面的实现方式。 我还将 nano-vllm 与 nano-vllm-v1 进行了基准测试对比,以观察调度行为如何影响端到端性能。

笔记链接:https://github.com/junuxyz/mlsys-notes/blob/main/notes/vllm/inside-nano-vllm-v1.md 基准测试仓库链接:https://github.com/junuxyz/nano-vllm-bench


junuxyz/mlsys-notes

来源:https://github.com/junuxyz/mlsys-notes

mlsys-notes

用于理解现代机器学习系统的学习笔记与实验。

目前专注于 LLM 服务系统与推理优化。

笔记

推理引擎

分布式

硬件

扩散模型

实验

  • microengine:一个极简的推理引擎
  • tinyorca (https://github.com/junuxyz/tinyorca):ORCA 论文的最小化实现 (https://www.usenix.org/system/files/osdi22-yu.pdf)
  • tiny-speculators (https://github.com/junuxyz/tiny-speculators):从头实现的推测解码模型训练

相似文章

vllm-project/vllm v0.21.0rc1

GitHub Releases Watchlist

vLLM v0.21.0rc1 是高性能大语言模型推理和服务库的预发布更新,主要功能包括针对吞吐量、量化以及硬件支持的优化。