@akshay_pachaar: LLM工程师手册(每天30分钟,10周,50课)一个面向LLM推理服务的路线图,一切都指向一个服务,而不是分散在多个演示中。

X AI KOLs Following 新闻

摘要

一个为期10周、每天30分钟的工程师学习LLM推理服务的路线图,涵盖vLLM、SGLang、负载测试、量化以及优化技术,以构建一个可复现的基准测试。

LLM工程师手册 (每天30分钟,10周,50课) 一个面向LLM推理服务的路线图,一切都指向一个服务,而不是分散在多个演示中。你将首先获得心智模型,然后服务一个模型,对其进行检测,在超过1000个并发请求下进行负载测试,并进行调优。最终,你将拥有自己配置的栈和一个值得发布的基准测试。 以下是涵盖的内容: → 屋顶线模型,以及为什么解码等待内存而预填充等待计算 → vLLM内部机制,PagedAttention和调度器,从代码中阅读 → 使用Prometheus和Grafana监控TTFT、令牌间延迟和队列深度 → SGLang和RadixAttention前缀复用,与vLLM进行基准测试 → 负载测试超过1000个并发请求 → 量化FP16、FP8和INT4,兼顾质量和速度 → 投机解码和KV驱逐,包括收益消失的情况 → 分离预填充和解码,部署在Kubernetes上 → 成本、延迟和质量路由器,具有每请求令牌预算 → 发布可复现的基准测试 GitHub上的路线图:https://github.com/patchy631/time-to-first-token… (别忘了点星) 我还在为每个主要主题撰写文章。第一篇已经发布,关于GPU实际工作原理。 文章引用如下。
查看原文
查看缓存全文

缓存时间: 2026/08/15 03:49

《LLM工程师手册》(每天30分钟,10周,50课)——一份LLM推理服务的学习路线图,所有内容都指向一个统一的服务架构,而非分散的示例演示。你将先建立心智模型,然后部署模型、进行检测、在1000并发请求下进行负载测试,最后进行调优。最终你将获得自己配置的技术栈和值得发表的基准测试结果。以下是内容涵盖范围:

→ 屋顶模型及其原理:为何解码依赖内存而预填充依赖计算
→ vLLM内部机制:分页注意力调度器与代码级解读
→ 使用Prometheus与Grafana监控首token延迟(TTFT)、token间延迟及队列深度
→ SGLang与RadixAttention前缀复用机制:与vLLM的基准测试对比
→ 超1000并发请求的负载测试方案
→ 跨FP16、FP8、INT4的量化技术:兼顾质量与速度
→ 投机解码与KV缓存淘汰策略:及其收益消失的边界条件
→ 在Kubernetes上部署预填充与解码的分离式架构
→ 集成成本、延迟与质量感知路由及按请求token预算控制
→ 发布可复现的基准测试报告

路线图已发布至GitHub:https://github.com/patchy631/time-to-first-token…(别忘了点星标)

我正在为每个核心主题撰写配套文章,首篇关于GPU工作原理的文章已发布,全文转载如下:

适用人群

需熟悉Python、Transformer架构原理及命令行操作。无需服务端部署、Kubernetes或CUDA经验。若已掌握某主题,标为快速浏览的课时可压缩学习,但切勿跳过动手构建环节。

最终成果

  • 自行配置、监控与调优的完整服务栈
  • 展示TTFT、token间延迟、吞吐量、队列深度及单请求成本的Grafana仪表盘
  • 可复现的1000+并发压力测试工具链
  • 跨FP16、FP8、INT4、投机解码及KV淘汰策略的基准测试对比
  • 集成成本/延迟/质量感知路由与token预算控制机制
  • 附版本锁定与复现命令的基准测试报告

时间投入

项目说明
课时长度30分钟
每周课时5节+2天缓冲
总周期10周,50课时,总计25小时
GPU成本约半张24GB显卡按时租用,另需2次H100

缓冲日用于进度补全,不涉及新内容。

环境准备

GPU获取

7-8B模型需约24GB显卡,按时租用并在课时关闭实例。

服务商特点
RunPod按秒计费,快速启动
Modal无服务器模式,适合基准扫描脚本
Lambda/vast.ai低成本按需及市场GPU
Colab纯Python环境,不支持服务部署

第1周全周、第3周多数课时、第6周理论日、第9周阅读均无需GPU。集中在构建日租用。H100仅用于第5周1000并发测试与第8周分离式部署(实际运行时)。

工具安装

pip install vllm  
pip install guidellm  
pip install sglang  

另需Docker部署Prometheus/Grafana,第8周需要kind或小型托管集群。

第一周:心智模型

核心目标:安装后续所有实验依赖的基础模型,掌握屋顶模型、算力强度及“解码依赖内存/预填充依赖计算”的原理。
教学形式:以视频为主,屋顶模型推导适合实时演示。
交付物:手动推导目标模型的算力强度指标,并能明确判断各阶段瓶颈。

日期课时内容
周一阅读 · 《从零理解深度学习加速原理》(Horace He) 前半部分:计算/内存带宽/开销三类模型
周二阅读 · 完成上文:算子融合、开销机制及为何增加浮点运算对内存带宽受限无效
周三阅读 · 斯坦福CS336第5讲:GPU (Percy Liang, Tatsunori Hashimoto) 前30分钟:执行模型与内存层次
周四阅读 · CS336第5讲后30分钟:算力强度、屋顶模型及数据搬运主导性
周五构建+浏览 · 手动计算目标模型算力强度,核心在于产出个人数据
缓冲日CS336第10讲:推理

第三周:度量基础设施

核心目标:在优化前建立观测体系,所有后续课时依赖本周成果。
教学形式:以文本材料为主,基准测试方法论视频质量参差。
交付物:实时Grafana仪表盘,展示自有服务的TTFT、token间延迟、吞吐量与队列深度。

日期课时内容
周一阅读 · vLLM指标设计文档:理解num_requests_running等指标定义
周二构建 · 部署Prometheus与Grafana监控服务
周三构建 · 导入仪表盘JSON,低负载验证面板响应,立即修正采集配置
周四阅读 · Databricks性能工程指南与NVIDIA基准测试基础,将指标映射至面板
周五阅读 · Modal如何测试LLM引擎:为何扫描请求率而非固定负载
缓冲日可选:vLLM技术分享21:生产栈深度剖析

第五周:1000并发压力测试

核心目标:在无需辩护时掌握可复现基准测试方法论。
教学形式:文档与实操为主。
交付物:1000+并发脚本化压力测试,输出p50/p95/p99指标,双工具交叉验证。

日期课时内容
周一阅读 · GuideLLM简介及安装
周二构建 · 固定输入输出token长度运行GuideLLM扫描
周三构建 · 使用vllm bench serve同负载交叉验证
周四构建 · genai-perf并发扫描1-128,定位吞吐饱和点
周五构建 · 租用H100突破1000并发,监控KV利用率与抢占信号
缓冲日在基准仓库编写预发布检查清单

第七周:投机解码与KV淘汰

核心目标:掌握在内存带宽受限模型中节省内存读取的两种策略。
教学形式:理论推导配合代码级验证。
交付物:投机解码性能收益分析 + KV淘汰策略的适用场景文档。

日期课时内容
周一阅读 · 投机解码原理(Leviathan等人论文)与vLLM实现
周二构建 · 启用投机解码运行基准测试,对比拒绝采样与并行验证效率
周三阅读 · KV淘汰策略综述(HuggingFace博客)与vLLM实现
周四构建 · 长上下文负载下对比LRU与基于重要性淘汰的性能差异
周五分析 · 绘制收益衰减曲线:投机解码在何种模型规模/批量下失效
缓冲日重读第五周压力测试数据,定位KV淘汰的最佳干预点

第九周:成本/延迟/质量路由

核心目标:将经济性指标集成到推理系统。
教学形式:路由算法设计结合实时监控。
交付物:按请求token预算控制的智能路由器 + 多模型负载分配策略。

日期课时内容
周一阅读 · 成本感知推理框架(QoS约束下的模型选择)
周二构建 · 实现基于延迟的实时路由决策
周三构建 · 添加质量评估维度(小型代理模型打分)
周四构建 · 集成token预算控制,防止请求超支
周五分析 · 路由日志可视化,验证策略有效性
缓冲日编写路由策略白皮书

关键提醒:每课时的“构建”环节是知识内化的核心,压缩阅读可,压缩实践不可。完整仓库请访问GitHub项目页

相似文章

逐步 LLM 工程项目 (2026 版)

X AI KOLs

一个基于项目的路线图,通过构建从分词器到服务栈的关键组件来学习 LLM 工程,包括硬件基础和后训练技术。

LLMs 101:实用指南(2026年版)

X AI KOLs

一份关于LLMs的全面实用指南,涵盖推理机制、令牌、Transformer、KV缓存、本地部署硬件和量化,截至2026年5月。