@akshay_pachaar: LLM工程师手册(每天30分钟,10周,50课)一个面向LLM推理服务的路线图,一切都指向一个服务,而不是分散在多个演示中。
摘要
一个为期10周、每天30分钟的工程师学习LLM推理服务的路线图,涵盖vLLM、SGLang、负载测试、量化以及优化技术,以构建一个可复现的基准测试。
查看缓存全文
缓存时间: 2026/08/15 03:49
《LLM工程师手册》(每天30分钟,10周,50课)——一份LLM推理服务的学习路线图,所有内容都指向一个统一的服务架构,而非分散的示例演示。你将先建立心智模型,然后部署模型、进行检测、在1000并发请求下进行负载测试,最后进行调优。最终你将获得自己配置的技术栈和值得发表的基准测试结果。以下是内容涵盖范围:
→ 屋顶模型及其原理:为何解码依赖内存而预填充依赖计算
→ vLLM内部机制:分页注意力调度器与代码级解读
→ 使用Prometheus与Grafana监控首token延迟(TTFT)、token间延迟及队列深度
→ SGLang与RadixAttention前缀复用机制:与vLLM的基准测试对比
→ 超1000并发请求的负载测试方案
→ 跨FP16、FP8、INT4的量化技术:兼顾质量与速度
→ 投机解码与KV缓存淘汰策略:及其收益消失的边界条件
→ 在Kubernetes上部署预填充与解码的分离式架构
→ 集成成本、延迟与质量感知路由及按请求token预算控制
→ 发布可复现的基准测试报告
路线图已发布至GitHub:https://github.com/patchy631/time-to-first-token…(别忘了点星标)
我正在为每个核心主题撰写配套文章,首篇关于GPU工作原理的文章已发布,全文转载如下:
适用人群
需熟悉Python、Transformer架构原理及命令行操作。无需服务端部署、Kubernetes或CUDA经验。若已掌握某主题,标为快速浏览的课时可压缩学习,但切勿跳过动手构建环节。
最终成果
- 自行配置、监控与调优的完整服务栈
- 展示TTFT、token间延迟、吞吐量、队列深度及单请求成本的Grafana仪表盘
- 可复现的1000+并发压力测试工具链
- 跨FP16、FP8、INT4、投机解码及KV淘汰策略的基准测试对比
- 集成成本/延迟/质量感知路由与token预算控制机制
- 附版本锁定与复现命令的基准测试报告
时间投入
| 项目 | 说明 |
|---|---|
| 课时长度 | 30分钟 |
| 每周课时 | 5节+2天缓冲 |
| 总周期 | 10周,50课时,总计25小时 |
| GPU成本 | 约半张24GB显卡按时租用,另需2次H100 |
缓冲日用于进度补全,不涉及新内容。
环境准备
GPU获取
7-8B模型需约24GB显卡,按时租用并在课时关闭实例。
| 服务商 | 特点 |
|---|---|
| RunPod | 按秒计费,快速启动 |
| Modal | 无服务器模式,适合基准扫描脚本 |
| Lambda/vast.ai | 低成本按需及市场GPU |
| Colab | 纯Python环境,不支持服务部署 |
第1周全周、第3周多数课时、第6周理论日、第9周阅读均无需GPU。集中在构建日租用。H100仅用于第5周1000并发测试与第8周分离式部署(实际运行时)。
工具安装
pip install vllm
pip install guidellm
pip install sglang
另需Docker部署Prometheus/Grafana,第8周需要kind或小型托管集群。
第一周:心智模型
核心目标:安装后续所有实验依赖的基础模型,掌握屋顶模型、算力强度及“解码依赖内存/预填充依赖计算”的原理。
教学形式:以视频为主,屋顶模型推导适合实时演示。
交付物:手动推导目标模型的算力强度指标,并能明确判断各阶段瓶颈。
| 日期 | 课时内容 |
|---|---|
| 周一 | 阅读 · 《从零理解深度学习加速原理》(Horace He) 前半部分:计算/内存带宽/开销三类模型 |
| 周二 | 阅读 · 完成上文:算子融合、开销机制及为何增加浮点运算对内存带宽受限无效 |
| 周三 | 阅读 · 斯坦福CS336第5讲:GPU (Percy Liang, Tatsunori Hashimoto) 前30分钟:执行模型与内存层次 |
| 周四 | 阅读 · CS336第5讲后30分钟:算力强度、屋顶模型及数据搬运主导性 |
| 周五 | 构建+浏览 · 手动计算目标模型算力强度,核心在于产出个人数据 |
| 缓冲日 | CS336第10讲:推理 |
第三周:度量基础设施
核心目标:在优化前建立观测体系,所有后续课时依赖本周成果。
教学形式:以文本材料为主,基准测试方法论视频质量参差。
交付物:实时Grafana仪表盘,展示自有服务的TTFT、token间延迟、吞吐量与队列深度。
| 日期 | 课时内容 |
|---|---|
| 周一 | 阅读 · vLLM指标设计文档:理解num_requests_running等指标定义 |
| 周二 | 构建 · 部署Prometheus与Grafana监控服务 |
| 周三 | 构建 · 导入仪表盘JSON,低负载验证面板响应,立即修正采集配置 |
| 周四 | 阅读 · Databricks性能工程指南与NVIDIA基准测试基础,将指标映射至面板 |
| 周五 | 阅读 · Modal如何测试LLM引擎:为何扫描请求率而非固定负载 |
| 缓冲日 | 可选:vLLM技术分享21:生产栈深度剖析 |
第五周:1000并发压力测试
核心目标:在无需辩护时掌握可复现基准测试方法论。
教学形式:文档与实操为主。
交付物:1000+并发脚本化压力测试,输出p50/p95/p99指标,双工具交叉验证。
| 日期 | 课时内容 |
|---|---|
| 周一 | 阅读 · GuideLLM简介及安装 |
| 周二 | 构建 · 固定输入输出token长度运行GuideLLM扫描 |
| 周三 | 构建 · 使用vllm bench serve同负载交叉验证 |
| 周四 | 构建 · genai-perf并发扫描1-128,定位吞吐饱和点 |
| 周五 | 构建 · 租用H100突破1000并发,监控KV利用率与抢占信号 |
| 缓冲日 | 在基准仓库编写预发布检查清单 |
第七周:投机解码与KV淘汰
核心目标:掌握在内存带宽受限模型中节省内存读取的两种策略。
教学形式:理论推导配合代码级验证。
交付物:投机解码性能收益分析 + KV淘汰策略的适用场景文档。
| 日期 | 课时内容 |
|---|---|
| 周一 | 阅读 · 投机解码原理(Leviathan等人论文)与vLLM实现 |
| 周二 | 构建 · 启用投机解码运行基准测试,对比拒绝采样与并行验证效率 |
| 周三 | 阅读 · KV淘汰策略综述(HuggingFace博客)与vLLM实现 |
| 周四 | 构建 · 长上下文负载下对比LRU与基于重要性淘汰的性能差异 |
| 周五 | 分析 · 绘制收益衰减曲线:投机解码在何种模型规模/批量下失效 |
| 缓冲日 | 重读第五周压力测试数据,定位KV淘汰的最佳干预点 |
第九周:成本/延迟/质量路由
核心目标:将经济性指标集成到推理系统。
教学形式:路由算法设计结合实时监控。
交付物:按请求token预算控制的智能路由器 + 多模型负载分配策略。
| 日期 | 课时内容 |
|---|---|
| 周一 | 阅读 · 成本感知推理框架(QoS约束下的模型选择) |
| 周二 | 构建 · 实现基于延迟的实时路由决策 |
| 周三 | 构建 · 添加质量评估维度(小型代理模型打分) |
| 周四 | 构建 · 集成token预算控制,防止请求超支 |
| 周五 | 分析 · 路由日志可视化,验证策略有效性 |
| 缓冲日 | 编写路由策略白皮书 |
关键提醒:每课时的“构建”环节是知识内化的核心,压缩阅读可,压缩实践不可。完整仓库请访问GitHub项目页。
相似文章
逐步 LLM 工程项目 (2026 版)
一个基于项目的路线图,通过构建从分词器到服务栈的关键组件来学习 LLM 工程,包括硬件基础和后训练技术。
@_rohit_tiwari_: 这本230页的书揭示了LLM的秘密。https://drive.google.com/file/d/1ZqV0wByb65_wvzWUbaLw6pCbtXgyXDHG/view……
一本230页的书,全面涵盖LLM概念,包括预训练、微调、对齐和提示技术。
大规模LLM推理开放手册(GPU内部机制、KV缓存、批处理、vLLM/SGLang/TensorRT-LLM)[P]
一本正在编写中的开放手册,解释LLM推理内部机制,包括GPU内存层次结构、KV缓存、批处理以及vLLM和TensorRT-LLM等流行推理引擎。
LLMs 101:实用指南(2026年版)
一份关于LLMs的全面实用指南,涵盖推理机制、令牌、Transformer、KV缓存、本地部署硬件和量化,截至2026年5月。
@_avichawla: https://x.com/_avichawla/status/2053049489963811135
本文概述了2026年大语言模型(LLM)工程的路线图,详细阐述了包括提示词工程、RAG系统、上下文管理在内的八大关键支柱,并为每项支柱提供了精选的免费及开源资源。