@TheAhmadOsman: 如何学习这一切?第一步:从服务引擎视角开始 - vLLM:PagedAttention、连续批处理...

X AI KOLs Following 工具

摘要

一份关于学习AI推理引擎内部机制的详细指南,涵盖vLLM和SGLang等服务引擎、使用Triton和CUTLASS的低层GPU内核编程,以及一系列旨在培养实践能力的小型项目。

如何学习这一切? 第一步:从服务引擎视角开始 - vLLM:PagedAttention、连续批处理、前缀缓存、CUDA图 - SGLang:RadixAttention/前缀复用、推测解码、MoE、结构化/代理工作负载 - TensorRT-LLM:NVIDIA峰值堆栈、FP8/FP4、Wide-EP、分离式服务 - FlashInfer:用于注意力/GEMM/MoE/采样的可重用内核/算子库 第二步:深入底层堆栈 - Triton教程 → 自定义融合内核 - CUTLASS/CuTe → Tensor Core GEMM 及 Blackwell/Hopper 细节 - FlashAttention论文 → 注意力算法/内核协同设计 - PagedAttention论文 → KV缓存内存管理 - MoE文档 → 路由 + 分组GEMM + all-to-all - Nsight性能分析 → 停止猜测 第三步:执行以下小型项目序列 1. 在Triton中实现RMSNorm;与PyTorch对比 2. 实现融合SiLU × gate 3. 实现简单FP16矩阵乘法;与cuBLAS/rocBLAS对比 4. 为解码注意力实现分页KV查找 5. 添加带逐块缩放因子的FP8 KV缓存 6. 在GPU上实现玩具级top-k采样 7. 实现小型MoE调度 + 分组GEMM 8. 将一个自定义算子集成到vLLM或SGLang中,并进行端到端性能分析
查看原文
查看缓存全文

缓存时间: 2026/06/08 11:19

如何开始学习这一切?

第1步:从推理引擎视角入手

  • vLLM:PagedAttention、连续批处理、前缀缓存、CUDA graphs

  • SGLang:RadixAttention/前缀重用、投机解码、MoE、结构化/智能体工作负载

  • TensorRT-LLM:NVIDIA 全栈优化、FP8/FP4、Wide-EP、分离式推理

  • FlashInfer:面向注意力/GEMM/MoE/采样的可复用内核/算子库

第2步:深入技术栈底层

  • Triton 教程 → 自定义融合内核

  • CUTLASS/CuTe → Tensor Core GEMM 与 Blackwell/Hopper 细节

  • FlashAttention 论文 → 注意力算法与内核协同设计

  • PagedAttention 论文 → KV-cache 内存管理

  • MoE 文档 → 路由 + 分组 GEMM + all-to-all

  • Nsight 性能分析 → 告别猜测

第3步:完成以下迷你项目序列

  1. 使用 Triton 实现 RMSNorm,并与 PyTorch 对比

  2. 实现融合 SiLU × gate

  3. 实现简单的 FP16 矩阵乘法,并与 cuBLAS/rocBLAS 对比

  4. 实现分页 KV 查找用于解码注意力

  5. 添加带逐块缩放的 FP8 KV cache

  6. 在 GPU 上实现简易 top-k 采样

  7. 实现小型 MoE 分发 + 分组 GEMM

  8. 将一个自定义算子集成到 vLLM 或 SGLang 中,并做端到端性能剖析

我会在本周尝试整理一些实用的内容。

相似文章

大语言模型与本地AI硬件的推理引擎(2026版)

X AI KOLs

本文提供了一份全面的指南,针对2026年本地AI硬件上的大语言模型推理引擎,解释了如何根据硬件策略、工作负载和服务模型进行选择,并涵盖了诸如llama.cpp、MLX、ExLlamaV2/3、vLLM、SGLang、TensorRT-LLM和NVIDIA Dynamo等引擎。