大规模LLM推理开放手册(GPU内部机制、KV缓存、批处理、vLLM/SGLang/TensorRT-LLM)[P]

Reddit r/MachineLearning 工具

摘要

一本正在编写中的开放手册,解释LLM推理内部机制,包括GPU内存层次结构、KV缓存、批处理以及vLLM和TensorRT-LLM等流行推理引擎。

我一直在研究LLM推理的内部机制,并将所学编写成一本正在进展中的开放手册。刚完成了一章关于GPU执行和内存内部机制的内容:为什么GPU在推理期间大部分时间处于空闲状态,内存层次结构如何限制吞吐量,以及真正的瓶颈在哪里。添加了Mermaid图表来展示架构部分,使得流程比大段文字更容易理解。这是一个个人学习项目,仍在逐章完善中。我欢迎任何在生产环境中运行过推理的人提供反馈或纠正,正是我的思维模型出问题的地方,也是我想发现之处。欢迎提交问题和PR。github.com/harshuljain13/llm-inference-at-scale
查看原文

相似文章

大语言模型与本地AI硬件的推理引擎(2026版)

X AI KOLs

本文提供了一份全面的指南,针对2026年本地AI硬件上的大语言模型推理引擎,解释了如何根据硬件策略、工作负载和服务模型进行选择,并涵盖了诸如llama.cpp、MLX、ExLlamaV2/3、vLLM、SGLang、TensorRT-LLM和NVIDIA Dynamo等引擎。

LLMs 101:实用指南(2026年版)

X AI KOLs

一份关于LLMs的全面实用指南,涵盖推理机制、令牌、Transformer、KV缓存、本地部署硬件和量化,截至2026年5月。

本地LLM推理优化:完整指南

Reddit r/LocalLLaMA

一份关于在消费级硬件上优化本地LLM推理的全面指南,涵盖llama.cpp、vLLM和LM Studio等工具,并提供关于内存层次结构、层放置和常见故障模式的实用建议。