内部部署 LLM 推理在 Kubernetes 上的生产运行手册
摘要
作者分享了在其组织中构建基础设施的经验基础上,用于在 Kubernetes 上部署内部 LLM 推理的运行手册。
我在构建组织基础设施时写了这个。请告诉我你们的想法... https://gd03.me/writings/inference-infra
相似文章
您的LLM推理基准测试在误导您
本文解释了为何LLM推理的合成基准测试可能具有误导性,因为生产流量具有突发性和可变性,并建议使用真实工作负载进行测试以选择正确的推理框架。
大规模LLM推理开放手册(GPU内部机制、KV缓存、批处理、vLLM/SGLang/TensorRT-LLM)[P]
一本正在编写中的开放手册,解释LLM推理内部机制,包括GPU内存层次结构、KV缓存、批处理以及vLLM和TensorRT-LLM等流行推理引擎。
@h100envy: 前vLLM核心贡献者用34分钟解释如何将LLM推理成本降低10倍——比$3000的推理优化训练营更有效
一位前vLLM核心贡献者解释了如何通过LMCache将KV缓存卸载到CPU/SSD/远程存储,从而使LLM推理成本降低10倍,这一技术已被彭博等生产环境采用。
@keigohtr: 来自Netflix。他们的内部LLM服务方法。In-House LLM Serving at Netflix https://netflixtechblog.com/in-house-l…
Netflix分享了他们的内部LLM服务方法,使用vLLM和Triton推理服务器,提供兼容OpenAI的API,并详细介绍了部署策略和生产权衡。
本地LLM推理优化:完整指南
一份关于在消费级硬件上优化本地LLM推理的全面指南,涵盖llama.cpp、vLLM和LM Studio等工具,并提供关于内存层次结构、层放置和常见故障模式的实用建议。