标签
一篇关于使用 vLLM 高效服务 AI 代理 LLM 推理的教程,涵盖了连续批处理和 PagedAttention 等概念,以解决性能瓶颈。
深入探讨vLLM用于高吞吐量LLM推理的架构与组件,涵盖调度、分页注意力、连续批处理、高级特性、扩展、服务及基准测试。
BlockServe 引入了块粒度连续批处理来解决扩散大语言模型中的收敛异质性,相比 Fast-dLLM 实现了 1.9–10.6 倍的吞吐量提升,同时保持生成质量。
作者分享了他们在过去6-8个月里在ML系统和AI基础设施方面的工作,包括一个轻量级的Python LLM推理引擎(tachyon),在消费级硬件上通过连续批处理和前缀缓存实现了每秒600+ tokens,还有关于CUDA/CUTE DSL和集体通信的博客文章,以及对SGLang和vLLM的贡献。
一篇详细阐述LLM推理关键概念的推文:注意力机制、KV缓存、分块预填充以及批处理技术,包括vLLM和SGLang中使用的连续批处理。
一篇介绍连续批处理的博客文章,该技术通过动态地将新请求添加到已完成请求的批次中,持续保持GPU忙碌并减少空闲时间,从而提高LLM服务吞吐量。
推荐了一篇关于LLM服务、推理基础以及VLLM(涵盖分页注意力和连续批处理)的介绍。
连续批处理已添加到TRL的GRPO中,提高了速度并减少了VRAM使用,无需vLLM。推文解释其工作原理及适用时机。
zml/llmd现已完全在Apple的Metal API上运行,以完整bf16精度服务8个并发请求,并支持连续批处理等现代功能。
本文基于SGLang Omni团队的内部决策文章,从自回归解码、KV缓存、连续批处理等基础概念出发,深入浅出地介绍了LLM推理系统的运作原理。
dlmserve 是首个面向扩散语言模型的开源服务引擎,提供兼容 OpenAI 的 API、持续批处理功能,在 12GB VRAM 内即可运行,吞吐量是 Hugging Face 的 2.5 倍。
oMLX 0.3.9rc1,一个为Apple Silicon Mac优化的LLM推理服务器,增加了低内存稳定性、分块预填充、多任务管理聊天等功能。
本文解释了如何为LLM推理实现异步连续批处理,将CPU批处理准备与GPU计算重叠,以最大化利用率并减少空闲时间。