标签
本文介绍了vLLM,一款用于大语言模型的高吞吐量推理引擎,并详细说明了其在PyTorchCon北美会议上的会议和活动。
这篇文章介绍了 1Cat-vLLM,这是一个针对 NVIDIA V100 GPU 优化的 vLLM 分支,并将其性能与 llama.cpp 进行比较,用于服务像 Qwen3.6-35b 这样的大型语言模型。
本文解释了RadixAttention,这是SGLang中的一项技术,使用基数树来高效缓存和重用AI服务中跨分支请求的重叠KV缓存。
Nicolò Lucchesi将在2026年PyTorch北美大会上,介绍与AWS和RedHat合作的关于vLLM中面向混合模型的解耦服务演进的成果。
一个新的vLLM分支为较旧的AMD MI100 GPU上的Qwen3.8 27B引入全面的INT8优化,实现高达972 tokens/秒的吞吐量,并进行严格的精度验证。
vLLM引入了一个原生的分片权重传输引擎,使用Ray Direct Transport (RDT)来在大规模在线强化学习环境中进行高效的权重同步,从而提升像Kimi K2这样的模型的性能。
本文介绍了一种优化 DeepSeek-V4-Pro(一个1.6万亿参数的 MoE 模型)在 H20 GPU 上服务的方法,通过场景特定的配置和优化实现了显著的性能提升。