迈向多模型LLM调度器:关于卸载和抢占的实证洞见

arXiv cs.AI 论文

摘要

本文对在共享异构硬件上调度多个LLM进行了实证研究,重点关注CPU-GPU卸载和抢占的性能影响。研究发现,卸载会导致非线性的解码吞吐量下降,尤其是对于较小的模型,而抢占开销主要由模型状态重载主导,为未来多模型调度器的设计提供了指导。

arXiv:2605.19593v1 Announce Type: new 摘要:现代大型语言模型(LLM)的部署越来越多地需要在共享的异构硬件上服务多种不同架构、大小和专门化的模型。这种场景给资源分配、调度和排程带来了新的挑战,尤其是在GPU内存受限的情况下,部分CPU-GPU卸载和抢占变得必要。虽然现有系统主要优化单个模型的吞吐量,但在这些条件下针对多模型调度的研究相对较少。本文对不同LLM在硬件平台上的表现进行了实证研究,重点关注层卸载和抢占的性能影响。我们表明,卸载会导致解码吞吐量发生强烈的非线性和模型相关的下降,其中较小的模型对GPU驻留减少表现出更尖锐的敏感性。我们进一步证明,抢占会带来巨大的开销,主要由模型状态重载而非键值缓存传输主导,并且这种成本在不同模型和硬件平台之间差异显著。此外,我们强调了序列长度和互连带宽在加剧数据传输和执行效率低下中的作用。基于这些发现,我们确定了一系列未来调度器必须考虑的关键特性,包括模型特定的卸载敏感性、工作负载特性以及抢占和数据传输的成本结构。这些见解为设计能够高效管理异构多模型工作负载并支持CPU-GPU混合执行的下一代LLM服务系统提供了指导。
查看原文

相似文章

基于阈值的LLM推理独占批处理

arXiv cs.AI

本文分析了混合批处理与独占批处理在LLM推理中的权衡,表明最优选择取决于GPU内存带宽。提出了一种基于阈值的混合调度器,可在两种方法间动态切换,在带宽受限的GPU上实现高达41.9%的吞吐量提升。