迈向多模型LLM调度器:关于卸载和抢占的实证洞见
摘要
本文对在共享异构硬件上调度多个LLM进行了实证研究,重点关注CPU-GPU卸载和抢占的性能影响。研究发现,卸载会导致非线性的解码吞吐量下降,尤其是对于较小的模型,而抢占开销主要由模型状态重载主导,为未来多模型调度器的设计提供了指导。
arXiv:2605.19593v1 Announce Type: new
摘要:现代大型语言模型(LLM)的部署越来越多地需要在共享的异构硬件上服务多种不同架构、大小和专门化的模型。这种场景给资源分配、调度和排程带来了新的挑战,尤其是在GPU内存受限的情况下,部分CPU-GPU卸载和抢占变得必要。虽然现有系统主要优化单个模型的吞吐量,但在这些条件下针对多模型调度的研究相对较少。本文对不同LLM在硬件平台上的表现进行了实证研究,重点关注层卸载和抢占的性能影响。我们表明,卸载会导致解码吞吐量发生强烈的非线性和模型相关的下降,其中较小的模型对GPU驻留减少表现出更尖锐的敏感性。我们进一步证明,抢占会带来巨大的开销,主要由模型状态重载而非键值缓存传输主导,并且这种成本在不同模型和硬件平台之间差异显著。此外,我们强调了序列长度和互连带宽在加剧数据传输和执行效率低下中的作用。基于这些发现,我们确定了一系列未来调度器必须考虑的关键特性,包括模型特定的卸载敏感性、工作负载特性以及抢占和数据传输的成本结构。这些见解为设计能够高效管理异构多模型工作负载并支持CPU-GPU混合执行的下一代LLM服务系统提供了指导。
相似文章
基于阈值的LLM推理独占批处理
本文分析了混合批处理与独占批处理在LLM推理中的权衡,表明最优选择取决于GPU内存带宽。提出了一种基于阈值的混合调度器,可在两种方法间动态切换,在带宽受限的GPU上实现高达41.9%的吞吐量提升。
llama.cpp 在混合专家模型(MoE)和 GPU+CPU 卸载场景下,P 核比 E 核更慢?
观察到在使用 GPU+CPU 卸载运行混合专家模型时,llama.cpp 在 P 核上的运行速度比 E 核慢。
多流大语言模型:通过并行思维、输入与输出流解锁语言模型的潜力
本文提出了多流大语言模型(Multi-Stream LLMs),将基于顺序消息的指令微调转变为并行流处理。这种方法允许语言模型在多个并发数据流中同时进行读取、思考和生成,解决了自主智能体应用中的瓶颈问题。
ModeSwitch-LLM:一种轻量级阶段感知控制器,用于单GPU上的跨模式大语言模型推理
ModeSwitch-LLM 是一种轻量级控制器,将大语言模型推理请求路由到单GPU上合适的固定模式(例如FP16、量化、推测解码),在无需重新训练模型的情况下,实现高达2.10倍的延迟加速和51.7%的能耗降低。
[论文] 面向消费级设备混合CPU-GPU LLM推理的自动化张量调度
本文提出了一种面向消费级设备混合CPU-GPU LLM推理的自动化张量调度方法。