ModeSwitch-LLM:一种轻量级阶段感知控制器,用于单GPU上的跨模式大语言模型推理
摘要
ModeSwitch-LLM 是一种轻量级控制器,将大语言模型推理请求路由到单GPU上合适的固定模式(例如FP16、量化、推测解码),在无需重新训练模型的情况下,实现高达2.10倍的延迟加速和51.7%的能耗降低。
查看缓存全文
缓存时间: 2026/05/25 08:59
# ModeSwitch-LLM:面向单GPU跨模式LLM推理的轻量级相位感知控制器 来源:https://arxiv.org/html/2605.23057 Aman Sunesh 纽约大学阿布扎比分校 计算机工程系 阿联酋阿布扎比 as18181@nyu\.edu Ali Alshehhi 纽约大学 库朗数学科学研究所 美国纽约 aa8148@nyu\.edu Hivansh Dhakne 纽约大学 计算机工程系 美国纽约 hd2296@nyu\.edu ###### 摘要 ModeSwitch\-LLM 是一个轻量级的请求边界控制器,旨在通过将每个请求路由到合适的固定推理模式,提高单GPU大语言模型的推理效率。该系统不依赖单一的静态服务配置,而是利用廉价的负载特征,在FP16、量化模式、投机解码以及混合模式(如GPTQ加前缀缓存和INT8加连续批处理)之间进行选择。我们在单张NVIDIA A100 GPU上针对Meta\-Llama\-3\.1\-8B\-Instruct模型评估了ModeSwitch\-LLM。在部署风格的合成负载上,在线控制器相比FP16实现了2\.10×的平均延迟加速比和0\.48×的平均能耗比,对应每个token能耗降低51\.7%。在用作质量关卡的自助基准测试中,准确率与FP16接近,平均差值仅为+0\.17个百分点。我们还评估了轻量级学习路由器,但发现它们并未明显优于基于规则的控制器,因为会引入路由开销,并且更频繁地选择违反质量、能耗或内存约束的模式。这些结果表明,简单的请求感知路由可以在不重新训练模型或改变其架构的情况下,从现有的推理模式中恢复可观的效率。 ## 1 引言 大语言模型推理日益受到限制,不仅受限于模型质量,还受限于服务效率。在单个GPU上,不同的请求类型对系统的压力各不相同:短交互式提示对延迟敏感,长生成请求在解码阶段耗时更多,重复前缀的聊天工作负载可以从缓存复用中获益,而长上下文工作负载则对内存和预填充计算施加更大压力。然而,许多服务设置通常对所有请求类型采用单一的固定推理配置进行评估或部署Yuet al\.\(2022 (https://arxiv.org/html/2605.23057#bib.bib15)\); Kwonet al\.\(2023 (https://arxiv.org/html/2605.23057#bib.bib12)\); Zhenget al\.\(2024 (https://arxiv.org/html/2605.23057#bib.bib16)\),尽管没有单一模式对所有工作负载类型都是最优的。 ModeSwitch\-LLM通过引入一个轻量级的请求边界控制器来解决这个问题,该控制器将每个传入请求路由到合适的固定推理模式。该系统将FP16基线与其他优化模式(如GPTQ 4比特量化、INT8量化、投机解码、前缀缓存、连续批处理和混合配置)进行比较。控制器不修改模型架构或重新训练LLM,而是使用简单的工作负载级特征(例如提示长度、预期输出长度、共享前缀结构、批次压力和内存压力指标),在生成开始前选择高效的服务模式。 本文做出三项贡献。首先,我们在一个通用的单GPU设置下对一组固定的LLM推理模式进行了基准测试,测量了延迟、吞吐量、每个token的能耗、内存和质量。其次,我们提出了一个轻量级的请求边界控制器,利用廉价的工作负载特征和可忽略的CPU开销来路由请求。第三,我们在延迟、能耗、内存和质量约束下比较了基于规则的路由、约束感知的优化路由和学习路由策略。 最终结果表明,简单的请求感知路由可以恢复可观的推理效率,尤其是在部署风格的合成负载上,同时保持接近FP16的基准测试准确率。学习路由器的实验进一步表明,有监督策略可以在一定程度上模仿约束感知的优化路由,但并没有明显优于基于规则的控制器,因为它们引入了路由开销并做出了更多违反约束的选择。这表明轻量级的基于规则的路由已经是一个强有力的实际基线,而学习路由仍然是未来改进的一个有用方向。 ## 2 问题描述 本项目中的核心问题是:LLM推理工作负载是异构的,但推理系统通常使用单一静态的服务模式。对一个工作负载高效的配置可能对另一个低效。例如,投机解码可以改善解码密集型生成,前缀缓存在请求共享重复上下文时有用,量化模式可以减少延迟和能耗,以批处理为导向的模式可以提高吞吐量。然而,选择错误的模式可能会增加延迟、浪费能源或降低输出质量。 因此,本项目旨在探究一个轻量级控制器是否可以通过在请求时选择固定的推理模式来提高单GPU LLM的推理效率。该控制器必须满足三个目标。首先,与FP16基线相比,它应该减少延迟并提高吞吐量。其次,它应该减少每个token的能耗,同时使GPU内存使用量接近FP16。第三,它应该保持输出质量,尤其是在能够直接测量准确率的自动基准测试工作负载上。 为了研究这个问题,我们在合成的部署风格工作负载上评估ModeSwitch\-LLM的效率,在自动基准测试工作负载上评估其质量保持能力。最终目标不是构建一个新的LLM,而是证明实际的请求感知路由可以在最小的运行时开销下,从现有的推理模式中恢复效率。 ## 3 相关工作 现代LLM服务系统通过系统级优化(如连续批处理、分页KV缓存管理和前缀复用)来提高吞吐量和内存效率。Orca引入了迭代级连续批处理,以提高活跃请求间的GPU利用率Yuet al\.\(2022 (https://arxiv.org/html/2605.23057#bib.bib15)\),而vLLM引入了PagedAttention以减少KV缓存碎片并提高服务吞吐量Kwonet al\.\(2023 (https://arxiv.org/html/2605.23057#bib.bib12)\)。SGLang进一步通过RadixAttention利用重复前缀Zhenget al\.\(2024 (https://arxiv.org/html/2605.23057#bib.bib16)\)。这些系统非常有效,但它们通常全局应用一种服务配置,而不是为每个请求选择服务模式。 其他工作则针对推理效率的特定方面。Sarathi\-Serve和DistServe表明预填充和解码阶段存在不同的瓶颈,并且可以从相位感知调度中获益Agrawalet al\.\(2024 (https://arxiv.org/html/2605.23057#bib.bib10)\); Zhonget al\.\(2024 (https://arxiv.org/html/2605.23057#bib.bib17)\)。量化方法(如GPTQ和AWQ)通过提供压缩模型来减少内存带宽和延迟Frantaret al\.\(2022 (https://arxiv.org/html/2605.23057#bib.bib6)\); Linet al\.\(2023 (https://arxiv.org/html/2605.23057#bib.bib7)\)。投机解码通过使用较小的草稿模型生成建议token,再由目标模型验证,从而加速生成过程Leviathanet al\.\(2023 (https://arxiv.org/html/2605.23057#bib.bib8)\)。ModeSwitch\-LLM与这些系统的不同之处在于,它将这些优化视为可选择的服务模式。它不是固定使用一种全局配置,而是利用廉价的请求级特征,将每个请求路由到单个GPU上适当的固定模式。控制器不会在请求内部切换模式;相反,它在生成前估计请求的主要瓶颈(如预填充密集型、解码密集型、共享前缀、批处理或内存压力行为),并选择针对该工作负载类型表现最佳的固定推理模式。 ## 4 方法论 本节描述了用于评估ModeSwitch\-LLM的系统设置、工作负载设计、推理模式、指标和控制器。 ### 4\.1 系统设置 所有实验均在纽约大学Burst集群的单张NVIDIA A100 40GB GPU上运行,使用通过vLLM提供服务的Meta\-Llama\-3\.1\-8B\-Instruct模型。FP16是基准配置,每个优化模式都针对相同的FP16设置进行评估。在计时运行之前,我们清除CUDA缓存并运行预热步骤,以减少残存内存和启动效应的影响。每个工作负载变体聚合多个请求的结果,以减少测量噪声。 ### 4\.2 工作负载设计 我们在两类工作负载上评估推理模式:合成部署风格工作负载和自动基准测试工作负载。 #### 合成工作负载。 合成工作负载使用一个2×2网格,独立变化提示长度和预期输出长度:短提示/短输出(约128个输入token,32个输出token),短提示/长输出(128个输入token,128个输出token),长提示/短输出(1024个输入token,32个输出token),以及长提示/长输出(1024个输入token,128个输出token)。这四种情况代表了延迟敏感的交互式请求、解码密集型生成、预填充密集型请求以及组合的预填充/解码压力测试。 我们还包括了另外两种部署风格的模式。共享前缀聊天工作负载包含重复的上下文(例如常见的系统提示),以测试前缀复用。内存压力长上下文工作负载在GPU内存部分预分配的情况下运行长上下文请求,模拟不太理想的生产服务器环境。 #### 自动基准测试工作负载。 为了更直接地衡量质量,我们运行MMLU\-ProWanget al\.\(2024 (https://arxiv.org/html/2605.23057#bib.bib1)\)、GSM8KCobbeet al\.\(2021 (https://arxiv.org/html/2605.23057#bib.bib2)\)、TruthfulQALinet al\.\(2021 (https://arxiv.org/html/2605.23057#bib.bib3)\)、GPQAReinet al\.\(2023 (https://arxiv.org/html/2605.23057#bib.bib4)\)和MLUHendryckset al\.\(2020 (https://arxiv.org/html/2605.23057#bib.bib5)\)。这些基准测试提供了真实答案,因此它们主要用作质量关卡,而不仅仅是效率工作负载。我们使用相对于FP16的±1\.5个百分点阈值来决定路由模式是否保持了基准测试质量。 ### 4\.3 推理模式 我们评估了十个候选单一模式:FP16基线、INT8量化、GPTQ 4比特Frantaret al\.\(2022 (https://arxiv.org/html/2605.23057#bib.bib6)\)、AWQ 4比特Linet al\.\(2023 (https://arxiv.org/html/2605.23057#bib.bib7)\)、投机解码Leviathanet al\.\(2023 (https://arxiv.org/html/2605.23057#bib.bib8)\)、前缀缓存、分块预填充、连续批处理、CUDA图和KV缓存压缩Zhanget al\.\(2024 (https://arxiv.org/html/2605.23057#bib.bib9)\)。这些模式涵盖了低精度执行、草稿模型加速、重复前缀复用、批处理导向服务、预填充调度和内存压力缓解。 我们还测试了结合互补优化的混合模式。主要的混合模式包括:用于共享前缀工作负载的GPTQ加前缀缓存,以及用于多请求服务的INT8加连续批处理。其他混合模式包含在筛选阶段,但并非最终分析的重点。 ### 4\.4 指标收集 对于每个模式-工作负载对,我们收集总延迟、吞吐量、每个token的能耗、峰值GPU内存和输出质量。总延迟从请求提交到最后一个token到达进行测量。吞吐量是输出token数除以延迟。每个token的能耗通过每50毫秒使用NVML轮询GPU功耗,对功率随时间进行积分,再除以生成的token数来估算。峰值内存使用torch\.cuda\.max\_memory\_allocated\(\)测量。 对于自动基准测试,质量使用基准测试准确率或精确匹配来衡量。对于合成生成工作负载,我们使用相对于参考输出的ROUGE\-L和相对于FP16输出的ROUGE\-L相似度作为轻量级的质量代理。 ### 4\.5 评估协议 所有报告的值均为跨请求和工作负载变体聚合的平均值。延迟加速比是FP16延迟除以模式延迟,因此大于1\.0×的值更好。能耗比和内存比是模式值除以FP16值。更低的能耗比更好,而内存比主要作为安全指标,应保持在1\.0×附近。准确率差值是相对于FP16的百分点变化。选择FP16作为参考基线,因为它代表了部署时默认运行的标准全精度服务配置。本文中的所有效率声明均相对于此基线。 ### 4\.6 控制器设计 在线请求边界控制器在生成开始之前为每个请求选择一个固定的推理模式。它分为三个步骤:特征提取、分类和路由。 #### 特征提取: 控制器在推理前提取六个特征:提示token数、预期输出token数、共享前缀状态、内存压力状态、批次压力级别,以及当请求属于已知基准测试系列时的工作负载标签。所有特征在请求时可用,且提取成本可忽略不计。 #### 分类: 一个轻量级的基于规则的分类器估计请求是批处理类型、共享前缀类型、预填充密集型还是解码密集型。这些类别来源于提示长度、预期输出长度、共享前缀结构和批次压力。我们采用这种基于规则的方法而非学习型分类器,因为产生的策略是可解释的,并且路由开销可忽略不计。此外,第5\.7节显示,这个简单的基于规则的控制器与训练过的路由策略性能相当。 #### 路由策略: 路由器将每个请求映射到五个候选模式之一:GPTQ 4比特、投机解码、GPTQ加前缀缓存、INT8加连续批处理和INT8量化,同时保留FP16作为紧急回退。策略遵循基于基准测试结果的固定优先级顺序: 1. 批处理请求路由到INT8加连续批处理。 2. 共享前缀聊天请求路由到GPTQ加前缀缓存。 3. 内存压力请求路由到GPTQ 4比特。 4. 合成SS、LS和LL请求路由到GPTQ 4比特,这是针对这些工作负载形状最强的平衡模式。 5. 解码密集型、长输出和长数学生成请求路由到投机解码。 6. 多选题和基准测试风格的预填充密集型请求路由到INT8量化,这在评分评估中提供了最佳的准确率-效率权衡。 7. 所有剩余请求默认使用INT8量化,保留FP16作为紧急回退。 测量的CPU路由开销约为每个请求0\.0096毫秒,相对于推理延迟可以忽略不计。该策略是确定性的且可解释的:每个路由决策都可追溯到测量的固定模式或混合模式结果。 #### 学习型控制器基线: 我们还训练了决策树、随机森林和逻辑回归分类器,以模仿一个约束感知的优化路由,该路由选择满足质量、能耗和内存约束的最快模式。这些学习型控制器测试了监督路由是否能超越基于规则的策略。 ## 5 实验结果 本节报告了ModeSwitch\-LLM的主要实证发现。除非另有说明,所有效率结果均相对于FP16。GPU内存主要作为安全指标处理,因为优化模式在此设置中并未显著减少内存使用。 ### 5\.
相似文章
EnergyLens: 面向多GPU大语言模型推理优化的预测性能耗感知探索
EnergyLens是一个端到端的框架,用于多GPU大语言模型推理的预测性能耗感知优化,在Llama3和Qwen3-MoE上验证,平均绝对百分比误差在9.25%至13.19%之间,并揭示了不同配置之间显著的能耗差异。
基于阈值的LLM推理独占批处理
本文分析了混合批处理与独占批处理在LLM推理中的权衡,表明最优选择取决于GPU内存带宽。提出了一种基于阈值的混合调度器,可在两种方法间动态切换,在带宽受限的GPU上实现高达41.9%的吞吐量提升。
利用适度非结构化稀疏权重矩阵加速大语言模型的GPU推理
本文提出了一种针对具有适度非结构化稀疏性的大语言模型的高效GPU推理方法。引入了一种三层矩阵存储格式和一个联合利用稀疏张量核心与CUDA核心的SpMM内核,实现了相比SpInfer最高1.64倍的内核级加速,以及相比FlashLLM最高1.41倍的端到端加速。
迈向多模型LLM调度器:关于卸载和抢占的实证洞见
本文对在共享异构硬件上调度多个LLM进行了实证研究,重点关注CPU-GPU卸载和抢占的性能影响。研究发现,卸载会导致非线性的解码吞吐量下降,尤其是对于较小的模型,而抢占开销主要由模型状态重载主导,为未来多模型调度器的设计提供了指导。
利用移动NPU的高效端侧扩散大语言模型推理
本文提出了llada.cpp,一种NPU感知推理框架,用于在智能手机上加速扩散大语言模型(dLLM)。它引入了三种技术——Multi-Block Speculative Decoding、Dual-Path Progressive Revision和Swap-Optimized Memory Runtime——以使dLLM推理与移动NPU特性对齐,实现了相比CPU基线17-42倍的延迟降低。