AugServe:面向增强型大语言模型推理服务的自适应请求调度
摘要
AugServe 提出了一种状态感知的请求调度框架,具有动态批处理级别的 token 预算,以缓解队头阻塞并提高增强型 LLM 推理服务的有效吞吐量,相比 vLLM 实现了高达 6.5 倍的吞吐量提升。
arXiv:2512.04013v3 公告类型:replace
摘要:随着在 Web 应用中集成外部工具的增强型大语言模型(LLM)日益流行,提升增强型 LLM 推理服务效率并优化服务等级目标(SLO)对于改善用户体验至关重要。为此,推理系统必须在延迟约束内最大化请求处理能力,即提高有效吞吐量。然而,现有系统面临两大挑战:(i)依赖先来先服务(FCFS)调度导致严重的队头阻塞,使得许多请求的排队延迟超过 SLO;(ii)静态批处理 token 限制无法适应负载和硬件条件的波动。这两个因素都会降低有效吞吐量和服务质量。
本文提出了 AugServe,一种高效的推理框架,旨在减少排队延迟并提高增强型 LLM 推理服务的有效吞吐量。AugServe 的核心思想是一种两阶段自适应请求调度策略。具体而言,AugServe 结合增强型 LLM 请求的推理特征来优化调度决策的顺序(第一阶段)。这些决策随着运行时信息不断优化(第二阶段),适应请求特性和系统能力。此外,AugServe 根据硬件状态和实时负载动态调整 token 批处理机制,进一步提升吞吐性能。实验结果表明,与 vLLM 和 InferCept 相比,AugServe 的有效吞吐量分别提高了 4.7 倍和 3.3 倍,同时首 token 生成时间(TTFT)分别降低了高达 96.3% 和 95.0%。
查看缓存全文
缓存时间: 2026/07/13 08:01
# 面向增强大语言模型推理服务的自适应请求调度 来源:https://arxiv.org/html/2512.04013 Zhen Jin, Zhenqian Chen, Jiexiong Xu, Wenhai Lin, Yiquan Chen, Wenzhi Chen ###### 摘要 在推理服务中,能够调用外部工具的增强大语言模型(Augmented Large Language Models, LLMs)日益普及。然而,在严格的服务级别目标(SLO)约束下,这种增强给推理效率带来了显著挑战。现有推理系统对外部调用引起的动态执行行为不敏感,并依赖固定的批级别令牌预算,导致严重的队头(HoL)阻塞,有效吞吐量大幅下降。我们提出 **AugServe**,一个高效的增强LLM推理服务框架,可缓解请求排队延迟,并在涉及外部调用的工作负载下提升有效吞吐量。AugServe 集成了状态感知的请求调度与动态批级别令牌预算,以适应异构请求及其动态变化的执行状态。实验结果表明,AugServe 的有效吞吐量分别比 vLLM 和 INFERCEPT 高出 6.5 倍和 4.7 倍。 机器学习,ICML ## 1 引言 增强大语言模型(Augmented LLMs)已成为现代LLM推理服务中一种前景广阔的范式(Abhyankar et al., 2024 (https://arxiv.org/html/2512.04013#bib.bib22);Hao et al., 2023 (https://arxiv.org/html/2512.04013#bib.bib7))。与依赖固定预训练参数、缺乏实时知识的传统纯文本LLM(Schick et al., 2023 (https://arxiv.org/html/2512.04013#bib.bib5);Gade et al., 2025 (https://arxiv.org/html/2512.04013#bib.bib18))不同,增强LLM通过在推理过程中调用外部工具(例如Web API、数据库或专用模型)来扩展其能力(Chen et al., 2024b (https://arxiv.org/html/2512.04013#bib.bib3);Go and Park, 2025 (https://arxiv.org/html/2512.04013#bib.bib8);Qin et al., 2024a (https://arxiv.org/html/2512.04013#bib.bib10);Lu et al., 2024 (https://arxiv.org/html/2512.04013#bib.bib4))。这种方法使增强LLM能够执行更复杂的任务,如算术计算(Chen et al., 2024a (https://arxiv.org/html/2512.04013#bib.bib16);Yao and Yadav, 2025 (https://arxiv.org/html/2512.04013#bib.bib15))、实时信息检索(Su et al., 2024 (https://arxiv.org/html/2512.04013#bib.bib17);Gade et al., 2025 (https://arxiv.org/html/2512.04013#bib.bib18))以及Web交互(Qi et al., 2025 (https://arxiv.org/html/2512.04013#bib.bib13);Zhang et al., 2025 (https://arxiv.org/html/2512.04013#bib.bib14))。 参考图注 图 1:增强LLM推理过程。 增强LLM推理服务系统正成为以AI为中心的云计算的关键基础设施,推理效率直接影响用户体验。图 1 (https://arxiv.org/html/2512.04013#S1.F1) 展示了增强LLM推理服务的工作流程(Abhyankar et al., 2024 (https://arxiv.org/html/2512.04013#bib.bib22);Gim et al., 2024 (https://arxiv.org/html/2512.04013#bib.bib23)): (i) 推理过程中,增强LLM识别到实时信息需求,并触发相应的工具调用。 (ii) 推理过程暂停,等待外部增强模块的响应。 (iii) 响应返回后,服务系统将其追加到已生成的序列中,并恢复正常的生成过程。 理想情况下,推理系统必须同时实现高吞吐量和低延迟。在此背景下,**服务级别目标(SLO)** 作为严格的延迟边界(例如,要求首令牌时间(TTFT)低于某个固定阈值)(Gao et al., 2025 (https://arxiv.org/html/2512.04013#bib.bib20);Zhong et al., 2024 (https://arxiv.org/html/2512.04013#bib.bib29);Wu et al., 2023 (https://arxiv.org/html/2512.04013#bib.bib19);Patel et al., 2025 (https://arxiv.org/html/2512.04013#bib.bib42))。因此,系统效率的最佳衡量指标是**有效吞吐量**(或**好吞吐量**),定义为单位时间内成功满足这些SLO要求的请求数量(Wang et al., 2025 (https://arxiv.org/html/2512.04013#bib.bib38);Karthik et al., 2024 (https://arxiv.org/html/2512.04013#bib.bib39);Zhang et al., 2023 (https://arxiv.org/html/2512.04013#bib.bib40))。 现有最先进的推理系统专注于提升推理性能。vLLM(Kwon et al., 2023 (https://arxiv.org/html/2512.04013#bib.bib21))已成为高效LLM服务的事实标准。然而,在增强LLM推理中,vLLM将外部调用视为请求终止,并丢弃请求的上下文(即键值缓存(KV cache))(Abhyankar et al., 2024 (https://arxiv.org/html/2512.04013#bib.bib22))。当调用返回时,系统必须重新计算KV cache,导致大量计算开销和处理延迟。为了解决这个问题,INFERCEPT(Abhyankar et al., 2024 (https://arxiv.org/html/2512.04013#bib.bib22))根据调用持续时间和上下文长度动态管理上下文,选择三种KV cache处理策略之一:丢弃、保留在GPU内存中,或交换到主机内存。这种设计减少了资源浪费,显著提高了增强LLM推理的效率。 然而,这些系统在提升增强LLM推理的好吞吐量方面仍面临两个挑战: C1:调度不足导致队头(HoL)阻塞和SLO违反。 在增强LLM推理中,现有系统(如vLLM和INFERCEPT)通常采用先来先服务(FCFS)调度,将请求批量处理而不考虑外部调用。当长请求触发外部调用并暂停执行时,其上下文(KV cache)可能保留在GPU内存中、交换到主机内存或丢弃,这些都会阻塞后续的短请求。这导致严重的HoL阻塞,造成超过SLO的排队延迟,从而急剧降低好吞吐量。一些工作尝试基于请求长度使用近似最短作业优先(SJF)调度来缓解这些延迟(Jin et al., 2023 (https://arxiv.org/html/2512.04013#bib.bib37);Fu et al., 2024 (https://arxiv.org/html/2512.04013#bib.bib43);Wu et al., 2023 (https://arxiv.org/html/2512.04013#bib.bib19))。然而,它们仍然忽略了外部调用引入的执行异构性,对于增强LLM推理来说仍然次优。 C2:固定批级别令牌预算限制了外部调用下的吞吐量。 在增强LLM推理中,外部调用引入暂停请求,其上下文可能占用GPU内存,从而复杂化了批容量选择。静态的批级别令牌预算无法适应这种动态内存可用性。小的预算限制了每次迭代的并发性并降低吞吐量,而过大的预算则引发资源争用,并频繁驱逐暂停上下文,导致重新计算开销。此外,现有方法(Zheng et al., 2025 (https://arxiv.org/html/2512.04013#bib.bib49))仅根据空闲GPU内存调整预算,忽略了不同上下文处理策略下的可回收内存,导致预算决策次优。 在本文中,我们提出 **AugServe**,一个增强LLM推理服务框架,共同重新思考请求排序和批容量。我们的关键洞察是,增强LLM推理引入了显著的执行异构性,其中具有不同外部调用和上下文处理策略的请求在多个阶段表现出不同的资源需求。基于这一洞察,AugServe 采用统一的、状态感知的设计,优化请求调度和批级别容量适应,以在动态增强LLM工作负载下最大化好吞吐量。 对于**状态感知调度(C1)**,AugServe 对整个推理生命周期中的请求调度进行建模,明确捕获外部调用引起的多阶段执行和跨轮次状态演变。调度优先级以状态感知的方式构建,适应每个请求的执行状态、上下文处理结果以及观察到的运行时反馈。通过优先考虑在当前执行阶段和资源占用下具有更高执行效率的请求,AugServe 缓解了增强LLM推理中的HoL阻塞,显著减少了排队延迟并提高了好吞吐量。 对于**动态批级别令牌预算(C2)**,AugServe 根据可用的GPU内存以及在不同上下文处理策略下暂停请求的可回收内存来调整批容量。此外,AugServe 强制执行有界的预算调整以确保鲁棒性。 我们使用vLLM实现了AugServe,并在多个LLM和GPU平台上将其与vLLM和INFERCEPT进行了评估。实验结果表明,AugServe 在延迟和有效吞吐量方面均持续优于两种基线。特别是,AugServe 的有效吞吐量几何平均值比 vLLM 和 INFERCEPT 分别高出 6.5 倍和 4.7 倍,同时平均降低 TTFT 95.6% 和 96.0%。 总之,我们的贡献如下: - • 我们提出了 AugServe,一个增强LLM推理服务框架,有效提高有效吞吐量(§5 (https://arxiv.org/html/2512.04013#S5))。 - • 我们提出了一种自适应的状态感知请求调度策略,根据请求特征、外部调用引起的执行状态和运行时反馈优化请求排序。(§5.2 (https://arxiv.org/html/2512.04013#S5.SS2),§5.3 (https://arxiv.org/html/2512.04013#S5.SS3)) - • 我们开发了一种动态批级别令牌预算机制,适应空闲和可回收内存。(§5.4 (https://arxiv.org/html/2512.04013#S5.SS4)) - • 我们进行了广泛的评估,以验证 AugServe 的有效性(§6 (https://arxiv.org/html/2512.04013#S6))。 ## 2 背景 我们回顾增强LLM和现有推理系统。 ### 2.1 增强大语言模型 增强LLM在推理过程中集成外部工具(例如远程API、数据库、外部模型)(Chen et al., 2024b (https://arxiv.org/html/2512.04013#bib.bib3);Schick et al., 2023 (https://arxiv.org/html/2512.04013#bib.bib5);Lu et al., 2024 (https://arxiv.org/html/2512.04013#bib.bib4);Go and Park, 2025 (https://arxiv.org/html/2512.04013#bib.bib8)),在算术计算(Hao et al., 2023 (https://arxiv.org/html/2512.04013#bib.bib7);Chen et al., 2024a (https://arxiv.org/html/2512.04013#bib.bib16);Yao and Yadav, 2025 (https://arxiv.org/html/2512.04013#bib.bib15))和实时信息检索(Su et al., 2024 (https://arxiv.org/html/2512.04013#bib.bib17);Gade et al., 2025 (https://arxiv.org/html/2512.04013#bib.bib18))等复杂任务中表现出卓越性能。此外,随着使用工具的智能体的兴起(Patil et al., 2025 (https://arxiv.org/html/2512.04013#bib.bib47);Wöllein et al., 2025 (https://arxiv.org/html/2512.04013#bib.bib48))以及通过模型上下文协议(MCP)实现标准化工具交互(Anthropic, 2024 (https://arxiv.org/html/2512.04013#bib.bib26)),工具调用已成为推理管线的普遍组成部分(Fei et al., 2025 (https://arxiv.org/html/2512.04013#bib.bib1);Mialon et al., 2023 (https://arxiv.org/html/2512.04013#bib.bib9))。因此,增强LLM推理系统正成为下一代云平台的核心基础设施。 ### 2.2 现有LLM推理系统 LLM推理已成为现代数据中心的主导工作负载,推动了高级系统设计以提高整体效率。为了处理不同的请求序列长度,Orca(Yu et al., 2022 (https://arxiv.org/html/2512.04013#bib.bib27))引入了迭代级调度,这已成为最先进推理引擎的事实标准。同时,为了提高GPU内存利用率,vLLM(Kwon et al., 2023 (https://arxiv.org/html/2512.04013#bib.bib21))提出了PagedAttention以消除内存碎片。此外,一些研究探索将KV cache卸载到CPU或SSD(Jeong and Ahn, 2025 (https://arxiv.org/html/2512.04013#bib.bib30);Hu et al., 2025b (https://arxiv.org/html/2512.04013#bib.bib32);Sheng et al., 2023 (https://arxiv.org/html/2512.04013#bib.bib33))以缓解GPU内存瓶颈。 然而,在增强LLM推理中,大多数先前的工作在外部调用期间简单地丢弃上下文(KV cache)。INFERCEPT(Abhyankar et al., 2024 (https://arxiv.org/html/2512.04013#bib.bib22))通过根据外部调用持续时间和上下文长度动态选择**保留**、**丢弃**或**交换**上下文处理策略来改进这些方法: - • **保留**:KV cache保留在GPU内存中,响应返回后恢复解码。 - • **丢弃**:KV cache被丢弃,响应返回后需要重新计算。 - • **交换**:KV cache交换到CPU内存,响应返回后恢复到GPU内存。 这种自适应设计避免了依赖单一策略的低效,减少了内存浪费和推理延迟。 ## 3 动机 在增强LLM推理中,请求是异构的且涉及多轮外部调用,在SLO约束下最大化好吞吐量具有挑战性。本节分析现有方法的关键局限性。 ### 3.1 现有调度策略的局限性 挑战1:现有的推理调度策略在动态增强LLM服务中难以奏效。 当前的推理系统通常采用FCFS调度,按到达顺序批量处理请求,而不考虑外部调用。在增强LLM推理中,为外部调用暂停请求(无论上下文是保留、交换还是丢弃)会阻塞后续短查询。这导致严重的HoL阻塞,增加延迟并降低好吞吐量。 为了缓解HoL阻塞,先前的工作探索了基于请求长度的近似SJF调度(Jin et al., 2023 (https://arxiv.org/html/2512.04013#bib.bib37);Fu et al., 2024 (https://arxiv.org/html/2512.04013#bib.bib43);Wu et al., 2023 (https://arxiv.org/html/2512.04013#bib.bib19))。虽然这些方法优于FCFS(图 2 (https://arxiv.org/html/2512.04013#S3.F2)),但它们没有考虑外部调用,在增强LLM推理中仍然无法满足SLO,TTFT经常超过SLO(例如1秒),尾部延迟高,在高负载下好吞吐量下降。 最近的系统(Shahout et al., 2025b (https://arxiv.org/html/2512.04013#bib.bib46))提出了基于内存的SJF启发式方法,通过内存成本近似作业大小。然而,这些方法在每个执行轮次做出一次性调度决策,将外部调用后的请求视为新到达的作业。因此,它们没有建模增强LLM工作负载中动态的、跨轮次的执行阶段(图 5 (https://arxiv.org/html/2512.04013#S4.F5)),忽略了累积上下文和外部调用返回长度带来的恢复成本。 此外,我们观察到,外部调用时的累积上下文长度以及外部调用返回长度变化很大(图 4 (https://arxiv.org/html/2512.04013#S3.F4))。这种可变性导致在不同上下文处理策略下,外部调用后的动态恢复成本,这些策略具有不同的内存占用和重新计算开销。而且,变化的返回长度显著影响TTFT和好吞吐量(图 4 (https://arxiv.org/html/2512.04013#S3.F4))。这些因素共同使得现有调度策略对于增强LLM推理来说次优。 参考图注 图 2:SJF在好吞吐量(有效吞吐量)和TTFT方面优于FCFS,但在高负载下仍然次优。 机会1:增强
相似文章
深入vLLM:高吞吐量LLM推理系统剖析(2025)
深入探讨vLLM用于高吞吐量LLM推理的架构与组件,涵盖调度、分页注意力、连续批处理、高级特性、扩展、服务及基准测试。
基于 PagedAttention 的大语言模型服务高效内存管理
本文介绍了 PagedAttention,这是一种受虚拟内存分页技术启发的算法,以及 vLLM,这是一种通过减少键值缓存中的内存碎片来显著提高大语言模型吞吐量的服务系统。
BlockServe: 块粒度连续批处理实现高吞吐扩散大语言模型服务
BlockServe 引入了块粒度连续批处理来解决扩散大语言模型中的收敛异质性,相比 Fast-dLLM 实现了 1.9–10.6 倍的吞吐量提升,同时保持生成质量。
@AndrewYNg:全新课程:高效部署 LLM——如何以低延迟、合理成本为大量并发用户提供模型服务…
Andrew Ng 与 DeepLearning.AI 联合 Red Hat 推出了一门关于使用 vLLM 进行高效 LLM 推理的短期课程,内容涵盖量化、PagedAttention、连续批处理以及大规模 LLM 服务的性能基准测试。
SOMA:通过小语言模型实现高效的 LLM 多轮对话服务
本文介绍了 SOMA,这是一种高效的 LLM 多轮对话服务框架,它利用经过软提示和 LoRA 微调适配的小语言模型来降低延迟和成本。