先校准,再路由:面向分离式LLM服务的学习型请求路由实测研究

arXiv cs.AI 论文

摘要

本文针对分离式LLM服务的学习型请求路由进行了实测研究,评估了一种利用准入时特征分配请求的校准路由器,在实际vLLM/NIXL集群上取得了比传统方法更高的平均有效吞吐量。

arXiv:2609.16206v1 公告类型:新 摘要:分离式LLM服务将计算密集型的预填充和内存密集型的解码放置在独立的GPU池上。DistServe、Splitwise和Mooncake等系统实现了快速分离,但路由仍然决定每个请求由哪个实例处理。我们研究了一种路由器,它利用精确提示长度、预测输出长度、准入后KV缓存压力和SLO类别来估计每个实例上的额外完成时间。我们在离散事件模拟器中开发了该策略,并在八个运行vLLM引擎的NVIDIA A40 GPU上进行了验证,使用NIXL在池间传输KV缓存。所有工作负载都在实测饱和状态下运行。在三个混合、突发的到达追踪中,校准路由器实现了最高的平均有效吞吐量0.864,而轮询、最少负载和长度启发式方法分别为0.835到0.847。它还在追踪间显示出最低的方差。它在所有三个追踪中击败了轮询和长度启发式方法,在两个追踪中击败了最少负载。在第三个追踪中,它落后0.003,在运行间噪声范围内。硬件校准很重要:模拟器导出的常数导致了4.5个有效吞吐点的损失和大约40%的尾延迟优势,使得评分器几乎等同于队列计数。收益随解码池大小和流量异质性增长,但在只有三个实例的池中消失,此时队列计数通常就足够了。在极端稀缺情况下,贪婪成本最小化将请求集中在成本最低的评分实例上,而盲目分散表现更好。使用校准成本,学习路由器仅用六个GPU就匹配了轮询使用七个GPU的有效吞吐量。
查看原文
查看缓存全文

缓存时间: 2026/09/16 08:57

# 学习型请求路由在离散化LLM服务中的实证研究

来源: https://arxiv.org/html/2609.16206
## 校准与路由:离散化LLM服务中学习型请求路由的实证研究

Srikanta Datta Tumkur, Jay Iyer, Mehar Simhadri, Sai Pavan Kumar, Sai Kapil Kumar, Ramesh Nampelly

###### 摘要

离散化LLM服务将计算密集型的预填充阶段与内存密集型的解码阶段分离到不同的GPU池上,DistServe、Splitwise和Mooncake等系统已实现了该机制的快速运行。然而,该机制并不决定任务分配。每个请求仍需一个预填充实例和一个解码实例,而生产系统通过与请求本身无关的策略做出这一选择。我们直接研究路由策略。路由器根据请求在候选实例上预期的边际完成时间对每个实例进行评分,评分基于四个准入时特征:精确提示长度、预测输出长度、准入后的KV缓存压力以及SLO等级。我们首先在离散事件模拟器中开发该策略,然后在真实的离散化集群上进行端到端验证:八块NVIDIA A40 GPU各运行一个vLLM引擎,KV缓存通过NIXL在池间移动,每种工作负载都在测量的饱和点下驱动。在包含混合突发流量的三个到达轨迹下,校准后的学习型路由器获得了最高的平均有效吞吐量(0.864,而轮询、最少负载和长度启发式分别为0.835至0.847),且在不同轨迹间的方差最小。它在所有三个轨迹上都优于轮询和长度启发式;与最少负载相比,它在两个轨迹上领先,第三个轨迹落后0.003,在运行噪声范围内。进一步的两项结果对这一发现进行了限定。首先,路由器的成本常数必须针对目标硬件进行拟合。使用模拟器推导的常数运行相同的策略会损失4.5个有效吞吐点,并大约丧失40%的尾延迟优势,因为错误的成本模型会使评分器退化为队列计数。其次,路由器的优势取决于其运行位置。优势随解码池宽度和流量异构性增加,在只有三个实例的池中消失(此时队列计数几乎是充分统计量),并在极端稀缺情况下反转(此时贪婪成本最小化会将请求集中到定价最低的实例,而盲目分散表现更好)。学习型路由器用六块GPU达到的吞吐量相当于轮询用七块GPU的水平。

\\@IEEEabskeysecsize

索引术语:\\@IEEEgobblelead离散化服务、预填充、解码、请求路由、学习型调度器、输出长度预测、SLO、有效吞吐量、KV缓存、LLM推理。

## I引言

见图例 图1:研究概述。离散化消除了预填充/解码间的干扰,但留下了通常盲目处理的请求级任务分配决策。学习型路由器根据准入时的请求特征为每个候选实例定价,并在真实的vLLM/NIXL集群上得到验证。
LLM推理请求包含两项不同的任务。第一项任务在一次计算饱和的遍历中读取整个提示;第二项任务逐个生成输出令牌,同时其KV缓存不断在GPU显存中增长。将两者共置于同一GPU会导致干扰[5 (https://arxiv.org/html/2609.16206#bib.bib5), 4 (https://arxiv.org/html/2609.16206#bib.bib4)],因此一系列服务系统现在将它们运行在独立的池上,并通过显式的KV缓存传递连接:DistServe[1 (https://arxiv.org/html/2609.16206#bib.bib1)]、Splitwise[2 (https://arxiv.org/html/2609.16206#bib.bib2)]和Mooncake[3 (https://arxiv.org/html/2609.16206#bib.bib3)]。

阶段的分离产生了一个分离本身无法解决的决策。每个到达的请求必须匹配一个预填充实例和一个解码实例,而这种匹配的质量对于只计数的策略是不可见的。一行聊天对话和一个千令牌的推理追踪对于轮询和最短队列连接来说都是“一个请求”,但它们占据解码槽位的时间相差两个数量级。如果一个长请求被发送到一个仅仅*看起来*空闲的实例,其SLO以及所有排队在其后的任务的SLO都将无法满足。

在准入时获得更好决策所需的信息是可用的且基本免费:提示长度是精确的,输出长度可以估计[9 (https://arxiv.org/html/2609.16206#bib.bib9), 10 (https://arxiv.org/html/2609.16206#bib.bib10)],每个实例的缓存占用可通过一次指标轮询获得,SLO等级随请求一同到达。我们的问题是,使用这四个信号为任务分配定价的路由器是否能在实际硬件上优于基于计数的分配,优势有多大,优势在何处成立,以及哪个信号贡献最大。

我们通过硬件测量来回答这些问题。我们的贡献如下:

1. 1\. 一个边际成本学习型路由器,它根据此请求在该实例上预期的完成时间对每个候选实例进行评分,结合了积压秒数、请求自身的定价工作量、准入后的缓存压力以及SLO严格度(§III (https://arxiv.org/html/2609.16206#S3))。
2. 2\. 一个用于在真实离散化集群上验证路由策略的端到端测试工具:一个路由器代理,通过NIXL KV传输驱动未修改的vLLM引擎,支持每个请求的记录、正确性门控(令牌计数契约、跨GPU贪婪等效性)、每次运行的缓存隔离以及每个工作负载的饱和度搜索(§IV (https://arxiv.org/html/2609.16206#S4))。
3. 3\. 一个带边界限定的实证答案(§V (https://arxiv.org/html/2609.16206#S5)):在混合流量下具有最高的平均有效吞吐量和最低的方差;仅硬件校准就贡献了+4.5个百分点;预测输出长度被识别为关键负载特征;对150%预测器误差具有鲁棒性;以及两个失效区域:窄池和极端稀缺。

## II背景与相关工作

离散化机制。DistServe[1 (https://arxiv.org/html/2609.16206#bib.bib1)]通过分离阶段在TTFT/TPOT目标下优化每GPU的有效吞吐量;Splitwise[2 (https://arxiv.org/html/2609.16206#bib.bib2)]跨硬件池分离,并由集群级调度器连接最短队列;Mooncake[3 (https://arxiv.org/html/2609.16206#bib.bib3)]围绕离散化KV缓存组织集群,并基于缓存局部性、负载和SLO状态进行调度。这些机制已趋成熟;而每个请求的分配策略仍然简单,这正是本文衡量的差距。

实例内部和跨实例的调度。连续批处理[7 (https://arxiv.org/html/2609.16206#bib.bib7)]和分块预填充[5 (https://arxiv.org/html/2609.16206#bib.bib5)]决定引擎内部的执行顺序;Llumnix[6 (https://arxiv.org/html/2609.16206#bib.bib6)]在准入后迁移请求实例;AlpaServe[8 (https://arxiv.org/html/2609.16206#bib.bib8)]在共享GPU上复用模型。我们的决策点更早,位于准入时跨预填充/解码结构的分配,而上述所有方法都将此固定。

输出长度预测。长度估计器范围从基于提示的回归[9 (https://arxiv.org/html/2609.16206#bib.bib9)]到学习排序[10 (https://arxiv.org/html/2609.16206#bib.bib10)];TetriInfer[11 (https://arxiv.org/html/2609.16206#bib.bib11)]和LAPS[12 (https://arxiv.org/html/2609.16206#bib.bib12)]使用预测长度进行调度。我们将预测器视为可更换组件,并测量路由器需要其多少精度,结果表明要求很低。

突发下的鲁棒性。稳态有效吞吐量隐藏了脆弱性;自适应重调度的存在是因为突发会级联[13 (https://arxiv.org/html/2609.16206#bib.bib13)]。我们在测量的饱和点进行评估,并全程报告尾延迟和均值。最近一篇综述涵盖了更广泛的图景[14 (https://arxiv.org/html/2609.16206#bib.bib14)]。

## III路由器

见图例 图2:架构。请求在准入时根据提示长度、预测输出长度、实例级缓存压力和SLO等级进行摘要;路由器选择一个预填充和一个解码实例;预填充产生的KV缓存传输到选定的解码实例;SLO达成情况和实时负载信号反馈给路由器。基线方法仅替换选择规则。
### III-A边际成本评分

对于请求 \(r\),其提示长度 \(p_{r}\)、预测输出长度 \(\hat{o}_{r}\) 和SLO等级 \(s_{r}\),路由器通过估算该请求在该解码候选实例 \(d\) 上预期的完成时间来评分:

\[
\mathrm{cost}(d)=w_{b}\cdot\mathrm{backlog}(d)\cdot\sigma(s_{r}) + w_{s}\cdot\hat{o}_{r}\,\tau_{\mathrm{dec}}\big(1+\rho\cdot\mathrm{press}^{+}(d)\big)\cdot\sigma(s_{r}) + w_{q}\cdot\mathrm{queue}(d),
\]

其中 \(\mathrm{backlog}(d)\) 是已承诺给 \(d\) 的以秒为单位的工作量,\(\tau_{\mathrm{dec}}\) 是硬件的每令牌解码时间,\(\mathrm{press}^{+}(d)\) 是*准入后*的缓存压力,\(\sigma(s_{r})\) 放大严格SLO请求的负载项。预填充候选实例以 \(p_{r}\tau_{\mathrm{pre}}\) 类似方式评分。请求被分配到每个池中成本最小的实例。算法1 (https://arxiv.org/html/2609.16206#alg1) 概述了该过程。

算法1 学习型路由(每次请求准入)
输入:请求 \(r\),预填充池,解码池
\[
\hat{o}_{r}\leftarrow\text{predict\_output\_length}(p_{r})
\]
\[
i_{\text{pre}}\leftarrow\arg\min_{p}\mathrm{cost}_{\mathrm{pre}}(p;p_{r},s_{r})
\]
\[
i_{\text{dec}}\leftarrow\arg\min_{d}\mathrm{cost}_{\mathrm{dec}}(d;\hat{o}_{r},p_{r},s_{r})
\]
在 \(i_{\text{pre}}\) 上预填充;传输KV;在 \(i_{\text{dec}}\) 上解码;记录结果

### III-B校准是方法的一部分

评分器混合了两种量:\(\mathrm{backlog}(d)\) 是以真实秒数观测的,而请求自身的工作量是*定价*的,使用 \(\tau_{\mathrm{dec}}\) 和 \(\tau_{\mathrm{pre}}\)。如果这些常数与部署硬件不匹配,则两项使用不同的单位,规模感知项实际上被静默,评分器退化为队列计数。因此,我们将路由器定义为校准即构成。对目标集群进行五分钟的基准测试(预填充延迟曲线、并发下的解码速率)在路由开始前设置 \(\tau_{\mathrm{pre}}\)、\(\tau_{\mathrm{dec}}\) 和SLO目标。第V-B节 (https://arxiv.org/html/2609.16206#S5.SS2) 测量了跳过此步骤的代价;在我们的测试平台上,模拟器推导的 \(\tau_{\mathrm{dec}}\) 比测量值小7.4倍。

### III-C输出长度预测器

预测器提供 \(\hat{o}_{r}\) 且刻意保持简单。因为其质量不限制系统中的其他东西,我们评估路由器在高达150%相对误差的注入预测器噪声下的表现(§V-H (https://arxiv.org/html/2609.16206#S5.SS8))。

### III-D在模拟中开发,在硬件上评估

策略和特征是在具有显式池、KV传输和SLO统计的确定性离散事件模拟器中开发的。模拟器用于生成假设;论文中的数字并非来自它。§V (https://arxiv.org/html/2609.16206#S5) 中的所有结果均在硬件上测量,我们在模拟与测量行为之间观察到的差异,包括服务模型、常数以及哪些特征重要,本身也有报告(§VI (https://arxiv.org/html/2609.16206#S6))。

## IV测量方法论

### IV-A测试平台

一个节点上的八块NVIDIA A40 GPU,每块运行一个未修改的vLLM 0.12引擎,服务Qwen2.5-3B(BF16, TP=1),KV缓存通过NixlConnector在预填充和解码引擎之间移动。每个引擎的KV预算固定为60,000个令牌。主要拓扑结构是2个预填充+4个解码实例;从3到8块GPU的显式池服务于前沿性和宽度研究。一个FastAPI路由器代理持有策略(逐字从模拟器代码库导入),维护每个实例的实时信号(一个进行中的账本提供积压秒数;缓存占用每50毫秒轮询),执行两步离散化推理,并记录每个请求。

### IV-B协议

三个特性将该工具与基准测试脚本区分开来。*在任何测量前的正确性门控:* 每个请求的精确令牌计数契约;解码GPU间的逐位贪婪输出等效性;每个预填充×解码对的热身(跨冷NIXL对的第一次传输可能不正常,这是合理的)。*运行间的隔离:* 在观察到相同配置因会话排序产生20多点差异后,每次运行前重置每个引擎的前缀缓存。*每个工作负载的饱和度搜索:* 每个工作负载族在轮询处于崩溃中点的到达率下驱动,通过探测找到,因为路由策略仅在竞争下区分。SLO目标(TTFT 175 ms / TPOT 39.7 ms 紧;3倍松)源自与路由器常数相同的校准。每次运行都按请求记录且可恢复。主要实验使用三个到达轨迹。

### IV-C工作负载和基线

四个工作负载族对不同资源施加压力(表I (https://arxiv.org/html/2609.16206#S4.T1))。基线是轮询、最少负载(JSQ)和基于预测长度的阈值启发式方法。

表I:工作负载及其施加的压力。

## V结果

本节所有图表和表格均在§IV (https://arxiv.org/html/2609.16206#S4) 的测试平台上测量。表II (https://arxiv.org/html/2609.16206#S5.T2) 行对三个到达轨迹取平均值。

表II:混合突发流量,三个轨迹,2个预填充+4个解码。学习型路由器在均值上最优,且轨迹间扩散最小。它在所有轨迹上都击败轮询和启发式方法;最少负载在一个轨迹上以0.003的优势微弱胜出。
### V-A混合突发负载下的有效吞吐量

在三个轨迹上,学习型路由器分别获得0.860/0.877/0.855,具有最高的均值和最小的轨迹间扩散,在单个基线微弱胜出的轨迹上,差距为0.003。最少负载说明了大小盲视的代价,平均表现尚可,但在最差轨迹上降至0.795。方差在操作上很重要,因为SLA是基于最坏情况行为制定的,而规模感知策略是这里唯一没有弱轨迹的策略。

### V-B校准的价值

在相同的三个轨迹上,使用模拟器推导的成本常数运行相同的学习策略,平均有效吞吐量为0.819,P99 TTFT为0.42至0.52秒,而校准后的为0.864和0.25至0.30秒。仅校准步骤就价值4.5个有效吞吐点和大约40%的尾延迟优势(§III-B (https://arxiv.org/html/2609.16206#S3.SS2))。每个请求的日志显示了机制:使用错误定价的常数时,路由器几乎完美地平衡了请求*计数*,同时让令牌负载比JSQ更不均衡,即它退化为其本应击败的基线。任何成本模型在模拟中调整的学习型调度器都会默默地继承这种失败模式。

### V-C工作负载异构性的影响

图3 (https://arxiv.org/html/2609.16206#S5.F3) 总结了哪种策略适合哪种工作负载。学习型路由器在

相似文章

UCCI: 校准不确定性实现成本最优的LLM级联路由

arXiv cs.LG

UCCI提出了一种校准优先的路由器,用于LLM级联,它使用等渗回归将令牌级别的边际不确定性映射到错误概率,在生产级NER任务中实现了31%的成本降低,同时保持微F1=0.91,并将期望校准误差从0.12降至0.03。

路由高原:理解并突破LLM路由器的精度极限

arXiv cs.LG

本文识别了一种'路由高原'现象,即多种LLM路由方法收敛到相似的精度,远低于理想路由器,原因是存在一个可预测性瓶颈,限制了针对特定查询的路由。随后,本文展示了更大的数据集、更强的编码器和微调有助于突破这一高原。