超越预测:面向尾延迟的LLM推理调度
摘要
本文提出了一种面向LLM推理的分布感知、无预测调度框架,利用轻量级统计信号以软优先级提升替代显式长度预测。该方法联合优化调度与缓存感知的抢占,以降低尾部延迟,相比具备完美长度知识的SRPT,P99 TTLT最多降低35-50%。
arXiv:2606.18431v1 公告类型:新
摘要:LLM服务展现出极端的长度变异性,使得基于大小的调度在实践中困难重重。最近的LLM调度器使用预测的解码长度或排名来近似SJF/SRPT,并主要报告以均值为中心的指标,如TTFT和TBT。我们表明,这些基于预测的策略在分布偏移、突发到达和GPU内存压力下可能变得脆弱,并且即使拥有完美的解码长度知识,对主导用户体验的尾部延迟(P90-P99)的控制也有限。我们提出了一种分布感知、无预测的调度框架,用轻量级统计信号驱动的软优先级提升替代显式长度预测。我们的设计联合优化调度和缓存感知的抢占,以考虑跨工作负载混合的内存耦合解码动态。在生产环境和开源追踪数据上的评估表明,相比具备完美长度知识的SRPT,我们的方法将P99 TTLT降低了最高35-50%,并在各工作负载(包括推理密集型与聊天密集型任务)上将TTFT降低了34-47%。这些结果证明了在线LLM服务中优化尾部延迟的一种稳健替代方案。
查看缓存全文
缓存时间: 2026/06/18 05:42
# 超越预测:面向尾部延迟的LLM推理调度 来源:https://arxiv.org/abs/2606.18431 查看 PDF (https://arxiv.org/pdf/2606.18431) > 摘要:LLM服务呈现出极端的长度变化,使得基于大小的调度在实践中困难重重。近期的LLM调度器利用预测的解码长度或排名来近似SJF/SRPT,并主要报告均值类指标,如TTFT和TBT。我们表明,这些预测驱动的策略在分布偏移、突发到达和GPU内存压力下可能变得脆弱,同时即使是完美的解码长度知识,也对其主导用户体验的尾部延迟(P90-P99)的控制能力有限。我们引入了一种分布感知、无需预测的调度框架,该框架用轻量级统计信号驱动的优先级软提升替代了显式的长度预测。我们的设计协同优化了调度和缓存感知的抢占,以考虑跨工作负载混合的内存耦合解码动态。在生产环境和开源追踪上的评估表明,与具有完美长度知识的SRPT相比,我们的方法将P99 TTLT降低了高达35-50%,并且在包含推理密集型和聊天密集型任务的各种工作负载上将TTFT降低了34-47%。这些结果为在线LLM服务中优化尾部延迟提供了一种稳健的替代方案。 ## 提交历史 来自:李悦颖 [查看邮箱 (https://arxiv.org/show-email/7e1d9899/2606.18431)] **\[v1]** 2026年6月16日星期二 19:25:37 UTC (465 KB)
相似文章
基于阈值的LLM推理独占批处理
本文分析了混合批处理与独占批处理在LLM推理中的权衡,表明最优选择取决于GPU内存带宽。提出了一种基于阈值的混合调度器,可在两种方法间动态切换,在带宽受限的GPU上实现高达41.9%的吞吐量提升。
EntMTP:利用熵引导的多令牌预测加速大语言模型推理
提出EntMTP,一种无需训练的调度器,基于局部熵估计自适应调整树形注意力拓扑以进行投机解码,相较于Hydra实现1.09-1.15倍加速,相较于Medusa最高达1.36倍加速。
深入vLLM:高吞吐量LLM推理系统剖析(2025)
深入探讨vLLM用于高吞吐量LLM推理的架构与组件,涵盖调度、分页注意力、连续批处理、高级特性、扩展、服务及基准测试。
Prefilling-dLLM:扩散语言模型中长上下文推理的预测性预填充
本文提出Prefilling-dLLM,一种无需训练的框架,它将前缀分割成块并缓存KV表示,在扩散语言模型的长上下文推理中实现了最先进的质量和高达28倍的加速。
AugServe:面向增强型大语言模型推理服务的自适应请求调度
AugServe 提出了一种状态感知的请求调度框架,具有动态批处理级别的 token 预算,以缓解队头阻塞并提高增强型 LLM 推理服务的有效吞吐量,相比 vLLM 实现了高达 6.5 倍的吞吐量提升。