KVServe: 面向服务的KV缓存压缩,用于通信高效的分离式LLM服务

Hugging Face Daily Papers 论文

摘要

KVServe是一个服务感知框架,用于分离式LLM服务中的自适应KV缓存压缩,实现了高达9倍的作业完成时间加速和32倍的首Token时间降低。

大型语言模型已在生产环境中广泛采用,将推理系统推向极限。分离式LLM服务(例如,预填充-解码分离和KV状态解耦)提升了可扩展性和成本效益,但同时也将KV缓存转变为跨越网络和存储边界的显式负载,使其成为端到端的核心瓶颈。现有的KV压缩通常是静态运行时配置,而生产服务上下文在工作负载组合、带宽以及服务水平目标/质量预算方面会随时间变化。因此,固定的选择可能是次优的,甚至会增加延迟。我们提出了KVServe,这是首个面向服务且自适应的KV通信压缩框架,专为分离式LLM服务设计:KVServe(1)将KV压缩统一为模块化策略空间,包含新组件和跨方法重新组合;(2)引入贝叶斯性能剖析引擎,高效搜索该空间并提炼出3D帕累托候选集,将离线搜索开销降低50倍;(3)部署服务感知的在线控制器,结合分析延迟模型与轻量级多臂赌博机,在约束条件下选择配置并纠正离线到在线的不匹配。集成到vLLM中,并在多个数据集、模型、GPU和网络上进行评估,KVServe在预填充-解码分离服务中实现了高达9.13倍的作业完成时间加速,在KV解耦服务中实现了高达32.8倍的首Token时间降低。
查看原文
查看缓存全文

缓存时间: 2026/05/22 06:39

论文页面 - KVServe: 服务感知的KV缓存压缩实现通信高效的分离式LLM推理服务

来源:https://huggingface.co/papers/2605.13734 作者:

摘要

KVServe是一个服务感知且自适应的框架,用于优化分离式大型语言模型推理服务中键值通信的压缩,通过动态优化在任务完成时间和首令牌延迟方面实现显著改进。

大型语言模型(LLM)在生产环境中被广泛采用,将推理系统推向极限。分离式LLM推理服务(如PD分离和KV状态分离)提升了可扩展性和成本效率,但也将KV变为跨越网络和存储边界的显式负载,使KV成为端到端的主要瓶颈。现有的KV压缩通常是静态运行时配置,尽管生产服务环境在工作负载混合、带宽和SLO/质量预算方面随时间变化。因此,固定的选择可能是次优的,甚至会增加延迟。我们提出KVServe,这是第一个服务感知且自适应的KV通信压缩框架,用于分离式LLM推理服务:KVServe (1) 将KV压缩统一到一个模块化的策略空间中,包含新组件和跨方法的重组;(2) 引入贝叶斯性能分析引擎,高效搜索该空间并提炼出三维帕累托候选集,将离线搜索开销降低50倍;(3) 部署服务感知的在线控制器,结合分析延迟模型和轻量级赌博机,在约束条件下选择配置并纠正离线与在线的不匹配。集成到vLLM中,并在数据集、模型、GPU和网络上进行评估,KVServe在PD分离服务中实现高达9.13倍的JCT加速,在KV分离服务中实现高达32.8倍的TTFT降低。

查看arXiv页面 (https://arxiv.org/abs/2605.13734)查看PDF (https://arxiv.org/pdf/2605.13734)GitHub7 (https://github.com/hpdps-group/KVServe)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.13734)

在您的智能体中获取这篇论文:

hf papers read 2605\.13734

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型关联此论文

在模型README.md中引用 arxiv.org/abs/2605.13734 即可从此页面链接。

引用此论文的数据集0

没有数据集关联此论文

在数据集README.md中引用 arxiv.org/abs/2605.13734 即可从此页面链接。

引用此论文的Spaces0

没有Space关联此论文

在Space README.md中引用 arxiv.org/abs/2605.13734 即可从此页面链接。

包含此论文的收藏集0

没有包含此论文的收藏集

将这篇论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接。

相似文章