KVServe: 面向服务的KV缓存压缩,用于通信高效的分离式LLM服务
摘要
KVServe是一个服务感知框架,用于分离式LLM服务中的自适应KV缓存压缩,实现了高达9倍的作业完成时间加速和32倍的首Token时间降低。
查看缓存全文
缓存时间: 2026/05/22 06:39
论文页面 - KVServe: 服务感知的KV缓存压缩实现通信高效的分离式LLM推理服务
来源:https://huggingface.co/papers/2605.13734 作者:
,
,
,
,
,
,
,
,
,
,
摘要
KVServe是一个服务感知且自适应的框架,用于优化分离式大型语言模型推理服务中键值通信的压缩,通过动态优化在任务完成时间和首令牌延迟方面实现显著改进。
大型语言模型(LLM)在生产环境中被广泛采用,将推理系统推向极限。分离式LLM推理服务(如PD分离和KV状态分离)提升了可扩展性和成本效率,但也将KV变为跨越网络和存储边界的显式负载,使KV成为端到端的主要瓶颈。现有的KV压缩通常是静态运行时配置,尽管生产服务环境在工作负载混合、带宽和SLO/质量预算方面随时间变化。因此,固定的选择可能是次优的,甚至会增加延迟。我们提出KVServe,这是第一个服务感知且自适应的KV通信压缩框架,用于分离式LLM推理服务:KVServe (1) 将KV压缩统一到一个模块化的策略空间中,包含新组件和跨方法的重组;(2) 引入贝叶斯性能分析引擎,高效搜索该空间并提炼出三维帕累托候选集,将离线搜索开销降低50倍;(3) 部署服务感知的在线控制器,结合分析延迟模型和轻量级赌博机,在约束条件下选择配置并纠正离线与在线的不匹配。集成到vLLM中,并在数据集、模型、GPU和网络上进行评估,KVServe在PD分离服务中实现高达9.13倍的JCT加速,在KV分离服务中实现高达32.8倍的TTFT降低。
查看arXiv页面 (https://arxiv.org/abs/2605.13734)查看PDF (https://arxiv.org/pdf/2605.13734)GitHub7 (https://github.com/hpdps-group/KVServe)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.13734)
在您的智能体中获取这篇论文:
hf papers read 2605\.13734
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型关联此论文
在模型README.md中引用 arxiv.org/abs/2605.13734 即可从此页面链接。
引用此论文的数据集0
没有数据集关联此论文
在数据集README.md中引用 arxiv.org/abs/2605.13734 即可从此页面链接。
引用此论文的Spaces0
没有Space关联此论文
在Space README.md中引用 arxiv.org/abs/2605.13734 即可从此页面链接。
包含此论文的收藏集0
没有包含此论文的收藏集
将这篇论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接。
相似文章
一种用于LLM驱动优化中解耦结构与参数的混合嵌套框架
本文提出了一种混合嵌套搜索框架,在LLM驱动的进化优化中,将结构草图(由LLM生成)与数值参数优化(由CMA-ES等传统求解器完成)解耦,并在元优化、基于代码的策略和贝叶斯推断任务中进行了验证。
超越平滑DAG精确性的支持选择:补全几何、得分边际与选择性证书
本文从理论上分析了连续DAG学习中的支持选择,表明仅靠平滑无环约束无法在可行性之外对支持进行排序,推导了NOTEARS/DAGMA的选择时间,并对320条轨迹进行了经验审计。
LibraSpec: Dynamic Diffusion-Based Speculative Decoding via Marginal-Gain-Driven Optimization
Presents LibraSpec, a training-free, plug-and-play algorithm that dynamically selects speculative decoding lengths via marginal-gain-driven optimization, achieving consistent speedups across multiple models and benchmarks.
Safety Cost of Steering Vectors Is Separable and Reducible
This paper shows that steering vectors' safety degradation is separable and reducible, proposing a post-hoc correction via constrained optimization that restores model safety while preserving steering effectiveness.
SPECTRA: Pushing the KV Cache Beyond the 2-Bit Cliff via Spectral Transform Coding
SPECTRA is a training-free codec that re-encodes LLM KV caches via spectral transform to concentrate bit budgets on important channels, achieving near-lossless 4x compression and usable compression up to 12x, surpassing the 2-bit quantization cliff.