CommitKV:通过提交转换实现的多轮智能体生命周期感知KV缓存压缩
摘要
CommitKV提出了一种面向多轮ReAct智能体的生命周期感知KV缓存压缩方法,通过提交转换区分休眠令牌与已完成令牌,以减少内存使用并加速推理。
查看缓存全文
缓存时间: 2026/08/11 08:07
# CommitKV:基于提交转换的多轮智能体生命周期感知KV缓存压缩
来源:https://arxiv.org/html/2608.07855
Weizhong Huang1,†Jinchao Zhang2,\*Xiawu Zheng1,\* 1厦门大学2微信AI,腾讯公司,中国 \*通讯作者
###### 摘要
多轮推理与行动(ReAct)智能体会积累越来越长的推理、工具调用和观察结果轨迹。其键值(KV)缓存随之增长,增加了模型推理过程中的内存使用和注意力开销。现有的KV缓存压缩方法通过驱逐低注意力分数的状态来降低这些成本。然而,当前轮次中的低注意力并不代表未来也不相关,因为暂时不活跃的信息之后可能变得重要。基于快照的驱逐方法因此无法明确区分暂时休眠的信息与看似已完成其作用的信息。在本文中,我们提出了CommitKV,它通过提交转换来识别KV生命周期。具体来说,CommitKV首先将已完成的智能体事件划分为token页,并在工具调用提交之前以及提交返回的观察结果被纳入之后,比较每个符合条件的页面的删除效果。基于这些配对测量,CommitKV区分休眠页面与从高到低完成度的候选页面。然后,它应用一个贪心联合测试,仅当候选页面的提交后综合效果保持有界时才接受其退役。最后,在后续的压缩检查点,被接受的页面被排除,一组等待提交后测量的受保护页面被保留,其余KV状态在缓存预算内使用相同的键、值和绝对位置token索引保留。这些机制确保CommitKV能够区分休眠信息与已完成其可观察作用并可安全移除的信息。在多种基准上的实验表明,CommitKV减少了智能体内存使用,加速了端到端推理,并且比现有KV缓存压缩方法获得了更高的准确率。
22脚注:这项工作是在Weizhong Huang在微信AI实习期间完成的。
## 1 引言
基于大型语言模型(LLM)的智能体\[Yang et al., 2025 (https://arxiv.org/html/2608.07855#bib.bib81); Guo et al., 2025 (https://arxiv.org/html/2608.07855#bib.bib84); Abdin et al., 2025 (https://arxiv.org/html/2608.07855#bib.bib166); Agarwal et al., 2025 (https://arxiv.org/html/2608.07855#bib.bib171); Lyu et al., 2026b (https://arxiv.org/html/2608.07855#bib.bib53), a (https://arxiv.org/html/2608.07855#bib.bib3)\]通过推理和工具使用来解决复杂任务\[Guo et al., 2024 (https://arxiv.org/html/2608.07855#bib.bib76); Cheng et al., 2024 (https://arxiv.org/html/2608.07855#bib.bib74)\]。在广泛使用的ReAct范式中,智能体交替进行推理、工具调用和返回的观察结果\[Yao et al., 2023 (https://arxiv.org/html/2608.07855#bib.bib22)\]。随着轨迹增长,其键值(KV)缓存也在增长。跨轮复用避免了重复预填充完整历史,但持久缓存仍然增加了内存和注意力开销\[Gao et al., 2024 (https://arxiv.org/html/2608.07855#bib.bib205); Zheng et al., 2024 (https://arxiv.org/html/2608.07855#bib.bib107)\]。KV缓存压缩通过在固定预算内保留缓存状态来缓解这个问题\[Shi et al., 2024 (https://arxiv.org/html/2608.07855#bib.bib68); WEI et al., 2025 (https://arxiv.org/html/2608.07855#bib.bib193)\]。
现有方法通常根据基于注意力或查询感知的分数来估计缓存token的重要性\[Tang et al., 2024 (https://arxiv.org/html/2608.07855#bib.bib71); Cai et al., 2025b (https://arxiv.org/html/2608.07855#bib.bib93); Feng et al., 2025 (https://arxiv.org/html/2608.07855#bib.bib94); Geng et al., 2025 (https://arxiv.org/html/2608.07855#bib.bib95)\]。例如,SnapKV\[Li et al., 2024 (https://arxiv.org/html/2608.07855#bib.bib92)\]从提示末尾的观察窗口中聚合注意力分数,R-KV\[Cai et al., 2025a (https://arxiv.org/html/2608.07855#bib.bib101)\]平衡了基于注意力的重要性和键冗余,TriAttention\[Mao et al., 2026 (https://arxiv.org/html/2608.07855#bib.bib182)\]使用预RoPE\[Su et al., 2024 (https://arxiv.org/html/2608.07855#bib.bib123)\]的查询-键几何结构来估计重要性。
尽管评分函数不同,这些方法遵循相同原则:它们从当前推理状态估计token重要性并驱逐低分token。这种基于快照的策略忽视了信息在智能体轮次间的演变方式。如图1所示,一个较早的观察结果和一个已完成的工具调用页面在当前的检查点可能都获得较低的分数。然而,较早的观察结果可能只是暂时休眠,未来会再次有用,而工具调用页面可能在返回的观察结果可用后已经完成了其作用。因此,仅凭当前低分无法确定某个页面是否可以安全移除,这可能导致有用状态被过早驱逐。
图1:为什么快照分数不足以进行KV缓存压缩。在检查点j,较早的观察页面E\_{1}和工具调用页面E\_{2}可能都具有较低的当前重要性,尽管E\_{1}包含Paris(后面需要),而E\_{2}在天气观察结果返回后可能已完成其作用。CommitKV比较它们提交前后的删除效果:低到低的E\_{1}不会被生命周期规则驱逐,而高到低的E\_{2}成为完成候选,并且只有在通过联合验证后才被标记为退役;其KV状态在后续检查点被移除。
为了消除这种歧义,我们提出了CommitKV,一种面向多轮ReAct智能体的生命周期感知KV缓存压缩方法。首先,CommitKV将已完成的工具调用和返回的观察结果划分为事件页面,并将每个生成的工具调用的结束视为*提交*测量边界。它在提交附近以及返回的观察结果被纳入下一轮之后测量同一个页面的删除效果,形成*提交转换*。接下来,它将绝对删除效果与百分位排名结合起来,识别从高到低的完成候选,同时避免过早移除低到低的休眠页面。最后,CommitKV联合验证完成候选,并暂时保护等待提交后测量的页面。在每个压缩检查点,它排除退役页面,保留受保护的待定页面,并在缓存预算下选择其余KV状态,将相同的token索引应用于键、值和绝对位置。通过这种方式,CommitKV移除了已完成其可观察作用的信息,同时保留了未来轮次可能有用的信息。
为了评估CommitKV,我们在六个LLM、八个基准和多个KV缓存预算上进行了大量实验。CommitKV在平均准确率上比最强的压缩基线高出最多22.24个百分点,同时实现了高达5.00×的峰值KV内存节省和5.62×的端到端加速。这些结果表明,CommitKV在显著降低内存和延迟的同时,有效保持了智能体性能。
## 2 相关工作
#### LLM智能体。
LLM\[Xie et al., 2025 (https://arxiv.org/html/2608.07855#bib.bib35), 2026 (https://arxiv.org/html/2608.07855#bib.bib2)\]智能体在轮次之间交错进行推理、工具使用和环境反馈\[Yao et al., 2023 (https://arxiv.org/html/2608.07855#bib.bib22); Masterman et al., 2024 (https://arxiv.org/html/2608.07855#bib.bib204); Zhang et al., 2025b (https://arxiv.org/html/2608.07855#bib.bib75)\]。它们不断增长的轨迹增加了上下文长度和持久KV缓存开销。最近的方法使用阶段和意图感知的重要性、区域特定衰减、情节级驱逐、上下文剪枝或缓存恢复来管理智能体状态\[Liu et al., 2026 (https://arxiv.org/html/2608.07855#bib.bib192); Li et al., 2026 (https://arxiv.org/html/2608.07855#bib.bib195); Matam and Kim, 2026 (https://arxiv.org/html/2608.07855#bib.bib194); Kariyappa and Suh, 2026 (https://arxiv.org/html/2608.07855#bib.bib153); Kim et al., 2025 (https://arxiv.org/html/2608.07855#bib.bib197); Hao et al., 2026 (https://arxiv.org/html/2608.07855#bib.bib203); Rusli et al., 2026 (https://arxiv.org/html/2608.07855#bib.bib201)\]。而CommitKV则将工具调用提交视为生命周期边界,在保留休眠页面的同时退役已完成的页面。
#### KV缓存压缩。
KV缓存压缩通过驱逐或压缩缓存状态来降低长上下文推理成本。驱逐标准包括注意力\[Zhang et al., 2023 (https://arxiv.org/html/2608.07855#bib.bib65); Liu et al., 2023 (https://arxiv.org/html/2608.07855#bib.bib66)\]、查询相关性\[Tang et al., 2024 (https://arxiv.org/html/2608.07855#bib.bib71)\]、自适应策略\[Feng et al., 2025 (https://arxiv.org/html/2608.07855#bib.bib94); Ge et al., 2024 (https://arxiv.org/html/2608.07855#bib.bib72)\]、锚点方向投影\[Geng et al., 2025 (https://arxiv.org/html/2608.07855#bib.bib95)\]、键相似性\[Park et al., 2025 (https://arxiv.org/html/2608.07855#bib.bib96)\]、值感知\[Chang et al., 2026 (https://arxiv.org/html/2608.07855#bib.bib97)\]以及结构化页面或块\[Chitty-Venkata et al., 2026 (https://arxiv.org/html/2608.07855#bib.bib196); Hu et al., 2026 (https://arxiv.org/html/2608.07855#bib.bib199)\]。SnapKV使用提示末尾注意力\[Li et al., 2024 (https://arxiv.org/html/2608.07855#bib.bib92)\],R-KV平衡重要性和冗余\[Cai et al., 2025a (https://arxiv.org/html/2608.07855#bib.bib101)\],TriAttention使用预RoPE几何结构\[Mao et al., 2026 (https://arxiv.org/html/2608.07855#bib.bib182)\]。其他技术\[Ma et al., 2023a (https://arxiv.org/html/2608.07855#bib.bib32), 2024b (https://arxiv.org/html/2608.07855#bib.bib70); Zheng et al., 2021 (https://arxiv.org/html/2608.07855#bib.bib133); Zhang et al., 2026 (https://arxiv.org/html/2608.07855#bib.bib41); Huang et al., 2025b (https://arxiv.org/html/2608.07855#bib.bib181), a (https://arxiv.org/html/2608.07855#bib.bib146)\]包括缓存合并\[Zhang et al., 2024 (https://arxiv.org/html/2608.07855#bib.bib86); Liu et al., 2024a (https://arxiv.org/html/2608.07855#bib.bib85)\]、量化\[Liu et al., 2024b (https://arxiv.org/html/2608.07855#bib.bib52); Hooper et al., 2024 (https://arxiv.org/html/2608.07855#bib.bib103); He et al., 2024 (https://arxiv.org/html/2608.07855#bib.bib102); Zhang et al., 2025a (https://arxiv.org/html/2608.07855#bib.bib67); Ma et al., 2024a (https://arxiv.org/html/2608.07855#bib.bib19), 2023b (https://arxiv.org/html/2608.07855#bib.bib13)\)、混合误差校正\[Kang et al., 2024 (https://arxiv.org/html/2608.07855#bib.bib104)\]、低秩投影\[Chang et al., 2025 (https://arxiv.org/html/2608.07855#bib.bib87)\]以及带值缓存卸载的低秩键\[Sun et al., 2025 (https://arxiv.org/html/2608.07855#bib.bib88)\]等等\[Ma et al., 2026 (https://arxiv.org/html/2608.07855#bib.bib17)\]。大多数驱逐方法对单个推理状态进行评分,混淆了休眠和已完成低影响页面。而CommitKV则比较提交前和返回观察结果后的删除效果,将低到低的休眠页面与高到低的完成候选区分开来,并在退役前联合验证后者。
图2:CommitKV概述。(1) 对于每个工具调用提交,在提交前后的查询窗口中测量同一符合条件事件页面的删除效果。(2) 配对删除效果和百分位排名确定页面的生命周期状态;只有高到低的页面才成为完成候选。(3) 贪心联合测试构造退役集合D\_{c}。在检查点j,D\_{c}中的token被排除,待定索引N\_{j}在B\_N内受保护,保留token索引集I\_{j}在预算B下选择,并一致应用于键、值和绝对位置。
## 3 方法
### 3.1 问题定义
#### 多轮ReAct智能体。
我们考虑一个使用工具的多轮ReAct智能体\[Yao et al., 2023 (https://arxiv.org/html/2608.07855#bib.bib22)\],它通过重复的推理和工具使用来回答查询q\\boldsymbol{q}。在第t轮,智能体接收交互历史x\_t\\boldsymbol{x}\_{t}并生成推理z\_t\\boldsymbol{z}\_{t},随后做出决策a\_t\\boldsymbol{a}\_{t},该决策要么是工具调用,要么是最终答案。定义
x\_t\\displaystyle\\boldsymbol{x}\_{t}=(q,z1,a1,o1,...,zt−1,at−1,ot−1),\\displaystyle=(\\boldsymbol{q},\\boldsymbol{z}\_{1},\\boldsymbol{a}\_{1},\\boldsymbol{o}\_{1},\\ldots,\\boldsymbol{z}\_{t-1},\\boldsymbol{a}\_{t-1},\\boldsymbol{o}\_{t-1}),(1)y\_t\\displaystyle\\boldsymbol{y}\_{t}=(xt,zt,at)。\\displaystyle=(\\boldsymbol{x}\_{t},\\boldsymbol{z}\_{t},\\boldsymbol{a}\_{t})。如果a\_t\\boldsymbol{a}\_{t}调用某个工具,则返回的观察结果o\_t\\boldsymbol{o}\_{t}会被追加到历史中以供下一轮使用。否则,a\_t\\boldsymbol{a}\_{t}是最终答案并终止交互。
#### 跨轮KV复用。
为了避免重复预填充完整历史,服务器在轮次之间保留并复用KV状态\[Gao et al., 2024 (https://arxiv.org/html/2608.07855#bib.bib205); Zheng et al., 2024 (https://arxiv.org/html/2608.07855#bib.bib107)\]。在第一轮,它预填充x\_1=q\\boldsymbol{x}\_{1}=\\boldsymbol{q}。对于每个后续轮次t\>1t\>1,
x\_t=(y\_t−1,o\_t−1),\\boldsymbol{x}\_{t}=(\\boldsymbol{y}\_{t-1},\\boldsymbol{o}\_{t-1}),(2)其中y\_{t-1}\\boldsymbol{y}\_{t-1}的KV状态已被缓存。因此,服务器只预填充新的观察结果o\_{t-1}\\boldsymbol{o}\_{t-1},并在解码过程中追加生成的z\_t\\boldsymbol{z}\_{t}和a\_t\\boldsymbol{a}\_{t}的KV状态。
#### Token级KV缓存压缩。
KV复用导致缓存随交互历史增长。考虑一个具有MM层、HH个KV头(宽度为dd)的LLM\[Vaswani et al., 2017 (https://arxiv.org/html/2608.07855#bib.bib16)\]。在第t轮之后,设L\_t=\|y\_t\|L\_{t}=\|\\boldsymbol{y}\_{t}\|。KV张量为
K\_t,V\_t∈R^{M×H×L\_t×d},\\boldsymbol{K}\_{t},\\boldsymbol{V}\_{t}\\in\\mathbb{R}^{M\\times H\\times L\_{t}\\times d},(3)其中四个轴分别表示层、KV头、token数和头宽度。
FullKV保留所有L\_tL\_{t}个token,而token级压缩则减少token轴。我们将可能移除token的每个运行时边界称为*压缩检查点*。假设在检查点jj之前驻留有S\_jS\_{j}个token,其绝对位置为p\_j=(p\_{j,1},...,p\_{j,S\_j})\\boldsymbol{p}\_{j}=(p\_{j,1},\\ldots,p\_{j,S\_{j}})。策略选择I\_j⊆{1,...,S\_j}\\mathcal{I}\_{j}\\subseteq\\{1,\\ldots,S\_{j}\\}并将其应用于键、值和位置:
K~\_j\\displaystyle\\widetilde{\\boldsymbol{K}}\_{j}=K\_j\[:,:,I\_j,:\],\\displaystyle=\\boldsymbol{K}\_{j}[:,:,\\mathcal{I}\_{j},:],\\qquadV~\_j\\displaystyle\\widetilde{\\boldsymbol{V}}\_{j}=V\_j\[:,:,I\_j,:\],\\displaystyle=\\boldsymbol{V}\_{j}[:,:,\\mathcal{I}\_{j},:],(4)p~\_j\\displaystyle\\widetilde{\\boldsymbol{p}}\_{j}=p\_j\[I\_j\],\\displaystyle=\\boldsymbol{p}\_{j}\[\\mathcal{I}\_{j}\],\\qquad\|I\_j\|\\displaystyle\|\\mathcal{I}\_{j}\|≤B。\\displaystyle\\leq B。这里,BB是token预算,p~\_j\\widetilde{\\boldsymbol{p}}\_{j}表示压缩后保留token的绝对位置。将相同的索引集应用于相似文章
IntentKV: 面向Agent推理的跨轮次意图感知KV缓存剪枝
IntentKV提出了一种针对多轮LLM Agent的跨轮次意图感知KV缓存剪枝方法,通过维护会话级别的查询记忆来高效剪枝缓存,且不损失精度,显著减少了token使用量和KV读取次数。
CompressKV:语义检索引导的KV缓存压缩方法,用于资源高效的长上下文大语言模型推理
CompressKV针对基于GQA的大语言模型,提出了一种语义检索引导的KV缓存压缩方法,通过识别语义检索头来保留关键令牌。在LongBench任务中,仅使用3%的KV缓存即可实现超过97%的全缓存性能。
ResKV:重构被省略的注意力贡献以实现固定预算的KV缓存压缩
ResKV提出了一种KV缓存压缩方法,将固定预算分为精确的主缓存和紧凑的残差缓存,以重构被省略的注意力贡献,从而在多个骨干网络上提升LongBench和RULER上的性能。
Practical Online KV Cache Compaction for LLM Agents: An Empirical Study
This empirical study examines practical online KV cache compaction for LLM agents, comparing token eviction and attention matching methods under different proxy query sources. It finds that delaying compaction to use future agent queries recovers performance, and token eviction preserves accuracy while reducing KV cache by 80%.
AnchorKV: Anchor-Residual KV Cache Compression
AnchorKV is a new KV cache compression scheme that shrinks the cache by 20x without discarding any tokens, using anchor-residual representations to preserve 99% of full-cache accuracy at the 70B scale. The paper is a preprint under review.