价值感知KV缓存淘汰何时有效?一种针对非单调缓存压缩的固定契约诊断方法

arXiv cs.LG 论文

摘要

本文介绍了一种固定契约诊断工具,用于分析KV缓存压缩方法在长上下文LLM推理中成功或失败的原因。文章确定了三种故障模式——遗漏证据、对无关token进行评分以及破坏相关证据——并在LongBench和NeedleBench上对这些模式进行了评估。

arXiv:2605.08234v1 公告类型:新发布 摘要:长上下文大语言模型(LLM)推理的瓶颈在于解码过程中读取大型KV缓存所产生的内存和带宽成本。KV压缩通过仅保留部分缓存来降低这一成本,但仅凭任务准确率无法确定选择器(selector)成功或失败的原因。选择器可能在三个阶段出现故障:它可能遗漏未来解码所需的证据,对不影响输出的token赋予高分,或者在将评分适配到小缓存时破坏相关证据。我们引入了一种固定契约诊断方法,该方法保持选择器的配置不变,每次仅更改一个决策槽位。对于价值排序,探测工具将块的注意力质量与移除该块后的估计输出变化相结合。在LongBench上,针对三种模型和两种预算设置,该探测工具在72.6%的正边际单元格和32.4%的非正边际单元格中呈阳性结果。在32k上下文长度的NeedleBench M-RT测试以及RULER 8k检查中,探测支持分支检索的闭合性,而264单元格的符号评估则将支持恢复和输出价值排序与边界附近的杠杆效应区分开来。得出的结论顺序是:首先恢复解码侧证据,其次对其输出价值进行排序,最后在投影过程中保持耦合证据。
查看原文
查看缓存全文

缓存时间: 2026/05/12 07:10

# 何时价值感知 KV 驱逐会有帮助?一种针对非单调缓存压缩的固定契约诊断方法

来源: https://arxiv.org/html/2605.08234 Ruijie Zhang, Haozhe Liang, Da Chang, Li Hu, Fanqi Kong, Huaxiao Yin, and Yu Li [email protected]

###### 摘要

长上下文 LLM 推理的瓶颈在于解码期间读取大型 KV 缓存所需的内存和带宽成本。KV 压缩通过仅保留部分缓存来降低这一成本,但仅凭任务准确率无法识别选择器成功或失败的原因。选择器可能在三个步骤上失败:它可能遗漏未来解码所需的证据,给不影响输出的 token 赋予高分,或者在将分数适配到小缓存时破坏相关的证据。我们引入了一种固定契约诊断方法,该方法保持选择器的设置不变,并每次更改一个决策槽位。对于价值排序,探针将块的注意力质量与移除该块估计的输出变化相结合。在 LongBench 上,跨越三个模型和两种预算,探针在 72.6% 的正边际单元和 32.4% 的非正边际单元上呈阳性。NeedleBench M-RT 在 32k 以及 RULER 8k 检查探针支持下,证实了在分支检索下的封闭性,而 264 单元符号评估将支持恢复和输出价值排序与边界附近的杠杆效应区分开来。得出的顺序是:恢复解码侧证据,排序其输出价值,并在投影过程中保留耦合证据。

## 1 引言

长上下文 LLM 推理将瓶颈从预填充(prefill)转移到了解码(decoding)。预填充之后,每个生成的 token 都必须读取不断扩展的键值缓存,因此延迟和内存流量都随着上下文长度增加而上升[52 (https://arxiv.org/html/2605.08234#bib.bib52),26 (https://arxiv.org/html/2605.08234#bib.bib26),46 (https://arxiv.org/html/2605.08234#bib.bib46)]。针对预训练模型的 KV 压缩方法通过决定保留、读取或以较低精度存储哪些缓存状态来降低这一成本[26 (https://arxiv.org/html/2605.08234#bib.bib26),17 (https://arxiv.org/html/2605.08234#bib.bib17),37 (https://arxiv.org/html/2605.08234#bib.bib37),27 (https://arxiv.org/html/2605.08234#bib.bib27)],而相邻的对齐解码和稀疏读出系统则修改访问估计器或读取基质本身[45 (https://arxiv.org/html/2605.08234#bib.bib45),50 (https://arxiv.org/html/2605.08234#bib.bib50),9 (https://arxiv.org/html/2605.08234#bib.bib9),12 (https://arxiv.org/html/2605.08234#bib.bib12)]。然而,固定预算的任务分数混合了多种故障模式(图 1 (https://arxiv.org/html/2605.08234#S1.F1))。选择器可能遗漏未来解码消耗的证据,给不影响输出的 token 赋予高分,或者在将分数适配到小缓存时破坏相关证据。

> **图 1:压缩并非单调的。** 根据哪个选择器阶段成为瓶颈,压缩后的缓存性能可能低于、匹配或超过 FullKV。诊断方法固定选择器契约并扰动一个排序槽位以定位故障。

在紧预算下,选择器之间的性能差异集中在预算阈值附近的一小部分**边界单元**上,而保留集的大部分大致是共享的。边界交换揭示了这种集中性。它保持模型、预算和所有其他缓存位置固定,仅交换阈值附近的决策,并恢复了选择器之间的大部分差距。在低预算下,边界排序的正确性是约束条件。这些边界错误映射到三个选择器阶段。

在访问估计中,当历史预填充统计数据偏离实际消耗缓存的解码查询时,会出现**查询域不匹配**,因此早期位置仅因为被更多后续查询看到而获得膨胀的分数。在价值后果排序中,**输出无意识评分**将注意力质量视为访问证据,而不测试删除是否会改变输出,因此任务相关证据最终与模板和分隔符混合。在分数到缓存的投影中,当多证据解码下的 token 级排序将预算分散到孤立的高分 token 上时,会出现**投影不匹配**,导致证据覆盖不完整且连续的支持区域碎片化。

该诊断在结果测量之前固定预填充注意力张量、查询域、观察窗口、预算、分配规则和分数到缓存的投影。阶段局部测试改变该契约中的一个槽位。主要测试保持 SnapKV[26 (https://arxiv.org/html/2605.08234#bib.bib26)]的观察窗口契约固定,并将价值后果排序标量代入相同的排序槽位,以测试边界单元是否包含可恢复的价值后果误排序。PyramidKV[2 (https://arxiv.org/html/2605.08234#bib.bib2)]、CAKE[37 (https://arxiv.org/html/2605.08234#bib.bib37)]、Ada-KV[17 (https://arxiv.org/html/2605.08234#bib.bib17)] 和 H2O[52 (https://arxiv.org/html/2605.08234#bib.bib52)] 上的跨契约行是转移和敏感性检查,展示了当访问估计、分配或投影也发生变化时符号模式如何改变。

在固定选择器契约下,每个实验仅支持其槽位发生变化的阶段。边界交换首先将紧预算错误定位到分数边际,并分离查询域不匹配、输出无意识评分和投影不匹配。在契约固定的情况下,LongBench[1 (https://arxiv.org/html/2605.08234#bib.bib1)]控制测试在读取结果之前的预测符号分裂。价值后果干预主要在具有正参考边际和低支持耦合的单元中有帮助,而无价值控制则消除了这种分离。Token 填充使得未使用预算在固定块控制下不太可能成为第三阶段的独立解释,而跨契约基线在不用于排序选择器的情况下测试转移。NeedleBench[25 (https://arxiv.org/html/2605.08234#bib.bib25)] 和 RULER[24 (https://arxiv.org/html/2605.08234#bib.bib24)] 8k 检查探针支持在分支检索目标下的封闭性。更广泛的 264 单元符号评估显示,无杠杆和最终符号之间高度一致,将支持恢复和输出价值排序与作为条件放大器的杠杆效应区分开来。

## 2 分阶段诊断框架

**设置。** 在紧预算下,预填充可观察分数可能因估计错误未来访问支持、错误排序有用位置或在预算投影过程中丢失支持而失败。该流程在固定保留 token 预算下形式化,符号收集在附录 A (https://arxiv.org/html/2605.08234#A1) 中。令 $A_{l,h}$ 表示层-头预填充注意力矩阵,标量条目 $A_{l,h}[u,i]$ 来自查询位置 $u$ 到键位置 $i$,其中 $T$ 是提示长度,$b \in (0,1)$ 是预算比率。驱逐规则首先从可观察的预填充注意力张量 $A$ 构建标量分数,然后将其投影到固定内存预算:
$$
s_i = \psi_{\mathrm{score}}(A, i), \quad \mathcal{K} = \operatorname{TopK}(s, k), \quad k = \lfloor bT \rfloor \le T. \quad (1)
$$
当头和层聚合不是核心时,写 $a_u(i) := \operatorname{Agg}_{l,h} A_{l,h}[u,i]$,仅当跨层结构重要时才保持张量形式。$\operatorname{TopK}$ 使用与分数无关的确定性平局打破。

###### 假设 1(固定选择器契约)

诊断比较在结果测量之前固定预填充注意力张量、查询或代理域、因果掩码、观察窗口、预算 $k = \lfloor bT \rfloor$ 和投影规则。查询定律共享一个零扩展的有限域,块变体陈述块大小和边界策略。本节中的所有形式化陈述均使用假设 1 (https://arxiv.org/html/2605.08234#Thmassumption1),除非另有说明。

对于固定的选择器契约和提示位置 $i$,写 $u_i$ 为保留 $i$ 的潜在解码侧效用,$e_i$ 为由 $u_{\mathrm{acc}}$ 估计的访问支持暴露因子,$g_i$ 为 token 级层、头或预算缩放,$\rho_i$ 为结构化非效用质量,如分隔符、记录或格式标记。任何标量预填充分数可以分解为:
$$
s_i = e_i g_i u_i + \rho_i + \xi_i, \quad (2)
$$
其中残差 $\xi_i := s_i - e_i g_i u_i - \rho_i$。此表示是定义性的。其作用是标记阶段局部干预改变的因素。支持耦合指数 $\phi(x)$ 标记 $\rho_i$ 类型的结构,而 $\eta_{\mathrm{proj}}$ 仅在投影后定义。第 4 节 (https://arxiv.org/html/2605.08234#S4) 中的固定预测器分割通过固定访问估计和投影,在 SnapKV[26 (https://arxiv.org/html/2605.08234#bib.bib26)] 契约下测试第二阶段。

**为何需要分阶段诊断。** 在低预算下,大多数提示位置要么安全保留,要么安全驱逐,结果由靠近保留或驱逐边界的位置决定。边界交换恢复了累积评分器和解码对齐评分器之间的大部分差距,而相同大小的随机交换则没有。这种局部性排除了仅基于全局分数校准的解释。活跃错误与选择器如何观察未来访问、为访问状态分配价值或将分数投影到有限缓存中有关。

###### 引理 1(边界边际条件)

固定一个具有确定性平局打破的选择器契约、基础分数 $s$ 和扰动分数 $s' = s + \delta$。令 $j \in \mathcal{K}_s$ 为基础保留集 $\mathcal{K}_s = \operatorname{TopK}(s, k)$ 下保留的 token,$i \notin \mathcal{K}_s$ 为驱逐的 token。只要 $\delta_i - \delta_j > s_j - s_i$,扰动就严格将 $i$ 排在 $j$ 之上。
$$
\delta_i - \delta_j > s_j - s_i. \quad (3)
$$
在相等时,固定平局打破决定。如果下游效用于此一对一切换局部可加,则用 $i$ 替换 $j$ 会将潜在保留集效用改变 $u_i - u_j$。在非相等情况附近,当分数扰动跨越基础边际且其带符号分数变化与潜在效用间隙一致时,该边界处的分数扰动是有益的。证明见第 B.1 节 (https://arxiv.org/html/2605.08234#A2.SS1)。

此局部条件激发了实验中使用的符号解析组。诊断目标是解码侧访问支持 $u_{\mathrm{acc}}(i)$,被访问位置中的价值后果 $u_{\mathrm{val}}(i)$,以及在将分数映射到固定 token、头、层或块预算后的投影残差 $\eta_{\mathrm{proj}}$。它们由公式 4 (https://arxiv.org/html/2605.08234#S2.E4)、6 (https://arxiv.org/html/2605.08234#S2.E6) 和 7 (https://arxiv.org/html/2605.08234#S2.E7) 实例化。公式 2 (https://arxiv.org/html/2605.08234#S2.E2)、2 (https://arxiv.org/html/2605.08234#Thmtheorem2) 和 3 (https://arxiv.org/html/2605.08234#Thmtheorem3) 给出了相应的代数检查。

$$
\hat{u}_{\mathrm{acc}}(i; m) := \sum_{u \in \mathcal{Q}_m} \hat{q}_m(u) \hat{d}_m(i, u) \hat{f}_m(u, i), \quad u_{\mathrm{acc}}(i) := \sum_{u \in \mathcal{Q}_m} q^{\star}(u) d^{\star}(i, u) f^{\star}(u, i), \quad (4)
$$

此处 $\mathcal{Q}_m$ 是零扩展的因果查询域。估计器 $m$ 使用查询定律 $\hat{q}_m$、暴露校正 $\hat{d}_m$ 和池化核 $\hat{f}_m(u, i) := \sum_{l,h} \hat{\beta}_{l,h,m}(u) A_{l,h}[u,i]$。星号项表示参考值。第一阶段访问误差随后精确分解为查询定律、暴露和聚合项。

###### 命题 2(有序替换恒等式)

在假设 1 (https://arxiv.org/html/2605.08234#Thmassumption1) 下,使用公式 4 (https://arxiv.org/html/2605.08234#S2.E4) 中公共查询域上定义的估计器,访问支持估计误差允许精确分解:
$$
\hat{u}_{\mathrm{acc}}(i; m) - u_{\mathrm{acc}}(i) = \delta_{\mathrm{phase}}(i; m) + \delta_{\mathrm{exp}}(i; m) + \xi_{\mathrm{acc}}(i; m), \quad (5)
$$
其中
$$
\begin{aligned}
\delta_{\mathrm{phase}}(i; m) &:= \sum_{u \in \mathcal{Q}_m} (\hat{q}_m(u) - q^{\star}(u)) d^{\star}(i, u) f^{\star}(u, i), \\
\delta_{\mathrm{exp}}(i; m) &:= \sum_{u \in \mathcal{Q}_m} \hat{q}_m(u) (\hat{d}_m(i, u) - d^{\star}(i, u)) f^{\star}(u, i), \\
\xi_{\mathrm{acc}}(i; m) &:= \sum_{u \in \mathcal{Q}_m} \hat{q}_m(u) \hat{d}_m(i, u) (\hat{f}_m(u, i) - f^{\star}(u, i)).
\end{aligned}
$$
*证明见第 B.2 节 (https://arxiv.org/html/2605.08234#A2.SS2).*

这三项隔离了上述固定顺序替换下的查询定律不匹配、暴露校正以及层和头池化残差。第二阶段通过条件输出后果 $u_{\mathrm{val}}(i)$ 对已访问位置重新加权。定义
$$
\begin{aligned}
\Delta(i) &:= u_{\mathrm{acc}}(i) u_{\mathrm{val}}(i), \\
\hat{\Delta}(i; m) &:= \hat{u}_{\mathrm{acc}}(i; m) \hat{u}_{\mathrm{val}}(i; m), \\
\xi_{\mathrm{val}}(i; m) &:= \hat{u}_{\mathrm{val}}(i; m) - u_{\mathrm{val}}(i).
\end{aligned}
$$
展开乘积给出
$$
\begin{aligned}
\hat{\Delta}(i; m) - \Delta(i) &= u_{\mathrm{val}}(i) [\delta_{\mathrm{phase}}(i; m) + \delta_{\mathrm{exp}}(i; m) + \xi_{\mathrm{acc}}(i; m)] \\
&\quad + u_{\mathrm{acc}}(i) \xi_{\mathrm{val}}(i; m) + R_2(i; m), \quad (6a) \\
R_2(i; m) &:= [\delta_{\mathrm{phase}}(i; m) + \delta_{\mathrm{exp}}(i; m) + \xi_{\mathrm{acc}}(i; m)] \xi_{\mathrm{val}}(i; m). \quad (6b)
\end{aligned}
$$
一阶近似保留线性项并仅丢弃残差乘积。SnapKV[26 (https://arxiv.org/html/2605.08234#bib.bib26)] 替换固定访问估计和投影,仅扰动价值后果标量,从而隔离 $u_{\mathrm{acc}} \xi_{\mathrm{val}}$ 通道。

第三阶段将 $\hat{\Delta}$ 投影到固定预算。对于保留集 $\mathcal{K}$ 和由评分查询引起的访问定律 $p_T$,当 $p_T(\mathcal{K}) > 0$ 时,投影项直接可见为保留的访问质量:
$$
\eta_{\mathrm{proj}}(\mathcal{K}; p_T) := \operatorname{TV}(p_T, \bar{p}_\mathcal{K}) = 1 - p_T(\mathcal{K}),
$$

相似文章

面向长推理的信息感知KV缓存压缩

arXiv cs.CL

本文提出InfoKV,一种熵感知的KV缓存压缩框架,结合了token级别的预测不确定性和注意力分数,以提高长上下文推理效率。实验表明,它在Llama-3.1、Llama-3.2和DeepSeek-R1上优于现有的基于注意力的方法。

KV缓存压缩的消融、统计推断与验证

arXiv cs.LG

本文对KV缓存压缩方案(TurboQuant和SpectralQuant)进行了系统的比较研究,介绍了一种统计验证方法,并针对高效Transformer推理提供了特定场景下的建议。