激进解码时KV缓存驱逐的关键因素:时间聚合与排序保持

arXiv cs.AI 论文

摘要

本文研究了AI模型解码时KV缓存压缩中时间聚合和排序保持的重要性,并引入InertiaKV方法以提高解码吞吐量。

arXiv:2609.03515v1 公告类型:新 摘要:解码时KV缓存压缩研究主要集中在设计更好的令牌评分函数,而跨解码步骤聚合分数的时间规则通常被视为实现细节。在激进KV压缩下,我们发现指数移动平均(EMA)聚合使得近似保持顺序的评分器修改在驱逐集层面几乎无法区分。值范数和熵变体与注意力高度相关,产生几乎不变的保留集,而KeyDiff、键范数、最近性和学习评分器会改变排序并显著退化。我们将这种稳定性归因于所评估的聚合,它耦合了层加权和时间保留。基于这一观察,我们引入了InertiaKV,一种基于EMA的解码时驱逐方法,以及InertiaKV-Lazy,其定期刷新变体,相对于完全刷新的InertiaKV,解码吞吐量提高了1.34-1.46倍。我们还研究了无评分解码作为独立的实证操作点:它在第一个解码步骤中对完整上下文进行一次评分,冻结该排序,并在移除所有后续评分时产生平均质量变化+0.03。在六个开放权重骨干网络以及LongBench、LongBench-v2和RULER基准测试中,结果确定了时间聚合和排序保持是不同且重要的设计因素;它们并不意味着评分质量在一般情况下无关紧要。
查看原文
查看缓存全文

缓存时间: 2026/09/04 06:06

# 激进解码时KV缓存淘汰的关键因素:时序聚合与排名保持
来源:https://arxiv.org/html/2609.03515  
作者:Yu Zhao  
单位:阿里巴巴集团  
邮箱:[hanfeng\.wxt@alibaba\-inc\.com](mailto:[email protected])  
GitHub:https://github\.com/BobTsang\-NLP/InertiaKV  
Yefeng Liu  
单位:蚂蚁集团  
Zhihong Lu  
单位:蚂蚁集团  
Xuanfan Ni  
单位:阿里巴巴集团  
Xintong Wang††  
(通讯作者 xintong\.wang@uni\-hamburg\.de)  
单位:阿里巴巴集团  
单位:汉堡大学  

###### 摘要  
解码时KV缓存压缩研究主要侧重于设计更优的令牌评分函数,而聚合各解码步骤得分的时序规则常被视为实现细节。在激进KV压缩条件下,我们发现指数移动平均(EMA)聚合使近似保序的评分器修改在淘汰集层面难以区分。值范数和熵变体仍与注意力高度相关,保留集几乎不变;而KeyDiff、键范数、时近度及学习型评分器改变了排名并显著降低性能。我们将此稳定性归因于所评估的聚合方式,该方式耦合了层权重与时序保持。基于此发现,我们提出**InertiaKV**——基于EMA的解码时淘汰方法,及其周期性刷新变体**InertiaKV-Lazy**,后者在保持完整刷新的InertiaKV性能的同时实现1.34–1.46倍解码吞吐提升。我们还将无评分解码(Score-Free)作为独立实证操作点:它在首个解码步骤对完整上下文进行一次评分后冻结该排名,移除后续所有评分操作,平均质量变化仅为+0.03。  
在六种开源模型及LongBench、LongBench-v2和RULER基准测试中,结果表明时序聚合与排名保持是独特且关键的设计因素;这并不意味着评分质量在一般情况下无关紧要。

## 1 引言  
解码时KV缓存压缩(Zhang et al., 2023; Liu et al., 2023; Oren et al., 2024)是一个序列决策问题:在每个生成步骤中,压缩器必须在固定内存预算下决定保留哪些令牌并永久淘汰哪些。该决策分解为两个通常讨论的设计维度:(1)**单步评分函数**,评估每个令牌的当前重要性;(2)**聚合规则**,将解码器层和解码步骤的分数结合成驱动淘汰的效用估计。现有方法主要聚焦于第一个维度:H2O累积注意力质量,TOVA按最后查询注意力排序,ScissorHands利用注意力持续模式,AdaKV自适应分配各头预算,FastGen采用模型感知自适应压缩,KeyDiff通过键向量几何特性评分。预填充时方法(如SnapKV)在生成前选择令牌;正交技术通过量化或跨层共享降低单令牌成本。  
聚合维度(单步、累积求和或有界内存平滑)被视为实现细节而非首要设计选择。在中等压缩率下,现有方法通常能保持可接受质量。但在激进压缩下,这一前提不再成立:在RULER基准中,当KV预算从50%缩减至10%时,尽管采用根本不同的评分函数(表1),TOVA、SnapKV和AdaKV均显著退化。不同评分器表现出的共同退化表明,在此区间内仅凭评分可能无法决定质量。先前工作很少将评分与时序聚合作为独立变量研究;它们通常作为耦合系统评估,导致在激进预算下哪个维度主导质量的问题悬而未决。  
表1:Llama-3.1-8B在KV预算递减时的RULER分数。不同评分函数的方法表现出不同的退化速率。  
这促使我们转向关注被忽视的第二维度:分数聚合。我们采用指数移动平均(EMA)平滑,该方法在解码过程中累积分数,具有有界内存和可调系数α。在评估的实现中,运行状态从解码器层顺序更新分数,并在解码步骤间保持,从而耦合层权重与时序保持。  
为在固定聚合程序下隔离评分器差异,我们在Llama-3.1-8B上进行90%压缩率的初始实验:固定顺序层-时序聚合规则,系统性地改变评分函数。将基于注意力的评分器替换为值范数或熵权重,产生的淘汰集几乎相同(图1;平均成对Jaccard系数=0.97)。当运行排名稳定后,近似保序的评分器修改很少改变保留/淘汰成员关系。  
为验证该发现的普适性,我们将实验扩展至Qwen2.5-7B和Llama-3.3-70B,在LongBench、LongBench-v2和RULER上进行测试。模式一致:在所评估的聚合下,近似保持效用排名的扰动产生相似保留集,而显著重排的评分器则降低质量。  
在这些激进压缩设置下,所评估的顺序层-时序聚合使近似保序的评分器修改在淘汰集层面难以区分;该结论不适用于显著改变效用排名的评分器。我们将此归因于所评估顺序层-时序聚合下的**排名惯性**:重复更新与更稳定的保留集成员关系相关(§5.3),但当前实验未能分离跨步记忆与递归隐含的后层权重。  
这种稳定性是有代价的:更强的平滑延迟了对相关性变化的适应,产生观察到的**边界误差与滞后误差**权衡(§3.1分析)。这种持续性促使了InertiaKV-Lazy的提出,它周期性刷新分数,相较于完整刷新的InertiaKV实现1.34–1.46倍解码吞吐提升。作为独立操作点,无评分解码在首个解码步骤计算解码器层的分数并冻结该排名;评估中它消除了所有后续分数更新,平均质量变化可忽略(Δ=+0.03)。  
总之,本文有三方面贡献:  
- •我们在7B–70B模型的LongBench、LongBench-v2和RULER上识别了顺序层-时序聚合中的排名惯性:近似保序的评分器变化使淘汰集几乎不变,而改变排名的评分器可能急剧降低质量。  
- •我们表征了观察到的边界误差与滞后误差权衡,并提供排名稳定性边界,解释了为何更强的时序平滑能稳定淘汰决策却延迟适应相关性变化。我们的负面结果进一步表明,仅凭局部噪声和漂移无法可靠指导自适应平滑。  
- •我们将解码时排名持续性转化为操作点:InertiaKV-Lazy相比完整刷新的InertiaKV实现1.34–1.46倍解码加速,而无评分解码在首步初始化后消除所有后续分数更新,平均质量变化可忽略。这些结果确立了刷新频率作为显式质量-效率控制手段。  
图1:EMA稳定了三个高排名相关评分器的保留集。每面板左侧为单步评分(*左*),右侧为EMA平滑评分(*右*),对应注意力、值范数和熵。单步分数波动,而EMA对这些近似保序变体产生几乎相同的保留集(在前B个令牌集上平均成对Jaccard=0.97,跨解码步骤和层平均)。深色单元格表示保留的令牌;列按参考效用排序(高→低);虚线标记预算边界。

## 2 相关工作  
#### 解码时淘汰方法。解码时KV淘汰围绕设计更优的评分函数快速发展。H2O引入累积注意力质量作为重击信号,确立了固定预算下“评分-淘汰”的框架。ScissorHands观察到注意力模式在解码步骤间持续,使得未来重要性可从过去注意力预测。TOVA将评分简化为单步最后查询信号,以降低开销为代价换取时间信息。后续工作进一步丰富了评分维度:AdaKV自适应分配各注意力头的预算,KeyDiff用键向量几何特性替换注意力权重,TaDA为自适应压缩添加均值中心化。近期工作如RocketKV应用两阶段粗到细评分加速,EvolKV使用进化搜索优化逐层预算分配。在此演进中,将单步分数聚合为淘汰决策的时序规则(累积求和、滑动窗口或隐含单步)始终作为后台实现选项,而非独立研究对象。  
#### 时序视角。少数工作涉及淘汰的时序维度。ScissorHands的持续性假设隐含时序稳定性,但将其归为注意力信号而非聚合机制的属性。FAEDKV识别现有方法的时近偏差,提出频域变换以实现无限窗口无偏评分——是首批明确将时序动态作为设计问题处理的尝试。然而FAEDKV贡献的是改进评分信号的去偏技术,并未解耦评分与聚合,也未测试时序平滑与评分器排名的交互作用。我们的发现与之互补:在激进KV压缩下,EMA聚合使近似保序的评分器修改在淘汰集层面难以区分,但无法拯救排名与注意力差异显著的评分器。  
#### 预填充时与稀疏注意力方法。SnapKV在预填充时选择令牌;StreamingLLM保留注意力汇点和局部窗口。这些方法在解码循环前或外部操作。稀疏注意力系统维护完整缓存于片外并每步加载子集——与不可逆淘汰是根本不同的范式。  
#### 正交维度。缓存大小还可通过量化、跨层共享、逐层预算塑形或基于重建的压缩减少。硬件高效注意力实现降低单步成本但不解决缓存增长问题。这些与淘汰方法可组合,但与本文研究问题正交。据我们所知,先前工作很少将评分与时序聚合作为独立可控设计维度分离研究。

## 3 方法  
我们研究激进预算下的解码时KV缓存压缩。给定长度为L0的预填充缓存和压缩率ρ,解码侧预算为B=⌊(1−ρ)L0⌋。与稀疏注意力不同,淘汰不可逆:移除的KV对无法恢复。  
### 3.1 时序效用聚合  
在每个解码步骤t,我们从所有H个头提取最后查询注意力权重,并通过跨头平均池化计算单令牌重要性分数:  
s_t(i) = (1/H) Σ_{h=1}^H a_t^{(h)}(i),i=1,...,L_t  
其中a_t^{(h)}(i)是头h对缓存位置i的注意力。我们维护效用向量m_t ∈ R^{L_t},其中m_t(i)估计截至步骤t的缓存令牌i的聚合重要性。当缓存超过B时,我们淘汰具有最低m_t(i)的令牌。  
聚合规则是主要设计选择:  
- 单步:m_t = s_t  
- 累积:m_t = m_{t-1} + s_t  
- EMA:m_t = α m_{t-1} + (1−α) s_t  

这三种规则涵盖了稳定性-自适应性轴:单步最具自适应性但噪声大;累积永不遗忘但对相关性变化适应慢;EMA(α∈(0,1))以有界内存在二者间插值。公式2-4展示了单步解码步骤级的聚合。在实现中,压缩应用于多个Transformer层,EMA状态在每个此类层后更新;因此α同时控制解码步骤间的持久性与连续层的相对影响。  
在激进压缩下,α的选择揭示了

相似文章

基于顿悟感知的KV缓存淘汰方法(无需注意力矩阵)

arXiv cs.LG

本文介绍了EpiKV,一种基于内部表征变化(顿悟分数)而非注意力权重来评估token重要性的KV缓存淘汰方法,无需具体化注意力矩阵。该方法在推理基准测试中取得了具有竞争力的性能,同时支持长达16倍的上下文长度。

HARD-KV: 解码时 KV 压缩的头部自适应正则化

arXiv cs.LG

Hard-KV 引入了级联缓存层次结构和 Logits 校准机制,以解决头部自适应 KV 缓存压缩中的静态-动态不匹配问题,在长上下文 LLM 推理中实现了高达 2 倍的吞吐量提升。