SemKV:基于质量悬崖引导的语义混合精度KV缓存量化,用于长上下文LLM推理

arXiv cs.LG 论文

摘要

SemKV引入了一个基于经验测量的质量悬崖引导的KV缓存混合精度量化框架,在长上下文LLM推理中实现了显著的存储减少,且没有可检测的质量损失。

arXiv:2608.28911v1 Announce Type: new 摘要:键值(KV)缓存是长上下文大型语言模型(LLM)推理的主要内存瓶颈,随上下文长度线性增长。我们表明,在分数位网格上的均匀KV量化不会优雅降级:在预定义的多种子统计协议下,使用仿射量化器的Llama-3.1-8B-Instruct在编码位/值降至2.322时与FP16 KV统计上不可区分,在2.0位时崩溃——这是一个在(2.0, 2.322]区间内的质量悬崖,该现象在生成时量化和多轮对话中重现,并转移至Mistral-7B。该悬崖重新定义了重要性感知混合精度:在悬崖之上,八个模型内部重要性指标在统计上可互换,因此混合的好处是网格插值,达到均匀量化无法实现的平均精度。SemKV保留每个令牌,根据模型内部分数对令牌进行排序,并分配两个相邻的高于悬崖的精度,实现了实测的6.0倍存储减少,与完整KV无统计上可检测的质量差异(n=900,三种子),并在1.5倍更大内存预算下优于FP16令牌剪枝。用失真优化量化器(TurboQuant-MSE)替换仿射基础,在测试的每个协议中降低了悬崖,将无可检测损失的操作点提高到7.9倍。方法:为为目标部署设置测量悬崖,然后在上进行插值。
查看原文
查看缓存全文

缓存时间: 2026/09/01 13:01

# SemKV:基于质量断崖引导的语义混合精度键值缓存量化,用于长上下文大语言模型推理
**来源**:https://arxiv.org/html/2608.28911

Daeha Lee  
电子邮箱:[[email protected]](mailto:[email protected])  
通讯作者。  
所属机构:电子通信研究院(ETRI),大韩民国大田市

Do-Hyung Kim  
所属机构:电子通信研究院(ETRI),大韩民国大田市

Jae-Hong Kim  
所属机构:电子通信研究院(ETRI),大韩民国大田市

###### 摘要
键值缓存是长上下文大语言模型推理中的主要内存瓶颈,因为其大小随上下文长度线性增长。现有的键值缓存压缩方法涵盖了均匀量化、标记删除和重要性感知混合精度,但如何选择精度水平而不跨越一个明显的质量边界仍不明确——此外,删除方法还有可能移除长上下文推理所依赖的证据标记。

我们引入了SemKV,这是一种全标记保留的混合精度键值缓存量化框架,其由经验测量的*质量断崖*引导。通过在预设的多种子统计协议下,对分数字位网格进行均匀量化扫描,我们发现采用仿射标量量化器的Llama-3.1-8B-Instruct在2.322代码位/值及以下时与FP16键值缓存在统计上无差异,而在2.0位时则急剧退化。SemKV在离线测量此边界后,根据模型内部重要性排序,为标记分配两个相邻的、高于断崖的精度(2.585/2.322位),实现了平均2.39代码位/值(打包和元数据后有效位为2.65位/值)——测量显示,在LongBench评估采样(n=900,三种子)中,与FP16键值缓存相比,实现了6.0倍的存储缩减,且质量差异在统计上无法检测。

内部探针测试表明,测试的部分保护混合方案在跨越断崖时无法恢复全键值缓存级别的质量,而一种分块延迟分配机制将此机制扩展到生成标记和多轮对话。尽管修剪基线使用了1.5倍更大的内存占用,但在匹配(实际上是更不利)的内存预算下,以低精度保留所有标记仍显著优于FP16标记修剪。此外,断崖、插值特性和工作点可迁移到Mistral-7B-Instruct-v0.3,在该模型上,信息性选择对于安全混合仍然必要。

最后,测量的断崖取决于在指定评估协议下的模型-量化器对:将仿射基准替换为失真优化的量化器(TurboQuant-MSE)会降低我们在所有测试协议中的崩溃边界;SemKV将额外的裕度直接转化为压缩——在新开放的网格间隙内以2.0/1.585位进行插值,其有效位为2.025位/值,在统计上与全键值缓存无差异,将无可检测损失的工作点从6.0倍提高到7.9倍。在全缓存多轮量化下,两个基准都存在一个小的高于断崖的底层(TurboQuant下其幅度小2.5倍)。在测试的多轮比较中,SemKV在使用更少位数的同时,与上层网格点在统计上无差异。

这些结果引出了一个通用方法:测量目标部署环境的断崖,然后在其之上插值。

###### 关键词:
键值缓存压缩,长上下文推理,大语言模型,混合精度量化,语义重要性

## 1 引言
大语言模型越来越多地处理数万个标记的上下文,用于文档问答、代码理解、检索增强生成和多轮智能体[31–36, 44–46]。在Transformer解码过程中,键值缓存随上下文长度线性增长,其内存占用决定了实际服务系统的可行批量大小和上下文预算[37–38, 47]。均匀键值量化[1-2, 9]、驱逐和修剪[13–24, 55]以及高效注意力机制[25–29]都已被提出,但均匀量化忽略了标记层面的差异,而基于删除的方法则有移除证据标记的风险。

本文从一个经验观察而非架构设计出发。当均匀键值量化在*分数字位*网格(例如,通过整数量化级别实现的log₂5≈2.322, log₂6≈2.585位)上扫描时,质量并非逐渐退化:在我们的LongBench协议下,Llama-3.1-8B-Instruct的所有均匀设置从3.0到2.322位在统计上与全精度键值缓存无差异,质量仅在区间(2.0, 2.322]内崩溃——这是一个与失控生成急剧增加同时发生的*质量断崖*。在相同的仿射基准下,相同的崩溃位置在单轮问答、生成标记量化以及多轮对话(其中还存在一个小的高于断崖的残余底层)中再现,甚至在不同的骨干网络Mistral-7B-Instruct-v0.3上也是如此。

该断崖重新定义了混合精度的目的。在测试设置中,跨越断崖的混合方案未能恢复全键值缓存性能,而当两个精度级别都保持在断崖之上时,分配几乎没有可测量的影响。有用的区域是紧邻断崖之上的稀疏分数字位网格,其中均匀量化只能位于*网格点上*,而混合精度可以*在网格点之间插值*。

因此,SemKV保留每个标记,使用模型内部的语义重要性指标对每个标记评分,并将两个高于断崖的网格精度中的较高者分配给排名靠前的部分标记,达到均匀量化无法实现的平均精度(例如,2.322到2.585位之间的2.39位),且质量在统计上与全键值缓存无差异。

本文的主要贡献如下:

1.  **分数字位网格上的质量断崖图**:我们在预设的多种子统计协议下,在分数字位网格上绘制均匀键值量化图,并定位了位于(2.0, 2.322]位之间的质量断崖——其灾难性转变在该基准下的预填充、生成和多轮协议中重现(多轮还显示出一个小的高于断崖的底层;第4.6节);在主要的单轮LongBench协议中,区域[2.322, 3.0]在统计上与全键值缓存无差异。
2.  **通过全标记保留混合精度实现网格插值**:SemKV保留所有标记,并通过重要性排序的两级分配在高于断崖的网格点之间插值,达到全键值缓存无统计可检测缺陷的、原本无法达到的平均精度——在2.39位工作点,包含元数据,测量显示键值存储缩减了6.0倍。对八种模型内部指标(隐藏状态、键值范数、logit和注意力系列)的消融研究表明,在平坦区域效果是结构性的:指标选择在那里不会改变结果。
3.  **生成标记和多轮扩展**:一种分块精确的延迟量化机制将标记级混合精度扩展到生成时的标记;在仿射基准下,生成质量在2.0位急剧退化,而2.322位生成在统计上与FP16无差异,并且该扩展在多轮对话中成立。
4.  **删除 vs. 低精度保留**:在匹配(实际上是更不利的)内存预算下,FP16修剪崩溃(0.065–0.149),而SemKV在2.39位下与全键值缓存(0.438)无统计可检测差异;随机修剪与基于指标的修剪在统计上无差异,并表现出相同的定性崩溃,这表明在本次受控比较中,标记删除是失败的主要来源。
5.  **压力测试与迁移**:一个其低端位于断崖之下的加宽间隙压力测试,在测试的模型内部指标之间产生了清晰的排序,表明当大多数标记获得低于断崖的精度时,指标质量变得重要。断崖和插值特性可迁移到Mistral-7B-Instruct-v0.3,在该模型上,使用信息性指标时,SemKV在统计上与全键值缓存无差异。将基准量化器替换为TurboQuant-MSE表明断崖依赖于量化器,并且其下移是全局性的:崩溃边界在预填充和多轮中向下移动一个网格步至(1.585, 2.0],在生成侧移动到(1.0, 1.585],而SemKV的标记轴分配保持不变,以更小的有效占用空间匹配TurboQuant的通道轴2.5位方案,并在性能与全键值缓存无统计差异(7.9倍)的仿射不可及的1.9代码位间隙中占据位置。

## 2 相关工作
### 2.1 键值缓存量化
在长上下文大语言模型推理中,键值缓存随输入长度成比例增长,当使用长上下文和大批次大小时,成为主要的GPU内存瓶颈。为解决此问题,近年来键值缓存量化方法被积极开发。KVQuant [1]针对亚4位键值缓存量化,结合了键缓存的逐通道量化、旋转位置编码前的键量化、非均匀数据类型以及异常值感知的密集-稀疏量化,即使在3位级别也能实现低性能损失。KIVI [2]分析键值缓存的分布特征,提出了一种非对称2位键值缓存量化方法,对键缓存进行逐通道量化,对值缓存进行逐标记量化。TurboQuant [9]从量化器设计视角出发:它应用随机旋转使坐标接近已知分布,用分布匹配的最优(Lloyd–Max)标量量化器量化每个坐标,并可选择使用1位残差素描校正内积偏置,在无需校准数据的情况下实现近乎最优的失真;其分数字位工作点(例如2.5位)通过*通道级*混合精度实现,该方法以更高位宽量化异常通道。因此,TurboQuant与SemKV在两个轴上正交:它改进了每向量量化器,同时在*通道*上分配精度,而SemKV在分数字位网格上跨*标记*分配精度;两者可以结合,第4.9节评估了以TurboQuant作为基准量化器的SemKV。

通用的大语言模型量化研究也与SemKV相关。SmoothQuant [3]、GPTQ [4]、AWQ [5]、LLM.int8() [6]、ZeroQuant [7]、QServe [8]、QuaRot [10]、Atom [11]、基于块重建的训练后量化[56]以及训练后量化[57-59]旨在通过权重或激活量化提高大语言模型推理效率。然而,这些研究主要集中在张量、通道或权重级量化。相比之下,SemKV的不同之处在于,它基于标记级语义重要性分配键值缓存精度。更接近SemKV的一系列工作应用*混合精度*键值量化。MiKV [71]将本应被驱逐的键值对以低精度保留,重要对以高精度保留,重要性从外部驱逐策略(如H2O)导入;QAQ [72]根据标记重要性和敏感性调整位分配;SKVQ [73]结合截断动态量化和高精度近因窗口;ZipCache [74]通过归一化注意力分数识别显著标记;GEAR [75]将大多数条目压缩到超低精度并进行低秩残差校正;WKVQuant [76]和RotateKV [77]以高精度保留近期或锚点标记;IntactKV [78]保持异常标记缓存完整。最近的研究也直接研究了标记数量与精度的权衡[79]。

SemKV与这些方法在三个方面不同。首先,SemKV将标记重要性视为可插拔的模型内部信号,并系统评估了四个系列(隐藏状态、键值、logit和注意力)中的八个指标,而不是依赖于单一的驱逐策略或固定位置启发式方法。其次,SemKV明确映射了分数字位网格上的均匀量化质量断崖,并将混合精度定位为*严格在断崖之上的网格插值*,这解释了*何时*分配重要(在断崖附近或以下)以及*何时*不重要(平坦区域)。第三,相同的基于排序的机制在预设的多种子统计协议下被分块精确地扩展到生成时的标记和多轮推理。

### 2.2 键值缓存压缩与驱逐
减少键值缓存内存的另一个方向是驱逐或压缩,仅保留键值缓存标记的一个子集并移除其余部分。基于“重磅”标记在注意力中被重复且重要地引用的观察,H2O [13]提出了一种键值缓存驱逐策略,同时保留近期标记和重磅标记。SnapKV [14]在生成前观察窗口内观察注意力模式,并选择每个注意力头关注的重要键值位置。PyramidKV [15]利用金字塔式信息漏斗现象,即层间信息流在下层广泛分布,在上层集中在核心标记上。KVzip [81]根据键值对对重构原始上下文的必要性进行评分,实现查询无关的驱逐,其压缩后的缓存可在后续查询中重复使用。FastGen [17]、ChunkKV [18]、InfLLM [19]、RetrievalAttention [20]、上下文压缩[66]和语义感知缓存压缩[67]也针对长上下文推理中的键值缓存或注意力压缩。尽管这些研究在减少键值缓存大小方面有效,但它们通常依赖于选择或移除一部分键值标记。相比之下,SemKV不移除标记。SemKV保留所有标记,仅根据重要性调整其精度。

### 2.3 标记修剪与稀疏推理
标记修剪和稀疏推理研究旨在通过减少输入标记或中间标记的数量来减少计算和内存。LazyLLM [21]、DynamicViT [22]、Token Merging [23]、TokenLearner [24]和Adaptive Token Pruning [55]基于标记重要性执行动态标记选择或合并。Sparse Transformer [25]、Longformer [26]和Big Bird [27]使注意力模式本身稀疏,以支持处理长序列。然而,修剪或稀疏选择可能会移除标记本身或限制其可访问性。由于SemKV保留所有标记并仅调整其精度,它是一种从根本上不同于修剪的全标记保留压缩方法。

### 2.4 高效注意力与长上下文推理
FlashAttention [28]和FlashAttention-2 [29]通过IO感知的精确注意力极大地提高了注意力计算效率。RoFormer [30]通过旋转位置嵌入改进了Transformer的位置表示。StreamingLLM [16]利用注意力锚点现象,即使对于长流序列也能实现稳定推理。ALiBi [65]解决了将Transformer外推到比训练期间所见更长上下文的难题。这些研究提高了注意力计算或位置泛化能力,而SemKV是一种互补方法,它使用语义混合精度压缩键值缓存本身。

相似文章

KV Packet: 免重计算的上下文无关KV缓存用于大语言模型

Hugging Face Daily Papers

KV Packet 提出了一种免重计算的缓存复用框架,用于大语言模型。该框架使用可训练的软标记适配器来弥合上下文不连续性,消除了开销,同时在 Llama-3.1 和 Qwen2.5 上的性能与完全重计算基线相当。