在查询关注之处分配比特:具有注意力保持变换的KV缓存向量量化
摘要
本文提出NOVA-KV,一种用于KV缓存量化的变换编码方法,它利用注意力保持变换在查询实际关注的位置分配比特,与先前方法相比,在低比特率下提高了长上下文检索精度。
arXiv:2608.04074v1 公告类型:新
摘要:长上下文大语言模型解码在每一步都读取键值(KV)缓存。加载缓存的时间比计算注意力乘积更长,因此吞吐量受带宽限制。因此,减小缓存大小可以提高解码速度和服务容量。挑战在于在保持注意力乘积、重建代价低廉以及使用固定的每令牌比特数的同时减小缓存大小。在每元素两比特的情况下,最有竞争力的方法依赖于正交变换。然而,现有技术要么是数据无关的,要么使用查询统计信息而不从失真准则推导变换。此外,它们依赖于基于随机旋转或Hadamard旋转构建的变换,这些变换均衡各条目之间的方差而非压缩能量,并且使用固定宽度的标量量化器,在低比特率下是次优的。本文将KV缓存量化问题建模为变换编码问题,其中失真定义为注意力乘积的误差。我们基于高分辨率模型,从校准统计数据中为键和值推导出闭式最优变换。我们证明最优键变换不是正交的,并且满足广义Parseval关系:注意力感知失真在变换域中变为均方误差(MSE)。因此,我们可以直接对变换后的键系数应用MSE最优向量量化器。为了满足固定宽度布局要求,我们证明将系数分组为等体积分区可以使等大小码本在同一高分辨率模型下达到变速率最优。在每元素两比特的情况下,我们的方法NOVA-KV能够恢复标量量化方法在相近吞吐量下丢失的大部分长上下文检索精度。
查看缓存全文
缓存时间: 2026/08/06 07:45
# KV 缓存向量量化与注意力保持变换
来源:https://arxiv.org/html/2608.04074
\\contribution [*] 同等贡献
## 把比特花在查询关注之处:具有注意力保持变换的 KV 缓存向量量化
Amir Ziashahabi, Eduardo Pavez, Antonio Ortega, Salman Avestimehr
南加州大学电气与计算机工程系
\{samuelf9,相似文章
量化键偷走注意力:视频扩散中KV缓存压缩的偏差校正
本文指出,在分块自回归视频扩散的KV缓存压缩中,对键进行量化会导致注意力权重出现偏差,并提出了一种每注意力分数校正方法,该方法以可忽略的开销消除偏差,在INT2量化下恢复接近BF16的视频质量。
KV缓存压缩比TurboQuant与逐向量香农极限高出900000倍
一篇新论文提出了一种基于概率语言Trie树和预测差分编码的顺序KV缓存压缩方法。该方法通过利用语言模型Token的序列结构而非对向量进行独立处理,实现了超越TurboQuant约91.4万倍的理论压缩比。
ResKV:重构被省略的注意力贡献以实现固定预算的KV缓存压缩
ResKV提出了一种KV缓存压缩方法,将固定预算分为精确的主缓存和紧凑的残差缓存,以重构被省略的注意力贡献,从而在多个骨干网络上提升LongBench和RULER上的性能。
新的 KV 量化方案来了 😍 Welcome OSCAR kv quant 由 Together AI 开源
Together AI 开源了 OSCAR,一种注意力感知的 2 位 KV 缓存量化系统,通过根据注意力重要性重新分配量化误差,实现了高效的长上下文 LLM 服务。
SelKV:基于逐标记合并或丢弃及注意力补偿的选择性 KV 缓存合并
SelKV 是一个无需训练的 KV 缓存压缩框架,它使用软余弦门进行选择性合并,并通过注意力比例补偿机制纠正 softmax 不平衡,在仅保留 25% 缓存大小的情况下实现近乎无损的生成,在 LongBench 上取得 3.3 倍解码加速。