通过变换编码视角的KV缓存压缩

arXiv cs.LG 论文

摘要

本文提出了注意力感知变换编码(AATC)用于压缩大语言模型中的KV缓存,通过注意力机制最小化失真,在约5.8倍压缩下实现了近乎无损的准确率。

arXiv:2608.14191v1 公告类型:新 摘要:键值(KV)缓存存储了过去令牌的信息,是长上下文推理中的主要内存瓶颈。现有的量化方法通过使用较低精度的数据类型统一表示KV缓存,并设计量化方案以最小化缓存本身的重构误差来解决这一瓶颈,而未考虑该误差如何通过注意力机制传播。我们证明,在白噪声量化模型下,预期的注意力感知失真可分解为可加的键和值贡献,这些贡献在令牌和通道上可因子化。基于变换编码和反向水填充(这些是信号处理和率失真理论中的经典工具),我们引入了注意力感知变换编码(AATC),它通过在校准集上分配比特来最小化注意力感知失真。在Llama-3.1-8B-Instruct和Qwen-2.5-7B-Instruct上,通过LongBench、RULER、GSM8K、MMLU-Pro和MATH-500进行评估,我们的方法在约$5.8\times$压缩下实现了近乎无损的准确率,而每个基线在某些设置中都会下降。
查看原文
查看缓存全文

缓存时间: 2026/08/17 10:22

# 从变换编码视角审视KV缓存压缩
来源:https://arxiv.org/abs/2608.14191
查看PDF (https://arxiv.org/pdf/2608.14191)

> 摘要:键值(KV)缓存存储着历史令牌的信息,是长上下文推理中的主要内存瓶颈。现有量化方法通过使用低精度数据类型统一表示KV缓存,并设计量化方案以最小化缓存本身的重建误差来应对此瓶颈,但忽略了这些误差在注意力机制中的传播。我们证明,在白噪声量化模型下,预期的注意力感知失真可分解为可加的键与值贡献,且这些贡献在令牌与通道维度上具有因子化特性。基于信号处理与率失真理论中的经典工具——变换编码与注水算法,我们提出了注意力感知变换编码(AATC),该方法在校准集上分配比特位以最小化注意力感知失真。在Llama-3.1-8B-Instruct和Qwen-2.5-7B-Instruct模型上,通过LongBench、RULER、GSM8K、MMLU-Pro和MATH-500进行评估,我们的方法在约5.8倍压缩率下实现了近无损的精度,而所有基准方法在某些场景中均出现性能下降。

## 提交历史

来源:Hannah Sophie Laus [查看邮件 (https://arxiv.org/show-email/57f59d7d/2608.14191)] **[版本1]** 2026年8月14日 周五 11:08:01 UTC (129 KB)

相似文章

KV缓存压缩比TurboQuant与逐向量香农极限高出900000倍

Hacker News Top

一篇新论文提出了一种基于概率语言Trie树和预测差分编码的顺序KV缓存压缩方法。该方法通过利用语言模型Token的序列结构而非对向量进行独立处理,实现了超越TurboQuant约91.4万倍的理论压缩比。

KV缓存压缩的风险

arXiv cs.LG

本文从理论上刻画了变压器中KV缓存压缩的极小极大风险,为因果掩码下的精确压缩提供了设计原则,并将其实例化到实用算法中,在LongBench上取得了有前景的结果。