Grouped Value Attention: 通过按需键重建实现高效KV缓存
摘要
Grouped Value Attention通过存储分组值并通过学习到的线性映射重建键来减少Transformer的KV缓存大小,以更小的持久缓存实现接近GQA的准确率。
查看缓存全文
缓存时间: 2026/09/15 10:41
论文页面 - 分组值注意力:通过按需键重建实现高效KV缓存
来源: https://huggingface.co/papers/2609.13285
摘要
分组值注意力通过存储分组值并利用学习的线性映射重建键来减少Transformer的KV缓存大小,以更小的持久缓存实现接近分组查询注意力的准确率。
KV缓存(https://huggingface.co/papers?q=KV%20cache)是Transformer解码的主要瓶颈:其内存占用和缓存读取流量随序列长度增加而增长。分组查询注意力(https://huggingface.co/papers?q=Grouped-query%20attention)(GQA)通过共享键值头降低了这一开销,但每一步仍需同时存储键和值。我们提出了分组值注意力(https://huggingface.co/papers?q=Grouped%20Value%20Attention)(GVA),该方法存储分组值并通过学习的线性映射重建内容键(https://huggingface.co/papers?q=content%20keys)。在推理阶段,该映射可被吸收到查询计算中,从而无需在预定解码路径中显式生成内容键。一个小型共享的解耦RoPE(https://huggingface.co/papers?q=decoupled%20RoPE)通道通过单独缓存的位置键(https://huggingface.co/papers?q=positional%20key)保留位置信息。在研究的配置中,这种表示方式相对于匹配的GQA配置,将持久缓存的标量数量减少了约45-47%。在3.5亿参数规模、使用300亿FineWeb-Edu令牌训练的情况下,16维位置变体在五项任务上达到44.18的平均准确率,而GQA为44.36,MLA为43.88。这些结果表明该紧凑缓存表示能够达到接近GQA基准测试的准确率。为了将这种紧凑表示转化为更快的自回归推理(https://huggingface.co/papers?q=autoregressive%20inference),我们已开发了定制的解码内核(https://huggingface.co/papers?q=decoding%20kernels),目前正在评估其端到端推理性能,并计划即将开源发布。
查看arXiv页面 (https://arxiv.org/abs/2609.13285) 查看PDF (https://arxiv.org/pdf/2609.13285) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.13285)
在您的代理中获取此论文:
hf papers read 2609\.13285
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
没有模型关联本文 在模型的README.md中引用 arxiv.org/abs/2609.13285 以将其链接到此页面。
引用本文的数据集0
没有数据集关联本文 在数据集的README.md中引用 arxiv.org/abs/2609.13285 以将其链接到此页面。
引用本文的Spaces0
没有Space关联本文 在Space的README.md中引用 arxiv.org/abs/2609.13285 以将其链接到此页面。
包含本文的收藏1
相似文章
@che_shr_cat: 1/ 多年来我们一直通过头部共享(GQA/MQA)来优化KV缓存,但我们忽略了一个基本假设:为什么……
这条推文挑战了关于Transformer需要独立的Q、K和V投影的基本假设,提出合并它们可以为KV缓存带来巨大的内存节省。
ResKV:重构被省略的注意力贡献以实现固定预算的KV缓存压缩
ResKV提出了一种KV缓存压缩方法,将固定预算分为精确的主缓存和紧凑的残差缓存,以重构被省略的注意力贡献,从而在多个骨干网络上提升LongBench和RULER上的性能。
通过变换编码视角的KV缓存压缩
本文提出了注意力感知变换编码(AATC)用于压缩大语言模型中的KV缓存,通过注意力机制最小化失真,在约5.8倍压缩下实现了近乎无损的准确率。
在查询关注之处分配比特:具有注意力保持变换的KV缓存向量量化
本文提出NOVA-KV,一种用于KV缓存量化的变换编码方法,它利用注意力保持变换在查询实际关注的位置分配比特,与先前方法相比,在低比特率下提高了长上下文检索精度。
CompressKV:语义检索引导的KV缓存压缩方法,用于资源高效的长上下文大语言模型推理
CompressKV针对基于GQA的大语言模型,提出了一种语义检索引导的KV缓存压缩方法,通过识别语义检索头来保留关键令牌。在LongBench任务中,仅使用3%的KV缓存即可实现超过97%的全缓存性能。