Grouped Value Attention: 通过按需键重建实现高效KV缓存

Hugging Face Daily Papers 论文

摘要

Grouped Value Attention通过存储分组值并通过学习到的线性映射重建键来减少Transformer的KV缓存大小,以更小的持久缓存实现接近GQA的准确率。

KV缓存是Transformer解码的主要瓶颈:其内存占用和缓存读取流量随序列长度增长。分组查询注意力(GQA)通过共享键值头来减少此成本,但仍需在每一步存储键和值。我们引入分组值注意力(GVA),它存储分组值并通过学习到的线性映射重建内容键。在推理时,该映射可以合并到查询中,从而无需在预期的解码路径中实例化内容键。一个小型共享的解耦RoPE通道通过单独缓存的键保留位置信息。对于所研究的配置,此表示相对于匹配的GQA减少了约45-47%的持久缓存标量。在350M参数规模下,使用30B FineWeb-Edu令牌,16维位置变体在五个任务上达到44.18的平均准确率,而GQA为44.36,MLA为43.88。这些结果证明了接近GQA基准准确率的同时具有更紧凑的缓存表示。为了将这种紧凑表示转化为更快的自回归推理,我们已开发自定义解码内核,并正在评估其端到端推理性能,计划很快开源发布。
查看原文
查看缓存全文

缓存时间: 2026/09/15 10:41

论文页面 - 分组值注意力:通过按需键重建实现高效KV缓存

来源: https://huggingface.co/papers/2609.13285

摘要

分组值注意力通过存储分组值并利用学习的线性映射重建键来减少Transformer的KV缓存大小,以更小的持久缓存实现接近分组查询注意力的准确率。

KV缓存(https://huggingface.co/papers?q=KV%20cache)是Transformer解码的主要瓶颈:其内存占用和缓存读取流量随序列长度增加而增长。分组查询注意力(https://huggingface.co/papers?q=Grouped-query%20attention)(GQA)通过共享键值头降低了这一开销,但每一步仍需同时存储键和值。我们提出了分组值注意力(https://huggingface.co/papers?q=Grouped%20Value%20Attention)(GVA),该方法存储分组值并通过学习的线性映射重建内容键(https://huggingface.co/papers?q=content%20keys)。在推理阶段,该映射可被吸收到查询计算中,从而无需在预定解码路径中显式生成内容键。一个小型共享的解耦RoPE(https://huggingface.co/papers?q=decoupled%20RoPE)通道通过单独缓存的位置键(https://huggingface.co/papers?q=positional%20key)保留位置信息。在研究的配置中,这种表示方式相对于匹配的GQA配置,将持久缓存的标量数量减少了约45-47%。在3.5亿参数规模、使用300亿FineWeb-Edu令牌训练的情况下,16维位置变体在五项任务上达到44.18的平均准确率,而GQA为44.36,MLA为43.88。这些结果表明该紧凑缓存表示能够达到接近GQA基准测试的准确率。为了将这种紧凑表示转化为更快的自回归推理(https://huggingface.co/papers?q=autoregressive%20inference),我们已开发了定制的解码内核(https://huggingface.co/papers?q=decoding%20kernels),目前正在评估其端到端推理性能,并计划即将开源发布。

查看arXiv页面 (https://arxiv.org/abs/2609.13285) 查看PDF (https://arxiv.org/pdf/2609.13285) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.13285)

在您的代理中获取此论文:

hf papers read 2609\.13285

没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

没有模型关联本文 在模型的README.md中引用 arxiv.org/abs/2609.13285 以将其链接到此页面。

引用本文的数据集0

没有数据集关联本文 在数据集的README.md中引用 arxiv.org/abs/2609.13285 以将其链接到此页面。

引用本文的Spaces0

没有Space关联本文 在Space的README.md中引用 arxiv.org/abs/2609.13285 以将其链接到此页面。

包含本文的收藏1

相似文章

通过变换编码视角的KV缓存压缩

arXiv cs.LG

本文提出了注意力感知变换编码(AATC)用于压缩大语言模型中的KV缓存,通过注意力机制最小化失真,在约5.8倍压缩下实现了近乎无损的准确率。