KVpop:基于预测性在线剪枝的键值缓存压缩

Hugging Face Daily Papers 论文

摘要

KVpop提出了一种由未来注意力目标监督的学习型KV缓存驱逐策略,在Qwen3模型上实现了高压缩率(例如,75%压缩率下保持98%性能),同时保持质量。

键值(KV)缓存的增长是自回归解码的主要瓶颈,因为内存和带宽随上下文长度线性扩展。现有的KV驱逐方法通常依赖静态启发式或代理分数,这些方法难以追踪未来令牌的效用,且当相关性发生变化时导致脆弱的驱逐。为了解决这一问题,我们引入了KVpop,它通过学习固定预算的KV驱逐策略,直接监督保留或丢弃的决策。该评分器针对一种新颖的未来注意力目标进行训练,该目标无需实例化密集注意力图即可高效计算。我们还进一步引入了一种基于延迟记忆的评分器,这在学习型驱逐方法中独树一帜,它将评分推迟固定步数以利用近期未来上下文。在AIME和HMMT数学推理任务上,KVpop在Qwen3-4B模型上以75%的KV缓存压缩率保持了全注意力性能的98%,在88%压缩率下保持了97%,始终优于现有的驱逐基线。Qwen3-8B模型表现更佳,达到了接近全教师模型的性能。这些结果表明,使用未来注意力信号监督驱逐可以在保持质量的同时降低内存成本。
查看原文
查看缓存全文

缓存时间: 2026/07/07 10:43

论文页面 - KVpop – 基于预测性在线剪枝的键值缓存压缩

来源:https://huggingface.co/papers/2607.05061 发表于 7月6日

·

由 https://huggingface.co/sirluk 提交

Lukas (https://huggingface.co/sirluk) 于 7月7日

摘要

KVpop 通过直接使用未来注意力目标监督保留或丢弃决策,学习最优的键值缓存逐出策略,在减少内存占用的同时实现了高性能。

键值(KV)缓存增长是自回归解码(https://huggingface.co/papers?q=autoregressive%20decoding)的主要瓶颈,因为内存和带宽随上下文长度线性扩展。现有的 KV 逐出(https://huggingface.co/papers?q=KV%20eviction)方法通常依赖静态启发式规则或代理分数,这些方法难以准确追踪未来 token 的效用,并且在相关性发生变化时导致不稳定的逐出。为了解决这个问题,我们引入了 KVpop,它通过直接监督保留或丢弃决策来学习固定预算的 KV 逐出(https://huggingface.co/papers?q=KV%20eviction)策略。评分器针对一种新颖的未来注意力目标(https://huggingface.co/papers?q=future-attention%20target)进行训练,该目标无需具体化密集的注意力图(https://huggingface.co/papers?q=attention%20maps)即可高效计算。我们进一步引入了一种延迟的基于记忆的评分器(https://huggingface.co/papers?q=delayed%20memory-based%20scorer),这在已学习的逐出方法中独树一帜——它将评分延迟固定步数,以利用近未来的上下文。在 AIME 和 HMMT 数学推理任务上,KVpop 在 Qwen3-4B(https://huggingface.co/papers?q=Qwen3-4B)模型上以 75% 的 KV 缓存压缩(https://huggingface.co/papers?q=KV%20cache%20compression)保留了 98% 的全注意力性能,在 88% 压缩率下保留了 97% 的性能,始终优于已有的逐出基线。Qwen3-8B(https://huggingface.co/papers?q=Qwen3-8B)表现出更强的结果,达到了接近完整教师模型的性能。这些结果表明,使用未来注意力信号监督逐出可以在保持质量的同时降低内存成本。

查看 arXiv 页面(https://arxiv.org/abs/2607.05061)查看 PDF(https://arxiv.org/pdf/2607.05061)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.05061)

在你的智能体中获取此论文:

hf papers read 2607\.05061

没有最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

请在模型 README.md 中引用 arxiv.org/abs/2607.05061 以从此页面链接。

引用此论文的数据集0

没有数据集链接此论文

请在数据集 README.md 中引用 arxiv.org/abs/2607.05061 以从此页面链接。

引用此论文的 Spaces0

没有 Space 链接此论文

请在 Space README.md 中引用 arxiv.org/abs/2607.05061 以从此页面链接。

包含此论文的收藏0

没有收藏包含此论文

请将此论文添加到收藏(https://huggingface.co/new-collection)以从此页面链接。

相似文章

自剪枝键值注意力:通过预测未来效用决定何时写入

arXiv cs.LG

提出了自剪枝键值注意力(SP-KV),一种通过学习预测键值对未来效用的机制,动态剪枝KV缓存,将内存使用和解码速度提升3-10倍,且性能下降极小。模型和效用预测器通过下一词元预测进行端到端联合训练。

KV缓存压缩比TurboQuant与逐向量香农极限高出900000倍

Hacker News Top

一篇新论文提出了一种基于概率语言Trie树和预测差分编码的顺序KV缓存压缩方法。该方法通过利用语言模型Token的序列结构而非对向量进行独立处理,实现了超越TurboQuant约91.4万倍的理论压缩比。

PolyKV: 异构保留与分配的KV缓存压缩

arXiv cs.LG

PolyKV是一种逐层的KV缓存压缩框架,为每一层分配异构的驱逐策略和非均匀的预算,在LongBench上使用LLaMA-3.1-8B和Qwen3-8B相比统一基线有显著提升。