KVpop:基于预测性在线剪枝的键值缓存压缩
摘要
KVpop提出了一种由未来注意力目标监督的学习型KV缓存驱逐策略,在Qwen3模型上实现了高压缩率(例如,75%压缩率下保持98%性能),同时保持质量。
查看缓存全文
缓存时间: 2026/07/07 10:43
论文页面 - KVpop – 基于预测性在线剪枝的键值缓存压缩
来源:https://huggingface.co/papers/2607.05061 发表于 7月6日
·
由 https://huggingface.co/sirluk 提交
Lukas (https://huggingface.co/sirluk) 于 7月7日
摘要
KVpop 通过直接使用未来注意力目标监督保留或丢弃决策,学习最优的键值缓存逐出策略,在减少内存占用的同时实现了高性能。
键值(KV)缓存增长是自回归解码(https://huggingface.co/papers?q=autoregressive%20decoding)的主要瓶颈,因为内存和带宽随上下文长度线性扩展。现有的 KV 逐出(https://huggingface.co/papers?q=KV%20eviction)方法通常依赖静态启发式规则或代理分数,这些方法难以准确追踪未来 token 的效用,并且在相关性发生变化时导致不稳定的逐出。为了解决这个问题,我们引入了 KVpop,它通过直接监督保留或丢弃决策来学习固定预算的 KV 逐出(https://huggingface.co/papers?q=KV%20eviction)策略。评分器针对一种新颖的未来注意力目标(https://huggingface.co/papers?q=future-attention%20target)进行训练,该目标无需具体化密集的注意力图(https://huggingface.co/papers?q=attention%20maps)即可高效计算。我们进一步引入了一种延迟的基于记忆的评分器(https://huggingface.co/papers?q=delayed%20memory-based%20scorer),这在已学习的逐出方法中独树一帜——它将评分延迟固定步数,以利用近未来的上下文。在 AIME 和 HMMT 数学推理任务上,KVpop 在 Qwen3-4B(https://huggingface.co/papers?q=Qwen3-4B)模型上以 75% 的 KV 缓存压缩(https://huggingface.co/papers?q=KV%20cache%20compression)保留了 98% 的全注意力性能,在 88% 压缩率下保留了 97% 的性能,始终优于已有的逐出基线。Qwen3-8B(https://huggingface.co/papers?q=Qwen3-8B)表现出更强的结果,达到了接近完整教师模型的性能。这些结果表明,使用未来注意力信号监督逐出可以在保持质量的同时降低内存成本。
查看 arXiv 页面(https://arxiv.org/abs/2607.05061)查看 PDF(https://arxiv.org/pdf/2607.05061)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.05061)
在你的智能体中获取此论文:
hf papers read 2607\.05061
没有最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2607.05061 以从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
请在数据集 README.md 中引用 arxiv.org/abs/2607.05061 以从此页面链接。
引用此论文的 Spaces0
没有 Space 链接此论文
请在 Space README.md 中引用 arxiv.org/abs/2607.05061 以从此页面链接。
包含此论文的收藏0
没有收藏包含此论文
请将此论文添加到收藏(https://huggingface.co/new-collection)以从此页面链接。
相似文章
自剪枝键值注意力:通过预测未来效用决定何时写入
提出了自剪枝键值注意力(SP-KV),一种通过学习预测键值对未来效用的机制,动态剪枝KV缓存,将内存使用和解码速度提升3-10倍,且性能下降极小。模型和效用预测器通过下一词元预测进行端到端联合训练。
KV缓存压缩比TurboQuant与逐向量香农极限高出900000倍
一篇新论文提出了一种基于概率语言Trie树和预测差分编码的顺序KV缓存压缩方法。该方法通过利用语言模型Token的序列结构而非对向量进行独立处理,实现了超越TurboQuant约91.4万倍的理论压缩比。
ProxyKV: 跨模型代理剪枝实现高效长上下文LLM推理
ProxyKV是一种跨模型代理剪枝框架,将重要性评分卸载到轻量级小模型上,以更低的预填充开销实现高精度KV缓存剪枝,在Llama-3.1、Qwen-2.5和Qwen-3系列上匹配KVZip的准确率。
CompressKV:语义检索引导的KV缓存压缩方法,用于资源高效的长上下文大语言模型推理
CompressKV针对基于GQA的大语言模型,提出了一种语义检索引导的KV缓存压缩方法,通过识别语义检索头来保留关键令牌。在LongBench任务中,仅使用3%的KV缓存即可实现超过97%的全缓存性能。
PolyKV: 异构保留与分配的KV缓存压缩
PolyKV是一种逐层的KV缓存压缩框架,为每一层分配异构的驱逐策略和非均匀的预算,在LongBench上使用LLaMA-3.1-8B和Qwen3-8B相比统一基线有显著提升。