RestoreKV:在激进的查询无关KV缓存驱逐下恢复全缓存行为

Hugging Face Daily Papers 论文

摘要

RestoreKV 引入了一种学习式恢复机制,作为查询无关 KV 缓存驱逐的补充;它通过一次 LoRA 适配的遍历生成紧凑的上下文条件恢复缓存,从而在激进预算下恢复全缓存行为,并在四个长上下文基准上提升了性能。

查询无关的 KV 缓存驱逐会一次性压缩上下文,并将生成的缓存复用于任意未来查询,但在紧张的预算下性能可能会崩溃。现有方法主要改进保留哪些原始 KV 对。我们提出了 RestoreKV,它在相同的总 KV 预算下,用学习式恢复来补充这种基于选择的方案。我们的关键洞见是,虽然驱逐导致丢失的信息是上下文特定的,但生成其紧凑补充的机制可以在不同上下文之间共享。在上下文预填充之后,少量恢复令牌通过一次 LoRA 适配的遍历关注完整 KV 缓存,生成一个紧凑的、依赖上下文的恢复缓存。基础重要性评分器和驱逐规则保持不变,并且适配器在后续所有查询和解码中均被禁用。RestoreKV 通过从冻结的全缓存模型进行参数高效的自蒸馏来训练,仅优化 0.4% 的参数,且无需任务特定微调。在四个主干模型和四个长上下文基准上,RestoreKV 大幅减少了压缩引起的性能下降。在 Qwen3-4B 上,它在五种基础驱逐方法的 60 组成对、预算匹配的设置中改善了 59 组;在 5% 预算下,它将 RULER-4K 上的 KVzip 从 38.2 提高到 73.2。应用于 KVzip+ 时,RestoreKV 在 KVPress Benchmark 上以 16 倍压缩达到 86.4 的 RULER 准确率,同时在 32K 上下文评估中只增加不到 0.5% 的一次性缓存构建开销。我们的项目页面位于 https://paper.pnu-cvsp.com/RestoreKV/
查看原文
查看缓存全文

缓存时间: 2026/08/05 17:46

论文页面 - RestoreKV:在激进的无查询感知KV缓存驱逐下恢复全缓存行为

来源:https://huggingface.co/papers/2608.01247

摘要

无查询感知的KV缓存驱逐(Query-agnostic KV cache eviction)仅压缩一次上下文,并将生成的缓存复用于任意未来查询,但在紧凑预算下性能可能崩溃。现有方法主要改进保留哪些原始KV对。我们提出RestoreKV,以相同的总KV预算,用学习式恢复来补充这种基于选择的方案。我们的关键洞察是:尽管驱逐造成的信息损失因上下文而异,但生成其紧凑互补信息的机制可以在不同上下文间共享。在上下文预填充后,少量恢复令牌(restore tokens)在一次LoRA适配的pass中关注完整KV缓存,生成一个紧凑的、由上下文条件化的恢复缓存。基础重要性评分器和驱逐规则保持不变,适配器在后续所有查询和解码阶段均被禁用。RestoreKV通过冻结的全缓存模型的参数高效自蒸馏进行训练,仅优化0.4%的参数,且无需任何任务特定微调。在四个骨干模型和四个长上下文基准上,RestoreKV显著减少了压缩导致的性能退化。在Qwen3-4B上,它改善了五种基础驱逐方法在60个配对、预算匹配设置中的59个;在5%预算下,它将RULER-4K上KV zip的得分从38.2提升至73.2。将RestoreKV应用于KV zip+,在KVPress基准上达到86.4的RULER准确率,压缩倍数高达16倍,同时在32K上下文评估中仅增加不到0.5%的一次性缓存构建开销。我们的项目页面位于 https://paper.pnu-cvsp.com/RestoreKV/

查看arXiv页面 (https://arxiv.org/abs/2608.01247) 查看PDF (https://arxiv.org/pdf/2608.01247) 项目页面 (https://paper.pnu-cvsp.com/RestoreKV/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.01247)

在你的agent中获取这篇论文:

hf papers read 2608\.01247

没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型1

higokri/RestoreKV 文本生成• 1天前更新 • 1 (https://huggingface.co/higokri/RestoreKV)

引用此论文的数据集0

没有关联此论文的数据集

在数据集README.md中引用 arxiv.org/abs/2608.01247 以从此页面链接它。

引用此论文的Spaces0

没有关联此论文的Space

在Space README.md中引用 arxiv.org/abs/2608.01247 以从此页面链接它。

包含此论文的收藏1

相似文章

PolyKV: 异构保留与分配的KV缓存压缩

arXiv cs.LG

PolyKV是一种逐层的KV缓存压缩框架,为每一层分配异构的驱逐策略和非均匀的预算,在LongBench上使用LLaMA-3.1-8B和Qwen3-8B相比统一基线有显著提升。