RestoreKV:在激进的查询无关KV缓存驱逐下恢复全缓存行为
摘要
RestoreKV 引入了一种学习式恢复机制,作为查询无关 KV 缓存驱逐的补充;它通过一次 LoRA 适配的遍历生成紧凑的上下文条件恢复缓存,从而在激进预算下恢复全缓存行为,并在四个长上下文基准上提升了性能。
查看缓存全文
缓存时间: 2026/08/05 17:46
论文页面 - RestoreKV:在激进的无查询感知KV缓存驱逐下恢复全缓存行为
来源:https://huggingface.co/papers/2608.01247
摘要
无查询感知的KV缓存驱逐(Query-agnostic KV cache eviction)仅压缩一次上下文,并将生成的缓存复用于任意未来查询,但在紧凑预算下性能可能崩溃。现有方法主要改进保留哪些原始KV对。我们提出RestoreKV,以相同的总KV预算,用学习式恢复来补充这种基于选择的方案。我们的关键洞察是:尽管驱逐造成的信息损失因上下文而异,但生成其紧凑互补信息的机制可以在不同上下文间共享。在上下文预填充后,少量恢复令牌(restore tokens)在一次LoRA适配的pass中关注完整KV缓存,生成一个紧凑的、由上下文条件化的恢复缓存。基础重要性评分器和驱逐规则保持不变,适配器在后续所有查询和解码阶段均被禁用。RestoreKV通过冻结的全缓存模型的参数高效自蒸馏进行训练,仅优化0.4%的参数,且无需任何任务特定微调。在四个骨干模型和四个长上下文基准上,RestoreKV显著减少了压缩导致的性能退化。在Qwen3-4B上,它改善了五种基础驱逐方法在60个配对、预算匹配设置中的59个;在5%预算下,它将RULER-4K上KV zip的得分从38.2提升至73.2。将RestoreKV应用于KV zip+,在KVPress基准上达到86.4的RULER准确率,压缩倍数高达16倍,同时在32K上下文评估中仅增加不到0.5%的一次性缓存构建开销。我们的项目页面位于 https://paper.pnu-cvsp.com/RestoreKV/
查看arXiv页面 (https://arxiv.org/abs/2608.01247) 查看PDF (https://arxiv.org/pdf/2608.01247) 项目页面 (https://paper.pnu-cvsp.com/RestoreKV/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.01247)
在你的agent中获取这篇论文:
hf papers read 2608\.01247
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型1
higokri/RestoreKV 文本生成• 1天前更新 • 1 (https://huggingface.co/higokri/RestoreKV)
引用此论文的数据集0
没有关联此论文的数据集
在数据集README.md中引用 arxiv.org/abs/2608.01247 以从此页面链接它。
引用此论文的Spaces0
没有关联此论文的Space
在Space README.md中引用 arxiv.org/abs/2608.01247 以从此页面链接它。
包含此论文的收藏1
相似文章
ResKV:重构被省略的注意力贡献以实现固定预算的KV缓存压缩
ResKV提出了一种KV缓存压缩方法,将固定预算分为精确的主缓存和紧凑的残差缓存,以重构被省略的注意力贡献,从而在多个骨干网络上提升LongBench和RULER上的性能。
ReST-KV:基于逐层输出重构与时空平滑的鲁棒 KV Cache 驱逐方法
本文介绍了 ReST-KV,一种用于大型语言模型的新型鲁棒 KV Cache 驱逐方法。该方法利用逐层输出重构与时空平滑技术来提升效率,显著降低了解码延迟,并在 LongBench 和 RULER 等长上下文基准测试中超越了现有的最先进基线模型。
CompressKV:语义检索引导的KV缓存压缩方法,用于资源高效的长上下文大语言模型推理
CompressKV针对基于GQA的大语言模型,提出了一种语义检索引导的KV缓存压缩方法,通过识别语义检索头来保留关键令牌。在LongBench任务中,仅使用3%的KV缓存即可实现超过97%的全缓存性能。
CONF-KV: 置信度感知的KV缓存淘汰与混合精度存储用于长视界大语言模型
CONF-KV 是一种KV缓存管理系统,利用模型不确定性动态调整缓存保留策略,从而提升长上下文大语言模型推理的内存效率,同时将困惑度控制在1.5-2.1个点以内。
PolyKV: 异构保留与分配的KV缓存压缩
PolyKV是一种逐层的KV缓存压缩框架,为每一层分配异构的驱逐策略和非均匀的预算,在LongBench上使用LLaMA-3.1-8B和Qwen3-8B相比统一基线有显著提升。