REAL:面向长上下文KV缓存压缩的检索-推理与逻辑构建注意力行为
摘要
REAL引入了一种注意力行为矩阵,用于分析成功与失败案例中注意力头的行为,从而实现更有效的KV缓存驱逐。它在达到与最强基线相当准确度的同时,所需空间减少32倍。
查看缓存全文
缓存时间: 2026/07/13 08:00
# REAL: 面向长上下文KV缓存压缩的检索-推理与逻辑构建注意力行为 来源:https://arxiv.org/abs/2508.15806 查看 PDF(https://arxiv.org/pdf/2508.15806) > **摘要:**大语言模型序列长度的不断增长给键值(KV)缓存带来了巨大挑战。现有最先进的缓存淘汰方法主要分析成功检索-推理案例中注意力头的推理行为,而往往忽略了失败案例中的多样化行为,例如偏见和干扰。这一疏忽限制了利用异构头部行为来提升淘汰性能的潜力。受混淆矩阵启发,我们引入了一个注意力行为矩阵,以全面分析成功和失败场景中的注意力头行为。通过最大化信噪比——在成功案例中强化有效的推理路径,同时在失败案例中抑制来自偏见和干扰的噪声——我们提出了REAL(检索-推理与逻辑构建)KV缓存淘汰方法,这是首个利用多行为分析的方法。全面评估表明,REAL在各种模型和基准测试中均表现出色;值得注意的是,在LongBench v2上,它实现了与最强基线HeadKV-R2相当的准确率,同时所需空间减少了32倍(图1)。通过提供行为分析的新视角,我们为长上下文建模从仅关注成功的方法向全面的、感知失败的方法转变铺平了道路。我们的代码可在以下https URL获取:https://github.com/yonseicasl/REAL ## 提交历史 来自:Mengjie Li [查看邮件](https://arxiv.org/show-email/5e3e306f/2508.15806) **[**[v1](https://arxiv.org/abs/2508.15806v1)**]** 2025年8月14日星期四 14:08:58 UTC(992 KB) **[v2]** 2026年7月10日星期五 13:38:08 UTC(1,079 KB)
相似文章
Random Attention:重新思考高效推理的KV缓存驱逐策略
本文提出了一种名为Random Attention的KV缓存驱逐方法,它使用随机选择而非评分,匹配选择性方法的同时提高推理任务中的吞吐量。
ResKV:重构被省略的注意力贡献以实现固定预算的KV缓存压缩
ResKV提出了一种KV缓存压缩方法,将固定预算分为精确的主缓存和紧凑的残差缓存,以重构被省略的注意力贡献,从而在多个骨干网络上提升LongBench和RULER上的性能。
面向长推理的信息感知KV缓存压缩
本文提出InfoKV,一种熵感知的KV缓存压缩框架,结合了token级别的预测不确定性和注意力分数,以提高长上下文推理效率。实验表明,它在Llama-3.1、Llama-3.2和DeepSeek-R1上优于现有的基于注意力的方法。
Thought-Aware KV Cache Compaction for Reasoning via Adaptive Attention Matching
This paper introduces Thought-Aware Attention Matching (TAM), a method for compressing KV caches during long chain-of-thought reasoning by segmenting reasoning traces, adaptively allocating compression budgets, and protecting pivotal tokens. Experiments on AIME 2024 and MATH-500 with Qwen3-4B show significant memory reduction while maintaining accuracy.
CompressKV:语义检索引导的KV缓存压缩方法,用于资源高效的长上下文大语言模型推理
CompressKV针对基于GQA的大语言模型,提出了一种语义检索引导的KV缓存压缩方法,通过识别语义检索头来保留关键令牌。在LongBench任务中,仅使用3%的KV缓存即可实现超过97%的全缓存性能。