REAL:面向长上下文KV缓存压缩的检索-推理与逻辑构建注意力行为
摘要
REAL引入了一种注意力行为矩阵,用于分析成功与失败案例中注意力头的行为,从而实现更有效的KV缓存驱逐。它在达到与最强基线相当准确度的同时,所需空间减少32倍。
arXiv:2508.15806v2 公告类型:替换
摘要:大语言模型序列长度的不断增长对键值(KV)缓存带来了重大挑战。现有最先进的缓存驱逐方法主要分析成功检索-推理案例中注意力头的推理行为,往往忽略了失败案例中的多样化行为,如偏差与分心。这一忽视限制了利用异构头行为来提升驱逐性能的潜力。受混淆矩阵的启发,我们引入了一种注意力行为矩阵,用于全面分析成功与失败场景中注意力头的行为。通过最大化信噪比——在成功案例中强化有效推理路径,同时在失败案例中抑制来自偏差和分心的噪声——我们提出了检索-推理与逻辑构建(REAL)KV缓存驱逐方法,这是首个利用多行为分析的方法。全面评估表明,REAL在各种模型和基准测试中均表现出色;尤其在LongBench v2上,它达到了与最强基线HeadKV-R2相当的准确度,但所需空间减少32倍(图1)。通过提供行为分析的新视角,我们为长上下文建模从仅关注成功向全面、感知失败的方法转变铺平了道路。我们的代码可在 https://github.com/yonseicasl/REAL 获取。
查看缓存全文
缓存时间: 2026/07/13 08:00
# REAL: 面向长上下文KV缓存压缩的检索-推理与逻辑构建注意力行为 来源:https://arxiv.org/abs/2508.15806 查看 PDF(https://arxiv.org/pdf/2508.15806) > **摘要:**大语言模型序列长度的不断增长给键值(KV)缓存带来了巨大挑战。现有最先进的缓存淘汰方法主要分析成功检索-推理案例中注意力头的推理行为,而往往忽略了失败案例中的多样化行为,例如偏见和干扰。这一疏忽限制了利用异构头部行为来提升淘汰性能的潜力。受混淆矩阵启发,我们引入了一个注意力行为矩阵,以全面分析成功和失败场景中的注意力头行为。通过最大化信噪比——在成功案例中强化有效的推理路径,同时在失败案例中抑制来自偏见和干扰的噪声——我们提出了REAL(检索-推理与逻辑构建)KV缓存淘汰方法,这是首个利用多行为分析的方法。全面评估表明,REAL在各种模型和基准测试中均表现出色;值得注意的是,在LongBench v2上,它实现了与最强基线HeadKV-R2相当的准确率,同时所需空间减少了32倍(图1)。通过提供行为分析的新视角,我们为长上下文建模从仅关注成功的方法向全面的、感知失败的方法转变铺平了道路。我们的代码可在以下https URL获取:https://github.com/yonseicasl/REAL ## 提交历史 来自:Mengjie Li [查看邮件](https://arxiv.org/show-email/5e3e306f/2508.15806) **[**[v1](https://arxiv.org/abs/2508.15806v1)**]** 2025年8月14日星期四 14:08:58 UTC(992 KB) **[v2]** 2026年7月10日星期五 13:38:08 UTC(1,079 KB)
相似文章
面向长推理的信息感知KV缓存压缩
本文提出InfoKV,一种熵感知的KV缓存压缩框架,结合了token级别的预测不确定性和注意力分数,以提高长上下文推理效率。实验表明,它在Llama-3.1、Llama-3.2和DeepSeek-R1上优于现有的基于注意力的方法。
REAL: 一种用于LLMs长期记忆管理的推理增强图框架
REAL是一种用于LLMs长期记忆管理的推理增强图框架,它利用时间与置信度感知的有向属性图,采用非破坏性时间更新和混合波束搜索检索,平均性能提升22.72%。
CompressKV:语义检索引导的KV缓存压缩方法,用于资源高效的长上下文大语言模型推理
CompressKV针对基于GQA的大语言模型,提出了一种语义检索引导的KV缓存压缩方法,通过识别语义检索头来保留关键令牌。在LongBench任务中,仅使用3%的KV缓存即可实现超过97%的全缓存性能。
基于顿悟感知的KV缓存淘汰方法(无需注意力矩阵)
本文介绍了EpiKV,一种基于内部表征变化(顿悟分数)而非注意力权重来评估token重要性的KV缓存淘汰方法,无需具体化注意力矩阵。该方法在推理基准测试中取得了具有竞争力的性能,同时支持长达16倍的上下文长度。
基于局部注意力的检索:在LongMemEval、LoCoMo和代码搜索基准上达到SOTA结果
Attemory 是一个开源本地记忆检索引擎,它使用基于注意力的检索来访问 KV 缓存,而非传统的嵌入或 BM25 方法,在 LongMemEval、LoCoMo 和代码搜索基准测试中取得了最先进的成绩。