BeaconKV:基于信标查询的键值缓存压缩技术,用于高效大型推理模型推理

Hugging Face Daily Papers 论文

摘要

BeaconKV 是一种无需训练的方法,它使用信标查询来压缩键值缓存,以实现大型推理模型的高效推理,从而减少内存使用并提高吞吐量,且不牺牲准确性。

大型推理模型(LRMs)通过扩展的思维链(CoT)生成实现卓越的问题解决能力,但由此产生的键值(KV)缓存随序列长度线性增长,导致严重的内存瓶颈,常常超出长推理轨迹的GPU容量。现有的KV缓存压缩方法依赖最近的查询来估计未来令牌的重要性,隐含地假设这些查询作为未来注意力模式的可靠代理。我们证明了这一假设在长程推理中失效:某些解码步骤生成思维回顾令牌(TRT),这些令牌会重新关注遥远的先前上下文,例如在轨迹早期制定的任务解决计划。通过系统分析,我们发现与TRT对应的查询在嵌入空间中聚类成少数几个相似度组。基于这一洞察,我们提出了BeaconKV,一种无需训练的KV缓存压缩方法,它维护信标查询,作为每个全局查询簇的紧凑代表,以预测哪些KV对将被重新访问,而无需存储整个查询历史。在四个开源LRMs和多种推理基准测试中,BeaconKV通常优于现有压缩方法,实现了高达5.8倍的内存减少,同时几乎保持了全缓存准确性,并将吞吐量提高了超过4.3倍。
查看原文
查看缓存全文

缓存时间: 2026/09/09 08:32

论文页面 - BeaconKV:由信标查询引导的键值缓存压缩,用于高效的大推理模型推理

来源:https://huggingface.co/papers/2609.04971 发布于9月4日

·

由https://huggingface.co/kkt20提交

jhk (https://huggingface.co/kkt20)于9月9日

摘要

BeaconKV 通过使用紧凑的信标查询来预测哪些过去的键值对将被重新访问,从而在不牺牲准确性的情况下减少缓存大小,提高了长推理链的内存效率。

大型推理模型(https://huggingface.co/papers?q=Large%20Reasoning%20Models)(LRM)通过扩展的思维链(https://huggingface.co/papers?q=Chain-of-Thought)(CoT)生成实现了卓越的问题解决能力,但由此产生的键值(KV)缓存随序列长度线性增长,在长推理链中造成了严重的内存瓶颈,常常超出 GPU 容量。现有的 KV 缓存压缩(https://huggingface.co/papers?q=KV%20cache%20compression)方法依赖于最近的查询来估计未来令牌的重要性,隐含地假设这些查询可以作为未来注意力模式的可靠代理。我们证明,在长程推理中这一假设会失效:某些解码步骤会生成思维回溯令牌(https://huggingface.co/papers?q=Thought%20Revisiting%20Tokens)(TRT),这些令牌会重新关注较早出现在推理链中的远距离上下文,例如早期制定的解任务计划。通过系统分析,我们发现对应于 TRT 的查询在嵌入空间中聚集到少数几个相似组中。基于这一洞见,我们提出了 BeaconKV(https://huggingface.co/papers?q=BeaconKV),这是一种无需训练的 KV 缓存压缩(https://huggingface.co/papers?q=KV%20cache%20compression)方法,它维护着信标查询(https://huggingface.co/papers?q=beacon%20queries)——每个全局查询组的紧凑代表,用以预测哪些 KV 对将被重新访问,而无需存储整个查询历史记录。在四个开源 LRM 和各种推理基准测试中,BeaconKV(https://huggingface.co/papers?q=BeaconKV)通常优于现有的压缩方法,在几乎保持完整缓存精度的同时,最高可减少 5.8 倍内存,并将吞吐量提高超过 4.3 倍。

查看 arXiv 页面 (https://arxiv.org/abs/2609.04971)查看 PDF (https://arxiv.org/pdf/2609.04971)GitHub1 (https://github.com/aiha-lab/BeaconKV)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.04971)

通过您的代理获取此论文:

hf papers read 2609\.04971

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2609.04971 以从此页面链接它。

引用此论文的数据集0

无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2609.04971 以从此页面链接它。

引用此论文的空间0

无空间链接此论文

在空间 README.md 中引用 arxiv.org/abs/2609.04971 以从此页面链接它。

包含此论文的收藏集0

无收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接它。

相似文章

面向长推理的信息感知KV缓存压缩

arXiv cs.CL

本文提出InfoKV,一种熵感知的KV缓存压缩框架,结合了token级别的预测不确定性和注意力分数,以提高长上下文推理效率。实验表明,它在Llama-3.1、Llama-3.2和DeepSeek-R1上优于现有的基于注意力的方法。