BeaconKV:基于信标查询的键值缓存压缩技术,用于高效大型推理模型推理
摘要
BeaconKV 是一种无需训练的方法,它使用信标查询来压缩键值缓存,以实现大型推理模型的高效推理,从而减少内存使用并提高吞吐量,且不牺牲准确性。
查看缓存全文
缓存时间: 2026/09/09 08:32
论文页面 - BeaconKV:由信标查询引导的键值缓存压缩,用于高效的大推理模型推理
来源:https://huggingface.co/papers/2609.04971 发布于9月4日
·
由https://huggingface.co/kkt20提交
jhk (https://huggingface.co/kkt20)于9月9日
摘要
BeaconKV 通过使用紧凑的信标查询来预测哪些过去的键值对将被重新访问,从而在不牺牲准确性的情况下减少缓存大小,提高了长推理链的内存效率。
大型推理模型(https://huggingface.co/papers?q=Large%20Reasoning%20Models)(LRM)通过扩展的思维链(https://huggingface.co/papers?q=Chain-of-Thought)(CoT)生成实现了卓越的问题解决能力,但由此产生的键值(KV)缓存随序列长度线性增长,在长推理链中造成了严重的内存瓶颈,常常超出 GPU 容量。现有的 KV 缓存压缩(https://huggingface.co/papers?q=KV%20cache%20compression)方法依赖于最近的查询来估计未来令牌的重要性,隐含地假设这些查询可以作为未来注意力模式的可靠代理。我们证明,在长程推理中这一假设会失效:某些解码步骤会生成思维回溯令牌(https://huggingface.co/papers?q=Thought%20Revisiting%20Tokens)(TRT),这些令牌会重新关注较早出现在推理链中的远距离上下文,例如早期制定的解任务计划。通过系统分析,我们发现对应于 TRT 的查询在嵌入空间中聚集到少数几个相似组中。基于这一洞见,我们提出了 BeaconKV(https://huggingface.co/papers?q=BeaconKV),这是一种无需训练的 KV 缓存压缩(https://huggingface.co/papers?q=KV%20cache%20compression)方法,它维护着信标查询(https://huggingface.co/papers?q=beacon%20queries)——每个全局查询组的紧凑代表,用以预测哪些 KV 对将被重新访问,而无需存储整个查询历史记录。在四个开源 LRM 和各种推理基准测试中,BeaconKV(https://huggingface.co/papers?q=BeaconKV)通常优于现有的压缩方法,在几乎保持完整缓存精度的同时,最高可减少 5.8 倍内存,并将吞吐量提高超过 4.3 倍。
查看 arXiv 页面 (https://arxiv.org/abs/2609.04971)查看 PDF (https://arxiv.org/pdf/2609.04971)GitHub1 (https://github.com/aiha-lab/BeaconKV)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.04971)
通过您的代理获取此论文:
hf papers read 2609\.04971
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2609.04971 以从此页面链接它。
引用此论文的数据集0
无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2609.04971 以从此页面链接它。
引用此论文的空间0
无空间链接此论文
在空间 README.md 中引用 arxiv.org/abs/2609.04971 以从此页面链接它。
包含此论文的收藏集0
无收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接它。
相似文章
CompressKV:语义检索引导的KV缓存压缩方法,用于资源高效的长上下文大语言模型推理
CompressKV针对基于GQA的大语言模型,提出了一种语义检索引导的KV缓存压缩方法,通过识别语义检索头来保留关键令牌。在LongBench任务中,仅使用3%的KV缓存即可实现超过97%的全缓存性能。
KVBoost: 基于偏差引导重计算的块级键值缓存重用,用于高效大语言模型推理
KVBoost 是一个块级键值缓存重用系统,用于高效大语言模型推理。它通过双哈希键控和偏差引导的重计算,实现高缓存命中率和首 token 时间的显著加速,且不损失质量。
面向长推理的信息感知KV缓存压缩
本文提出InfoKV,一种熵感知的KV缓存压缩框架,结合了token级别的预测不确定性和注意力分数,以提高长上下文推理效率。实验表明,它在Llama-3.1、Llama-3.2和DeepSeek-R1上优于现有的基于注意力的方法。
StepKV:面向LLM代理的步骤感知KV缓存压缩方法
StepKV是一种面向LLM代理的步骤感知KV缓存压缩方法,通过保留推理步骤,在低内存预算下保持准确性,解决了多步推理中推理连续性中断的问题。
KV缓存正成为推理的内存层级结构
文章讨论了KV缓存如何演变为LLM推理的内存层级结构,优化解码过程中的内存管理。