Random Attention:重新思考高效推理的KV缓存驱逐策略

Hugging Face Daily Papers 论文

摘要

本文提出了一种名为Random Attention的KV缓存驱逐方法,它使用随机选择而非评分,匹配选择性方法的同时提高推理任务中的吞吐量。

大型语言模型在需要扩展推理的任务上表现出色,但长思维链使KV缓存成为严重的内存瓶颈。现有的KV缓存压缩方法共享一个范式:通过某种估计评分每个缓存的token,保留得分最高的token。我们表明,选择信号几乎没有贡献。Random Attention保留提示(prompt),并在每个注意力头内均匀随机驱逐,完全不计算评分;在四个模型和六个推理任务中,它与最强大的先前驱逐方法相匹配,同时在vLLM部署中提供高出32-43%的吞吐量。对照实验通过以下方式解释这一点:1) 提示是缓存的脆弱部分,选择器之间的差距主要在于其选择信号是否恰好保留了它;2) 推理轨迹通过两个层面的冗余自我保护,防止驱逐:在文本中(模型在工作时重述其仍需要的内容)和跨注意力头(每个头保留自己的轨迹副本),因此一旦提示安全,随机抽样就能保留模型仍需要的足够副本,无需评分来选择它们。我们的代码公开在 https://github.com/SalesforceAIResearch/Random-Attention。
查看原文
查看缓存全文

缓存时间: 2026/09/04 03:56

论文页面 - 随机注意力:重新思考高效推理中的 KV 缓存驱逐策略

来源:https://huggingface.co/papers/2609.03430

摘要

对推理令牌进行随机驱逐的效果可媲美选择性 KV 缓存压缩,因为推理链通过冗余实现了自我保护,一旦提示信息得以保留,评分机制便不再必要。

大型语言模型在需要长时推理的任务上表现优异,但长链思维过程使 KV 缓存成为严重的内存瓶颈。现有的 KV 缓存压缩方法共享一个范式:通过某种评估方式为每个缓存令牌评分,衡量其后续重要性,并保留得分最高的令牌。我们的研究表明,这种选择信号几乎毫无贡献。随机注意力方法保留提示信息,在每个注意力头内进行完全随机的驱逐,完全无需计算评分;在四个模型和六项推理任务的测试中,该方法性能与现有最强驱逐策略相当,同时在 vLLM 部署中实现了 32%-43% 的吞吐量提升。控制实验证明:1)提示信息是缓存中的脆弱部分,不同选择策略的差距主要取决于其选择信号是否恰好保留了提示;2)推理链通过两个层面的冗余自我保护——文本层面(模型在推理过程中会重复陈述所需内容)和注意力头层面(每个头独立保存推理链副本),因此只要提示安全,随机采样便能保留足够的模型所需信息,无需任何评分来筛选。我们的代码已开源:https://github.com/SalesforceAIResearch/Random-Attention。

查看 arXiv 页面 (https://arxiv.org/abs/2609.03430) 查看 PDF (https://arxiv.org/pdf/2609.03430) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.03430)

在您的智能代理中获取此论文:

hf papers read 2609.03430

尚未安装最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型 0

暂无模型关联本文
在模型 README.md 中引用 arxiv.org/abs/2609.03430 以从本页面建立链接。

引用本文的数据集 0

暂无数据集关联本文
在数据集 README.md 中引用 arxiv.org/abs/2609.03430 以从本页面建立链接。

引用本文的空间 0

暂无空间关联本文
在空间 README.md 中引用 arxiv.org/abs/2609.03430 以从本页面建立链接。

包含本文的合集 0

暂无合集包含本文
将本文添加到合集 (https://huggingface.co/new-collection) 以从本页面建立链接。

相似文章

Random Attention(GitHub 仓库)

TLDR AI

Random Attention 提出了一种无信号的 KV 缓存驱逐策略,适用于推理模型,在 MATH-500 和 LiveCodeBench 等基准测试中,其性能匹配或超越了学习方法,同时推理速度更快。

基于顿悟感知的KV缓存淘汰方法(无需注意力矩阵)

arXiv cs.LG

本文介绍了EpiKV,一种基于内部表征变化(顿悟分数)而非注意力权重来评估token重要性的KV缓存淘汰方法,无需具体化注意力矩阵。该方法在推理基准测试中取得了具有竞争力的性能,同时支持长达16倍的上下文长度。

面向长推理的信息感知KV缓存压缩

arXiv cs.CL

本文提出InfoKV,一种熵感知的KV缓存压缩框架,结合了token级别的预测不确定性和注意力分数,以提高长上下文推理效率。实验表明,它在Llama-3.1、Llama-3.2和DeepSeek-R1上优于现有的基于注意力的方法。

Thought-Aware KV Cache Compaction for Reasoning via Adaptive Attention Matching

arXiv cs.CL

This paper introduces Thought-Aware Attention Matching (TAM), a method for compressing KV caches during long chain-of-thought reasoning by segmenting reasoning traces, adaptively allocating compression budgets, and protecting pivotal tokens. Experiments on AIME 2024 and MATH-500 with Qwen3-4B show significant memory reduction while maintaining accuracy.