Random Attention:重新思考高效推理的KV缓存驱逐策略
摘要
本文提出了一种名为Random Attention的KV缓存驱逐方法,它使用随机选择而非评分,匹配选择性方法的同时提高推理任务中的吞吐量。
查看缓存全文
缓存时间: 2026/09/04 03:56
论文页面 - 随机注意力:重新思考高效推理中的 KV 缓存驱逐策略
来源:https://huggingface.co/papers/2609.03430
摘要
对推理令牌进行随机驱逐的效果可媲美选择性 KV 缓存压缩,因为推理链通过冗余实现了自我保护,一旦提示信息得以保留,评分机制便不再必要。
大型语言模型在需要长时推理的任务上表现优异,但长链思维过程使 KV 缓存成为严重的内存瓶颈。现有的 KV 缓存压缩方法共享一个范式:通过某种评估方式为每个缓存令牌评分,衡量其后续重要性,并保留得分最高的令牌。我们的研究表明,这种选择信号几乎毫无贡献。随机注意力方法保留提示信息,在每个注意力头内进行完全随机的驱逐,完全无需计算评分;在四个模型和六项推理任务的测试中,该方法性能与现有最强驱逐策略相当,同时在 vLLM 部署中实现了 32%-43% 的吞吐量提升。控制实验证明:1)提示信息是缓存中的脆弱部分,不同选择策略的差距主要取决于其选择信号是否恰好保留了提示;2)推理链通过两个层面的冗余自我保护——文本层面(模型在推理过程中会重复陈述所需内容)和注意力头层面(每个头独立保存推理链副本),因此只要提示安全,随机采样便能保留足够的模型所需信息,无需任何评分来筛选。我们的代码已开源:https://github.com/SalesforceAIResearch/Random-Attention。
查看 arXiv 页面 (https://arxiv.org/abs/2609.03430) 查看 PDF (https://arxiv.org/pdf/2609.03430) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.03430)
在您的智能代理中获取此论文:
hf papers read 2609.03430
尚未安装最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型 0
暂无模型关联本文
在模型 README.md 中引用 arxiv.org/abs/2609.03430 以从本页面建立链接。
引用本文的数据集 0
暂无数据集关联本文
在数据集 README.md 中引用 arxiv.org/abs/2609.03430 以从本页面建立链接。
引用本文的空间 0
暂无空间关联本文
在空间 README.md 中引用 arxiv.org/abs/2609.03430 以从本页面建立链接。
包含本文的合集 0
暂无合集包含本文
将本文添加到合集 (https://huggingface.co/new-collection) 以从本页面建立链接。
相似文章
Random Attention(GitHub 仓库)
Random Attention 提出了一种无信号的 KV 缓存驱逐策略,适用于推理模型,在 MATH-500 和 LiveCodeBench 等基准测试中,其性能匹配或超越了学习方法,同时推理速度更快。
基于顿悟感知的KV缓存淘汰方法(无需注意力矩阵)
本文介绍了EpiKV,一种基于内部表征变化(顿悟分数)而非注意力权重来评估token重要性的KV缓存淘汰方法,无需具体化注意力矩阵。该方法在推理基准测试中取得了具有竞争力的性能,同时支持长达16倍的上下文长度。
面向长推理的信息感知KV缓存压缩
本文提出InfoKV,一种熵感知的KV缓存压缩框架,结合了token级别的预测不确定性和注意力分数,以提高长上下文推理效率。实验表明,它在Llama-3.1、Llama-3.2和DeepSeek-R1上优于现有的基于注意力的方法。
Thought-Aware KV Cache Compaction for Reasoning via Adaptive Attention Matching
This paper introduces Thought-Aware Attention Matching (TAM), a method for compressing KV caches during long chain-of-thought reasoning by segmenting reasoning traces, adaptively allocating compression budgets, and protecting pivotal tokens. Experiments on AIME 2024 and MATH-500 with Qwen3-4B show significant memory reduction while maintaining accuracy.
REAL:面向长上下文KV缓存压缩的检索-推理与逻辑构建注意力行为
REAL引入了一种注意力行为矩阵,用于分析成功与失败案例中注意力头的行为,从而实现更有效的KV缓存驱逐。它在达到与最强基线相当准确度的同时,所需空间减少32倍。