查询知道该遗忘什么:线性注意力的第二擦除方向
摘要
介绍了用于线性注意力模型的查询派生擦除方向(QED),以提升检索性能并将可用上下文长度大约加倍,在S-NIAH-1基准测试中得到验证。
查看缓存全文
缓存时间: 2026/08/17 10:11
# 查询知道该忘记什么:线性注意力的第二个擦除方向 来源:https://arxiv.org/abs/2608.13668 查看 PDF (https://arxiv.org/pdf/2608.13668) > 摘要:线性注意力维持固定大小的状态。在长上下文场景中,许多存储项共享此状态,其间的干扰会降低检索性能。Gated DeltaNet-2(GDN-2)与以往所有基于 Delta 规则的模型一样,其擦除向量源自当前令牌的键。然而,其读取操作的干扰是通过查询来度量的,而擦除步骤无法触及该部分。我们引入了查询派生擦除方向(QED)。QED 新增了一个源自查询且与键正交的第二擦除方向。在快速权重视角下,键导向的 Delta 编辑无法改变读取操作中与键正交的部分。它利用可编辑的部分来抵消沿查询向量度量的旧状态内容。该方法在超越训练窗口的各个长度上均能提升检索性能,并在 S-NIAH-1 基准测试中将可用上下文长度约提升了一倍。 ## 提交历史 发件人:Dhruman Gupta [查看邮件 (https://arxiv.org/show-email/160615c3/2608.13668)] **\[v1\]** 2026年8月13日(周四)18:04:53 UTC(321 KB)
相似文章
擦除后增量注意力:在Delta规则线性注意力中解耦擦除与写入地址
提出擦除后增量注意力(EDA),一种用于线性注意力的记忆更新规则,它在写入新内容之前,先通过解耦擦除和写入地址来有选择地抑制过时信息。在2.5B密集模型和25B MoE模型上的实验表明,在标准评估和长上下文评估中均取得一致增益。
Subquadratic AI 推出 SubQ-1.1-Small,一款采用 Smart Sparse Attention 的新模型
Subquadratic AI 推出 SubQ-1.1-Small,该模型利用 Smart Sparse Attention 在长达 1200 万 token 的上下文中实现近乎完美的长上下文检索,注意力计算量减少高达 1000 倍。它兼顾了长上下文优化与强大的通用推理能力,在 NIAH 和 RULER 等基准测试中优于基线模型。
更快的查询-键学习锐化自注意力模型中的注意力
本文分析了自注意力模型中查询-键回路和输出-值回路的参数化如何影响训练过程中的注意力锐度。通过梯度流分析,作者表明,相对于输出-值学习,更快的查询-键学习会产生更锐利的注意力,从而提高可解释性,同时不牺牲预测性能。
QEvict: Recoverable Quantized KV Eviction for Attention-Drift-Robust Long-Context Decoding
This paper introduces QEvict, a KV-cache management scheme for LLMs that uses recoverable quantized eviction to handle attention drift during long-context decoding, improving memory efficiency while preserving important historical context.
利用指数衰减记忆增强注意力提升查询感知的KV稀疏性
本文探讨了RAT+中的指数衰减记忆模块如何提升长上下文语言模型的查询感知稀疏推理方法,在针尖干草垛任务中,跨多种稀疏预算展示了一致的准确率提升。