查询知道该遗忘什么:线性注意力的第二擦除方向

arXiv cs.LG 论文

摘要

介绍了用于线性注意力模型的查询派生擦除方向(QED),以提升检索性能并将可用上下文长度大约加倍,在S-NIAH-1基准测试中得到验证。

arXiv:2608.13668v1 Announce Type: new 摘要:线性注意力保持一个固定大小的状态。在长上下文中,许多存储项共享此状态,它们之间的干扰会降低检索性能。门控DeltaNet-2(GDN-2),像之前的每个delta规则模型一样,从当前标记的键中派生其擦除向量。然而,其读取中的干扰是通过查询来衡量的,而擦除步骤无法触及它。我们引入了查询派生的擦除方向(QED)。QED添加了一个从查询派生并与键正交的第二擦除方向。在快速权重视角下,键导向的delta编辑无法更改读取的键正交部分。它使用可编辑部分来抵消沿查询衡量的旧状态内容。它还在超过训练窗口的每个长度上提升了检索性能,并在S-NIAH-1上将可用上下文长度大约加倍。
查看原文
查看缓存全文

缓存时间: 2026/08/17 10:11

# 查询知道该忘记什么:线性注意力的第二个擦除方向
来源:https://arxiv.org/abs/2608.13668
查看 PDF (https://arxiv.org/pdf/2608.13668)

> 摘要:线性注意力维持固定大小的状态。在长上下文场景中,许多存储项共享此状态,其间的干扰会降低检索性能。Gated DeltaNet-2(GDN-2)与以往所有基于 Delta 规则的模型一样,其擦除向量源自当前令牌的键。然而,其读取操作的干扰是通过查询来度量的,而擦除步骤无法触及该部分。我们引入了查询派生擦除方向(QED)。QED 新增了一个源自查询且与键正交的第二擦除方向。在快速权重视角下,键导向的 Delta 编辑无法改变读取操作中与键正交的部分。它利用可编辑的部分来抵消沿查询向量度量的旧状态内容。该方法在超越训练窗口的各个长度上均能提升检索性能,并在 S-NIAH-1 基准测试中将可用上下文长度约提升了一倍。

## 提交历史

发件人:Dhruman Gupta [查看邮件 (https://arxiv.org/show-email/160615c3/2608.13668)] **\[v1\]** 2026年8月13日(周四)18:04:53 UTC(321 KB)

相似文章

更快的查询-键学习锐化自注意力模型中的注意力

arXiv cs.LG

本文分析了自注意力模型中查询-键回路和输出-值回路的参数化如何影响训练过程中的注意力锐度。通过梯度流分析,作者表明,相对于输出-值学习,更快的查询-键学习会产生更锐利的注意力,从而提高可解释性,同时不牺牲预测性能。