遗忘注意力:一种可训练的支持向量记忆,具有认证选择和精确遗忘
摘要
提出支持向量注意力(SV-Attention),一种可训练的最大间隔记忆,通过可逆增量求解器提供令牌的零权重认证选择和精确遗忘。它实现了改进的稀有项召回率和患者记录删除能力。
arXiv:2607.12204v1 公告类型:新
摘要:注意力可被视为上下文中的在线学习器,但现有的测试时记忆无法认证丢弃一个令牌后输出不变,也无法彻底删除其影响。我们引入支持向量注意力(SV-Attention),一种最大间隔记忆,其权重是固定框参数C的单类SVM的支持系数。它的活动集划分将保留令牌赋予恰好零权重,从而认证保持输出的驱逐;一个可逆增量求解器删除一个令牌,以恢复在相同C下重新训练(不含该令牌)所产生的状态。在fp64实验中,当最优解唯一时,递减与重新拟合恢复出相同的划分,且它们的决策函数匹配的中位偏差约为10^-9(学习键上为10^-13);10^-2的最坏情况仅限于病态重复,并在所有机制中低于系数衰减。精确路径在自定义反向传播中复用了维护的KKT逆。训练使用独立的稳定批处理近似,且不携带精确删除的认证;它在3.22M参数模型上达到9,125个令牌/秒,但比MPS softmax参考慢35.8倍。在匹配预算下,认证选择在稀有项召回率上达到0.86 vs 0.32,并在真实MIMIC-IV流上保持0.80 vs 0.05的恶化小时数。我们还展示了外科手术式遗忘、精确编辑、患者记录删除,以及基于真实句子嵌入的可遗忘检索记忆。在enwik8上,混合模型在七个种子上获得2.178 BPC,而匹配状态的滑动窗口Transformer为2.383 BPC(配对改进8.6%,p=0.001);三个种子的TinyStories结果方向正向但不显著(p=0.057)。
查看缓存全文
缓存时间: 2026/07/15 04:18
# 一种可训练的支持向量记忆:具有认证选择与精确遗忘功能
来源:https://arxiv.org/html/2607.12204
###### 摘要
注意力机制可被视为一种在线学习器作用于上下文,但现有的测试时记忆无法证明丢弃一个 token 不会改变输出,也无法彻底消除其影响。我们提出**支持向量注意力(SV-Attention)**,一种最大间隔记忆,其权重是单类支持向量机(SVM)在固定 box 参数 \(C\) 下的支持系数。其活动集划分使得保留 token 的权重恰好为零,从而认证了输出的无损剔除;一种可逆增量求解器能够删除一个 token,并恢复到在相同 \(C\) 下从未基于该 token 进行重训练的状态。在 fp64 实验中,当最优解唯一时,减量操作与重新拟合得到完全相同的划分;两者的决策函数在训练得到的 key 上中位数偏差约为 \(10^{-9}\)(最大偏差为 \(10^{-13}\));最坏情况 \(10^{-2}\) 仅出现在病态重复数据中,且在所有场景下都低于系数衰减的偏差。精确路径在自定义反向传播中复用了维护的 KKT 逆矩阵。训练使用一个独立的稳定化批量近似方法,不携带精确删除的认证;在 3.22M 参数的模型上达到 9,125 tokens/s,相比 MPS softmax 参考慢 35.8 倍。在相同预算下,认证选择达到 0.86 vs 0.32 的稀有项召回率,并在真实 MIMIC-IV 数据流中保持 0.80 vs 0.05 的恶化小时保持率。我们还展示了手术式遗忘、精确编辑、患者记录删除,以及基于真实句子嵌入的可遗忘检索记忆。在 enwik8 上,混合模型在七个随机种子下获得 2.178 BPC,而匹配状态的滑动窗口 Transformer 为 2.383 BPC(配对比改善 8.6%,p=0.001);三个种子的 TinyStories 结果方向为正但不显著(p=0.057)。
## 1 引言
注意力机制越来越被理解成一种在推理时运行的学习算法,而非简单的相似度启发式。在这种测试时学习(TTL)视角下,每一层维护一个在线拟合于上下文(key, value)对的记忆,并通过读取该记忆来回答查询(Katharopoulos 等,2020;Yang 等,2024;von Oswald 等,2023)。该家族成员的区别在于它们解决的内部优化问题:DeltaNet 每一步采用单个在线梯度(delta 规则)步骤(Yang 等,2024);mesa 层以闭式形式解决在线岭回归(von Oswald 等,2023, 2025);Titans 通过带 surprise 门和基于衰减的遗忘的梯度下降来训练深度记忆(Behrouz 等,2025);选择性状态空间模型则控制哪些信息进入固定的循环状态(Gu 和 Dao, 2024)。
该家族存在一个明显的空白。每个成员都拟合了一个**无约束**的、稠密的最小二乘风格或循环记忆,其中每个 token 都保留一定权重,移除 token 的唯一手段是指数衰减,它缓慢侵蚀但永远无法完全消除。因此,以下两个问题没有原则性答案:*哪些上下文 token 可以丢弃而对输出无影响*,以及*如何完全删除单个 token 的贡献*。这两个问题都具有实际意义。长上下文推理受限于内存,生产系统使用基于分数的启发式方法修剪键值缓存,这些方法无法保证丢弃了什么东西(Zhang 等,2023;Li 等,2024b)。另外,欧盟 GDPR 的删除权和临床同意撤回可能要求按需从已部署模型中删除特定记录;通常的补救措施(清空缓冲区、梯度上升、将系数缩放到零)会留下难以界定边界的残留,从而难以向审计方证明其合理性(Bourtoule 等,2021;Huang 等,2024)。快速注意力默认接受了这两种近似。
我们证明,对于 TTL 家族中一个精心选择的成员,两者都不必要。关键是一个经典算法。Cauwenberghs 和 Poggio(2000)展示,支持向量机解可以**精确地**一次一个点地构建:绝热增量提升一个点的系数,同时保持所有先前点的 KKT 条件;该过程是可逆的,因此可以递减地移除一个点,得到的解与从未训练过该点的解相同。在维护的 fp64 实现中,该算法保留边界支持向量上的带边界的 KKT 矩阵的逆。我们注意到,这一对象可被三次复用:它驱动前向求解、认证哪些 token 是惰性的,并且根据隐函数定理,它正是自定义反向传播所需的算子。用于训练的稳定批量实现是一个独立的数值路径,在 3.4 节描述。
我们将其具体化为**支持向量注意力(SV-Attention)**,即 TTL 家族中受约束的、最大间隔的成员:该层对上下文 token 的注意力权重是对 keys 拟合的单类 SVM 的支持系数。被间隔分类为**保留**的 token 获得恰好为零的权重;位于间隔上或之外(支撑向量或边界上)的 token 承载读出值。通过这一单一构造,该层继承了基于梯度的记忆所缺乏的两个性质:认证选择和精确遗忘,以及第三个使其可训练的性质。我们的贡献如下:
1. **在维护求解器中的精确遗忘**。精确(“完美”)遗忘等同于从头开始重新训练而不使用该数据(Cao 和 Yang, 2015;Bourtoule 等,2021)。我们在 fp64 递减路径上测试,与使用相同算法和相同原始 box 超参数 \(C\) 重新训练(不包含该数据)进行比较。当最优解唯一时(在 Gaussian、真实 MIMIC-IV(Johnson 等,2023)和训练模型 key 上,98%–100% 的试验),它恢复了**相同**的支持向量划分;其决策函数(在重复数据上对非唯一最优解不变的度量)与重新拟合的中位数偏差约为 \(10^{-9}\)(在训练 key 上为 \(10^{-13}\))。最坏情况 \(1.1 \times 10^{-2}\) 仅出现在病态的近重复数据流中,并且在所有场景下都低于系数衰减的偏差(第 4 节)。
2. **认证选择**。活动集划分是一种认证而非得分:互补松弛性使得保留的剔除是理论上无输出的。在偏斜冗余下匹配 token 预算时,认证选择在稀有项召回率上以较大优势击败了 H2O 风格的重头戏剔除(0.86 vs 0.32,即使 H2O 拥有对评估查询的先验知识),并且自适应支持集在 40 个不同项目上保持 0.95 召回率,而匹配状态的 DeltaNet 循环坍塌至 0.06(第 5 节)。
3. **具有两条数值路径的可训练最大间隔记忆**。对于精确维护求解器,自定义向量-雅可比乘积重用了前向维护的带边界 KKT 逆矩阵,无需第二次求解和展开(在双精度 gradcheck 下梯度与有限差分匹配)。独立的批量训练路径一次性为所有(序列、头、块)问题找到近似划分,然后使用 \(10^{-3}\) 岭正则化的 `torch.linalg.solve` 及其 autograd 反向传播。其系数是稳定的可微近似,不是精确系数也不是精确删除认证。在完整模型基准中,该路径达到 9,125 tokens/s,比未融合的 PyTorch CPU softmax 参考慢 6.1 倍,比其 MPS 参考慢 35.8 倍(第 7 节)。
4. **基于真实数据展示的能力**。使用精确 fp64 求解器在训练 key 和我们未构造的记录上,我们展示了手术式事实遗忘(其他事实保持不变)、精确知识编辑、针对真实 MIMIC-IV 数据流的患者删除操作(零泄漏;与重头戏剔除相比,关键小时内 0.80 vs 0.05 的保持率),以及基于真实句子嵌入的可认证、可遗忘的检索记忆(第 6 节)。
#### 声明的范围
贡献是一对**性质**:对于使用维护的 fp64 求解器评估的长程门控,实现认证选择和精确固定 \(C\) 遗忘,以及该求解器的自定义逆复用反向传播。没有标准的序列层提供这两个性质,并且它们在真实数据上成立,与语言模型规模无关。批量语言模型路径是一种稳定的训练近似,自身不认证精确删除;混合模型的密集局部路径通过掩码和重新归一化删除,而不是通过 SV 认证(第 3.5 节)。该层并不定位为在吞吐量或准确率上具有竞争力的通用注意力替代品:对于非冗余上下文,门控近似均匀,该层行为类似于普通核注意力;在原始预测准确率方面,与标准序列基线相比具有竞争力而非主导地位。语言模型探测(第 8 节)确认该层是可用的序列层,在匹配状态下优势体现在小规模上。对于具有删除义务的冗余、异常驱动数据流,长程认证值得其代价。
## 2 相关工作
**测试时学习和快速权重**。线性注意力将上下文读取为通过外积更新的联想记忆(Katharopoulos 等,2020;Schlag 等,2021);DeltaNet 用在线 delta 规则替换了 Hebbian 更新(Yang 等,2024);mesa 层每一步精确求解正则化最小二乘问题(von Oswald 等,2023, 2025);Titans 通过动量遗忘门在线训练深度记忆(Behrouz 等,2025);选择性状态空间模型控制哪些信息进入固定循环状态(Gu 和 Dao, 2024)。所有这些都维护一个**无约束**的最小二乘风格或循环状态,这正是它们缺乏我们受约束的最大间隔门的活动集结构,因此也缺乏认证的原因。我们的实验与 DeltaNet 和线性注意力(具有标准参考实现的恒定状态成员)进行比较;mesa 层和 Titans 在内部目标上有所不同,但共享我们对比所针对的稠密、仅衰减状态,因此结构论证(尽管没有经验比较)同样适用于它们。
**注意力与支持向量机**。Tarzanagh 等(2023)展示,对单层注意力模型的梯度下降在方向上收敛于一个硬间隔 SVM,该 SVM 分离最优与非最优 token,这是一个关于训练动态的**描述性**结果。我们的工作是**构建性**的:我们在层中放置一个单类 SVM,使用精确 fp64 维护路径求解以获得认证,并使用独立的稳定可微近似进行批量训练。
**机器遗忘与知识编辑**。通过分片重新训练的精确遗忘(SISA, Bourtoule 等,2021)成本高昂,而权重空间近似遗忘(梯度上升、擦除)会留下难以界定的残留影响;递减 SVM 遗忘被 ECO(Huang 等,2024)重新用于深度分类器,通过最后一层 SVM 移除**训练**数据。当前语言模型遗忘的基准(TOFU, Maini 等,2024;MUSE, Shi 等,2025;WMDP, Li 等,2024a)评估**参数化**遗忘(编辑权重以使某个事实不再被召回),并报告了顽固的遗忘-效用权衡:MUSE 发现近似遗忘将保留任务效用降低了 24%–100%。我们的范围不同:SV-Attention 从**上下文记忆**而非权重中遗忘,其递减操作构造上为零附带效果,因为在相同固定 \(C\) 下,保留的 token 被重新求解到它们本应达到的最优点(没有删除该 token),因此没有需要调整的效用-遗忘权衡。我们将 fp64 结果保持为 Cao 和 Yang(2015)的精确遗忘定义(等价于使用相同算法和超参数重新训练),其在层内的类似物是系数衰减(我们的基线)。知识编辑方法如 ROME(Meng 等,2022)和 MEMIT(Meng 等,2023)通过修改权重编辑事实;我们的编辑是在上下文记忆中的精确删除-添加,其旧绑定在机器精度下留有残留。
**KV 缓存剔除与长上下文**。H2O(Zhang 等,2023)和 SnapKV(Li 等,2024b)根据累积注意力质量对缓存条目排序,这是一种频率信号,无法保证剔除丢弃了什么。较新的工作通过**保留**完整缓存来恢复无损:VeriCache(Yao 等,2026)从压缩缓存起草,并针对保留的完整缓存验证每个 token,保证相同输出。我们在两个轴向上不同。我们的认证保留由互补松弛性**结构上**惰性,而非通过验证步骤,因此其剔除不能改变输出,并且我们不保留完整缓存作为后备。相同的机制支持精确**删除**,而验证-完整-缓存的方案不解决这一问题。混合层的全局+局部模式遵循长上下文文献(Beltagy 等,2020);其精确求解的全局记忆可以认证,而局部当前块路径通过掩码直接删除,不携带 SV 认证。
**可微优化**。包含优化问题的层可以通过其 KKT 系统的隐函数定理进行微分,如 OptNet(Amos 和 Kolter, 2017)和可微凸层(Agrawal 等,2019);通常的代价是在反向传播中进行矩阵分解。精确维护路径避免了这一代价……(原文可能未结束,但根据规则,我们只翻译提供的部分。此处截断)相似文章
变分线性注意力:用于长上下文 Transformer 的稳定联想记忆
本文介绍了变分线性注意力(VLA),这是一种用于稳定长上下文 Transformer 中线性注意力机制记忆状态的方法。VLA 将记忆更新重构为在线正则化最小二乘问题,证明了状态范数的有界性,并展示了相较于标准线性注意力和 DeltaNet 显著的速度提升以及更高的检索准确性。
自剪枝键值注意力:通过预测未来效用决定何时写入
提出了自剪枝键值注意力(SP-KV),一种通过学习预测键值对未来效用的机制,动态剪枝KV缓存,将内存使用和解码速度提升3-10倍,且性能下降极小。模型和效用预测器通过下一词元预测进行端到端联合训练。
基于边际自校正的大规模快速遗忘
介绍了MASC(边际自校正),一种用于大型语言模型的高效遗忘方法,采用在线停止规则,以降低的计算成本实现有竞争力的遗忘-保持权衡,并在TOFU和MUSE基准上得到验证。
@omarsar0:新论文值得一读。(收藏)基本思路是将压缩循环状态与一个小型精确记忆配…
HOLA(海马体线性注意力)受海马记忆启发,通过一个有界的精确KV缓存增强线性注意力,在不牺牲效率的情况下改善长程召回和困惑度。在340M参数规模下,它在Wikitext上优于全注意力Transformer,并在高达32k token的范围内实现稳健的针召回。
MemTrain:自监督上下文记忆训练
MemTrain 提出了一种自监督训练框架,通过在维基百科语料上使用掩码重建和中间记忆召回代理任务,增强 LLM 智能体的上下文记忆能力,在下游记忆密集型 QA 基准上取得了高达 17.67 个百分点的提升。