DOW-KE:通过直接端到端权重优化的无锚点多层知识编辑

arXiv cs.LG 论文

摘要

DOW-KE 介绍了一种无锚点方法,用于大型语言模型中的知识编辑,通过直接优化跨层的权重更新,在序列编辑任务中实现了更高的性能。

arXiv:2608.16932v1 公告类型:新 摘要:多层定位后编辑方法在知识编辑中,首先优化选定层的目标残差流激活(锚点),然后逐层实现为权重更新。这个流程优化了一个中间表示,但部署的多层权重更新在真实前向传播中的联合效应从未被优化:无论锚点如何设置或传播,每个更新都来自局部求解,因此传播引起的衰减和失真未得到纠正,导致锚点目标与实现编辑之间存在闭合差距。我们提出 DOW-KE,一种基于单一原则的无锚点方法:优化的内容必须与部署的内容完全一致。DOW-KE 通过完整模型反向传播最终编辑目标,联合优化所有编辑层的更新,使得跨层传播和耦合进入每个梯度步长。同一原则决定了保留的位置:将保留投影嵌入更新参数化中,在计算图内部,使得每个梯度都作用于部署的更新;事后约束会重新打开差距,而约束搜索确保编辑与受保护知识保持清晰。在对两个数据集和三个模型进行的大规模序列编辑中,DOW-KE 在评估基线的六个模型-数据集设置中有五个实现了最高的整体 Score 和邻域 Specificity。
查看原文
查看缓存全文

缓存时间: 2026/08/19 10:18

# DOW-KE:通过直接端到端权重优化实现无锚点多层知识编辑
来源:https://arxiv.org/html/2608.16932
###### 摘要

多层“定位后编辑”知识编辑方法首先在选定层优化目标残差流激活值(锚点),然后逐层将其实现为权重更新。此流程优化的是中间表示,但部署的多层权重更新通过真实前向传播产生的联合效应从未得到优化:无论锚点如何设定或传播,每次更新都来自局部求解,因此传播引起的衰减和失真未得到纠正,在锚点目标与实际编辑之间留下了闭合差距。我们提出 DOW-KE,一种基于单一原则的无锚点方法:被优化的内容必须与被部署的内容完全一致。DOW-KE 通过完整模型反向传播最终的编辑目标,联合优化所有被编辑层的更新,使得跨层传播和耦合进入每一个梯度步骤。同一原则决定了保护机制的存在位置:将保护投影嵌入更新参数化中,置于计算图内部,使得每个梯度都作用于被部署的更新;事后约束会重新打开差距,而约束搜索则使编辑远离受保护的知识。在两个数据集和三个模型上的大规模序列编辑中,DOW-KE 在六项模型-数据集设置中的五项中,取得了最高的总体得分和邻域特异性。

## 引言

大型语言模型(LLMs)在其参数中存储了广泛的跨领域知识,这得益于其庞大的规模和广泛的训练语料库。然而,这些知识是隐式编码并分布在参数中,而非存储为可直接访问的条目(Geva et al. 2023),这使得修改单个事实变得困难(Mitchell et al. 2022; Lewis et al. 2020; Hase et al. 2023)。语料库级别的知识更新通常通过继续预训练或微调来执行(Jiang et al. 2024),但其巨大的时间和计算成本以及有限的目标特异性(De Cao et al. 2021; Mitchell et al. 2022)使其对于修改特定项目的请求不经济。模型编辑正是为此类场景设计的:它以最小的干预成本对模型参数中的指定知识进行精确且局部的更改(Sinitsin et al. 2020; Yao et al. 2023)。

参见图片标题图 1:知识编辑示意图。知识编辑通过仅更新前馈层的输出权重来实现对模型知识的精确修改。大多数现有方法依赖锚点来引导优化信号,而我们的方法消除了这种基于锚点的结构,直接使用梯度优化权重。
“定位后编辑”是一种主流的参数编辑范式:它识别与目标知识相关的一小部分参数子集,并直接重写它们,而不引入辅助模块。ROME 是一个代表性的单层方法(Meng et al. 2022)。在冻结权重后,它为选中层前馈网络输出处的主体最后令牌优化一个替换激活值,使得模型对于编辑提示及其前缀变体都产生编辑后的答案。我们将这个层-令牌位置称为锚点,由此产生的激活值称为锚点目标。然后 ROME 使用锚点目标作为其唯一约束,计算一个封闭形式的最小二乘更新来更新该层。由于单层编辑需要一个线性算子来平衡有效性和局部性,其容量有限。因此,多层方法保留单个锚点,但将更新分布在先前较浅的层中,假设逐层增量在残差流中近似无损传播,并在锚点处线性组合成目标残差(Meng et al. 2023)。

尽管多层编辑扩大了编辑容量,但其隐含的线性叠加假设并不成立,导致传递到锚点的编辑增量与预期目标之间存在差距。先前的工作试图解决这个问题(Li et al. 2025; Liu et al. 2026),但这些方法忽略了核心问题:无论锚点放置在何处或如何传播,每层的权重更新仍然是通过局部求解一个预定的中间目标获得的,而所有层更新产生的最终效果在任何阶段都未被优化。

这个问题并非无害的抽象;它在两阶段框架内产生了两个相互关联的负面效应。首先,传播成本是不可见的。当在不同层写入的增量通过残差流传递时,它们会衰减、失真并与后续计算相互作用(Liu et al. 2026)。因为没有任何阶段在其目标中包含最终效果,所以这些损失既无法检测也无法纠正。其次,当传递未被观察时,写入强度只能盲目设定。现有方法通过建立裕度来补偿:它们将目标激活值优化到超过必要的强度,然后逐层重复计算残差以吸收差距。这个过程是单向的,一旦层被写入就无法重新访问。没有最终反馈,补偿裕度无法校准,在任何单一强度设置下都会产生不可避免的权衡:强度不足会导致编辑不完整,而强度过高则会导致不必要的更新溢出到不相关的知识中(Hartvigsen et al. 2023)。

参见图片标题图 2:编辑增量从未达到其目标。层从浅到深求解:每个层被要求分担在锚点测量到的不足部分,仅写入其中一部分(阴影块),而写入的内容在传输过程中衰减(从每个峰值保持的灰色等级)。两种损失都累积到锚点处仍然开放的差距中。
这两个效应共享同一个根本原因:被优化的对象与最终部署的对象不同,这种差异我们称之为结构性错位。因此,DOW-KE 遵循单一设计原则:使两者完全一致。它不是规定中间目标,而是使用最终编辑目标作为损失,并通过完整模型的反向传播联合优化所有被编辑层的权重更新。通过移除基于锚点的梯度截断,DOW-KE 使得衰减、失真、跨层耦合和子空间约束能够直接反映在梯度中,从而消除了传递假设的需要。优化本身协调跨层的分工,而不是遵循预定义的计划。写入强度在跨层之间联合学习,而不是通过残差分配预设。

我们的贡献总结如下:

- 我们识别并从机制上描述了两阶段多层定位后编辑方法中长期存在的结构性错位,并通过受控实验进行了定量验证。
- 我们提出 DOW-KE,一种无锚点多层编辑方法,它使用最终编辑目标作为损失,并通过完整模型的反向传播联合优化所有被编辑层的权重更新,从而显式地考虑传播衰减、失真和跨层耦合。它还将所有保护约束嵌入到更新参数化中。
- 在两个数据集和三个模型的序列编辑实验中,DOW-KE 在六项模型-数据集设置中的五项中取得了最高的总体得分。消融实验进一步表征了直接权重优化和图内约束参数化在评估设置中的行为。

## 相关工作

### 定位后编辑方法

ROME(Meng et al. 2022)开创了这种范式:因果追踪定位携带事实的层,然后通过两阶段过程,通过梯度下降优化一个锚点目标,再将其转换为封闭形式的权重更新。MEMIT(Meng et al. 2023)将残差分布在几个层以增加容量;AlphaEdit(Fang et al. 2025)将更新约束在受保护知识键的零空间内,EvoEdit(Lyu et al. 2026)将该投影扩展以覆盖先前的编辑。然而,多层编辑与单个锚点配对所引入的衰减和失真在很大程度上未经检验,直到 BLUE(Li et al. 2025)和 FE(Liu et al. 2026):前者引入了一个额外的锚点,为每个边界层分配一个锚点目标,代价随其数量增长;后者通过前向重放构建逐层目标。因此,沿着这条路线的进展完善了中间目标和保护统计的覆盖范围,但保留了两阶段前提本身:被优化的是锚点处的激活值,而不是实际部署的权重更新。

### 其他知识编辑范式

除了直接修改原始参数的方法外,知识编辑还包含另外两种范式。第一种使用辅助参数或外部存储器:原始模型保持不变,而新知识存储在一个附加组件中。WISE 和 MELO 将编辑存储在路由的侧边存储器或动态 LoRA 模块中(Wang et al. 2024; Yu et al. 2024)。第二种范式是元学习,它训练一个辅助网络来学习如何修改参数。KE 和 MEND 使用超网络将朴素的微调梯度转换为满足局部性约束的参数更新(De Cao et al. 2021; Mitchell et al. 2022)。

外部存储器方法特别适用于终身编辑,其中编辑一个接一个地到达并必须立即生效;然而,它们的存储和路由成本随着编辑数量的增加而不断增长。LocFT-BF 通过结合局部参数选择和广度优先优化,重新审视直接微调(Yang et al. 2026)。在 WISE 考虑的相同设置下(Wang et al. 2024),同期工作 LOKI(2026年6月;Eskandar et al. 2026)则直接修改模型的内部权重。LOKI 移除了中间激活锚点。其权重空间零空间约束仅指定了一个一般性的可行更新空间,并未使用目标编辑来预先决定更新应对哪些输入特征做出响应。因此,全尺寸权重优化共同决定了要影响哪些输入特征以及要写入什么内容。相比之下,DOW-KE 保留了分批的定位后编辑机制,其中编辑键和保护统计预先决定了更新可以响应哪些输入特征,并且仅针对最终编辑目标端到端地学习写入什么内容。这种分工使每个更新与特定的编辑事实相关联,将优化限制在一个随编辑批次增长的低秩空间内,并支持批次内编辑的协调。因此,DOW-KE 仍然是一种事实导向的定位后编辑方法,用最终编辑目标替代了锚点目标;而 LOKI 在移除中间激活锚点后,在其一般的可行权重空间内学习更新结构。

## 预备知识

### 残差流与 FFN 键值存储

给定一个自回归语言模型 \(G\),令 \(\mathbf{h}_t^l \in \mathbb{R}^{d_1}\) 表示层 \(l\) 在位置 \(t\) 的残差流状态。令 \(\mathbf{a}_t^l\) 和 \(\mathbf{m}_t^l\) 分别表示注意力模块和 FFN 写入残差流的增量。我们用 \(\gamma\) 表示层归一化,用 \(\phi^l\) 表示下投影之前的 FFN 特征映射。待编辑的下投影矩阵记为 \(W^l \in \mathbb{R}^{d_1 \times d_0}\)。我们将下投影矩阵的输入和输出定义为键和值:

\(\mathbf{k}_t^l \triangleq \phi^l \big( \gamma( \mathbf{h}_t^{l-1} + \mathbf{a}_t^l ) \big) \in \mathbb{R}^{d_0}, \quad \mathbf{v}_t^l \triangleq W^l \mathbf{k}_t^l \in \mathbb{R}^{d_1}.\) (1)

特征映射可以简写为 \(\phi^l(\mathbf{x}) = \sigma(W_{\mathrm{in}}^l \mathbf{x})\)。根据线性关联记忆观点(Meng et al. 2022),\(W^l\) 存储从输入模式到残差流增量的映射,即 \(W^l \mathbf{k} = \mathbf{v}\)。因此,定位后编辑方法将知识更新表述为重写特定的键值关联。

### 锚点目标优化

定位后,ROME、MEMIT 和 AlphaEdit 首先在最深被编辑层 \(l_L\) 优化一个目标激活值。令 \(G_{i,\bm{\delta}}\) 表示通过在主体第 \(i\) 个请求的最后令牌状态 \(\mathbf{h}_i^{l_L}\) 上添加增量 \(\bm{\delta}\) 所获得的模型。令 \(\mathcal{L}_{\mathrm{edit}}\) 表示目标对象的负对数似然,令 \(\mathcal{L}_{\mathrm{KL}}\) 约束干预前后的输出分布:

\(\bm{\delta}_i = \arg\min_{\bm{\delta}} \; \mathcal{L}_{\mathrm{edit}}(G_{i,\bm{\delta}}) + \lambda_{\mathrm{KL}} \mathcal{L}_{\mathrm{KL}}(G_{i,\bm{\delta}}, G).\) (2)

\(\mathcal{L}_{\mathrm{edit}}\) 在 \(N\) 个随机前缀 \(x_j\) 上取平均,以使目标激活值对上下文变化具有鲁棒性。\(\mathcal{L}_{\mathrm{KL}}\) 在本质提示 \(p_i'\) 上评估,以抑制主体表示的全局漂移。优化后的目标状态为

\(\mathbf{z}_i = \mathbf{h}_i^{l_L} + \bm{\delta}_i.\) (3)

与引言中的术语一致,此状态即为锚点目标。它指定了模型在最深被编辑层应达到的残差流状态,但不直接修改权重。为避免与 FFN 输出值 \(\mathbf{v}\) 混淆,我们遵循 MEMIT 用 \(\mathbf{z}\) 表示此状态。

### 封闭形式的权重更新

相似文章

HyperPatch:面向n元结构漂移的序列知识编辑

arXiv cs.CL

HyperPatch提出了一种参数保持框架,用于处理n元结构漂移下的序列知识编辑,利用超图神经网络维护事件完整性。在MQuAKE-CF和MQuAKE-T基准上,逐跳准确率分别相对提升96.24%和21.06%。

模态解耦的在线递归编辑

arXiv cs.LG

提出M-ORE,一种模态解耦的在线递归编辑器,用于多模态大语言模型的终身适应,解决跨模态冲突和编辑间干扰,且每次编辑开销恒定。