基于Gated Singular Vector Shrinkage的选择性知识编辑逆转

arXiv cs.CL 论文

摘要

本文提出了一种基于频谱的框架,用于在大语言模型中选择性逆转知识编辑,允许移除有害编辑同时保留有益编辑。

arXiv:2609.02091v1 Announce Type: new 摘要:知识编辑为更新大语言模型中的事实知识提供了一种高效的方法。然而,恶意编辑可能引入安全风险,因此有必要逆转不良编辑效果。现有的参数修改编辑逆转方法主要集中在全局移除上,这可能会删除应保留的有益编辑。本文研究了编辑知识的选择性逆转,目标是在保留剩余编辑事实的同时逆转目标编辑事实。基于每个编辑在编辑矩阵的主子空间中稀疏编码的假设,我们提出了一种基于频谱的逆转框架,该框架在编辑权重的奇异值主子空间中定位编辑敏感组件。跨多个设置的实验证明了我们的方法在逆转选定编辑同时保留未编辑事实方面的有效性。这些结果表明,不同的编辑在主导奇异成分中稀疏编码,并且在编辑数量适中时可以分离,使选择性频谱逆转成为定位编辑特定组件和修复编辑语言模型的一个有前景的方向。
查看原文
查看缓存全文

缓存时间: 2026/09/03 05:50

# 基于门控奇异向量收缩的选择性知识编辑逆转  
来源:https://arxiv.org/html/2609.02091  
陈瑞瑞、毛乾任、刘俊男、张启立、Kwok‑Yan Lam  
南洋理工大学计算与数据科学学院,新加坡  
南洋理工大学数字信任中心,新加坡  
新加坡科技研究局高级智能计算研究所,中国  
中关村实验室,中国  
澳大利亚莫纳什大学信息技术学院数据科学与人工智能系  

###### 摘要  
知识编辑为更新大语言模型中的事实知识提供了一种高效方法。然而,恶意编辑可能引入安全风险,因此有必要逆转不良编辑效果。现有针对参数修改型编辑的逆转方法主要集中于全局移除,这可能会同时抹除应保留的有益编辑。本文研究已编辑知识的选择性逆转,目标是在保留其他已编辑事实的同时逆转目标编辑事实。基于每个编辑稀疏编码于编辑矩阵主导子空间的假设,我们提出一种基于谱的逆转框架,该框架在已编辑权重的主导奇异子空间中定位编辑敏感组件。多个设置下的实验表明,我们的方法在逆转选定编辑的同时能有效保留无关编辑事实。结果表明,不同编辑在主导奇异分量中呈稀疏编码,且当编辑数量适中时可分离,这使得选择性谱逆转成为定位特定编辑分量并修复已编辑语言模型的有前景方向。  

1代码与数据请参见:https://github.com/marvinhehehe/spectral-reverse  

## 1 引言  
大语言模型(LLMs)在各应用领域展现出强大能力Qin等(2023)、Li等(2023)、Cui等(2024)、Ye等(2025)。随着这些模型日益部署于现实应用,保持其事实知识的时效性变得至关重要Yao等(2023)、Zhang等(2024)。知识编辑Mitchell等(2022a)、Meng等(2022)、Meng等(2023)、Yao等(2023)、Zhang等(2024)、Li等(2024)、Fang等(2025)提供了一种在保留无关知识的同时更新模型中特定事实关联的高效方法,从而避免昂贵的重训练和灾难性遗忘Zhu等(2020)、Cao等(2021)、Mitchell等(2022a)、Huang等(2023)、Zhang等(2024)。  

见图注  
图1:模型可能包含有益和有害编辑。简单地假设所有编辑都是未知的并从模型中移除所有编辑,也会消除有益的修改。更现实的情景是结合现有检测方法识别有害编辑,然后选择性移除检测到的编辑而不影响其他未知编辑。  

然而,尽管性能优异,近期研究表明知识编辑可能引入安全风险Youssef等(2025a)。由于其低开销和易用性,攻击者可利用知识编辑在LLMs中植入后门、引入偏见、实现越狱并传播虚假信息Qiu等(2025)、Hazra等(2024)、Chen等(2024a)、Ju等(2024)、Youssef等(2025a)。尽管已有多种方法被提出用于检测模型或其输出的编辑性Li等(2025)、Youssef等(2025b)、Youssef等(2025c)、Youssef等(2026),将编辑逆转回预训练状态仍是一个具有挑战的研究问题,特别是对于参数修改型编辑方法,其中编辑知识直接嵌入模型权重。近期工作已探索利用谱方法逆转参数修改型编辑Youssef等(2026)。它通过删除编辑矩阵的主导奇异子空间实现全局逆转。然而,全局删除不足以应对现实场景。如图1所示,被编辑的模型可能同时包含有害和有益编辑。简单移除所有编辑也会抹除应保留的有用知识更新。因此,本文旨在定位已编辑模型参数空间中不同编辑的编码位置,并利用此定位选择性逆转编辑知识。更具体地说,给定一组已确认被编辑的主体‑关系事实,我们仅使用已编辑模型识别与这些事实相关的编辑敏感组件。基于识别的组件,模型对选定事实的输出应接近原始预训练模型,而对其余已编辑事实的输出应保持接近已编辑模型。为实现此目标,我们提出一种基于谱的逆转框架。我们假设与每个编辑相关的信息稀疏编码于编辑矩阵的主导秩一分量中。基于此假设,我们使用可学习的逐元素门控作用于已编辑权重矩阵的奇异向量,以定位和收缩与选定编辑相关的敏感组件。我们在多种语言模型、编辑方法和事实编辑基准上评估所提方法。我们的贡献总结如下:  

- 我们形式化了参数修改型知识编辑的选择性逆转问题,其目标是在保留其余已编辑事实的同时定位并逆转目标编辑事实(第3节)。  
- 我们提出一种基于谱的逆转框架,该框架使用可学习的逐元素门控作用于奇异向量,以定位并收缩已编辑权重主导秩一分量内的编辑敏感组件(第5节)。  
- 我们在多个模型、编辑方法和事实编辑基准上进行了广泛实验,表明所提框架能有效逆转选定编辑同时保留其余编辑。结果提供了经验证据,表明当编辑数量适中时,不同编辑在编辑矩阵的主导奇异分量中是稀疏且非强纠缠的(第6节)。  

## 2 相关工作  
#### 知识编辑  
知识编辑旨在高效更新模型中存储的特定知识Yao等(2023)、Zhang等(2024)。大多数现有研究关注事实关联,可表示为三元组(s, r, o),其中s、r和o分别表示主体、关系和客体。给定编辑主体‑关系对及提示p(s_e, r_e),目标是将模型输出从原始客体o_old更新到新目标客体o_new,同时保持无关事实提示p(s_u, r_u)的输出不变。知识编辑方法可分为两类。参数保持方法通过外部记忆Mitchell等(2022b)、Zhong等(2023)、Zheng等(2023)、Chen等(2024b)或附加参数Huang等(2023)、Hartvigsen等(2023)执行编辑。参数修改方法直接修改原始模型参数,包括先定位再编辑范式Meng等(2022)、Meng等(2023)、Li等(2024)、Fang等(2025)和元学习方法Mitchell等(2022a)、Tan等(2024)。由于先定位再编辑方法因其简单性和强编辑性能对恶意攻击者特别有吸引力Youssef等(2025a)、Youssef等(2026),本文主要关注此类方法。  

#### 编辑性检测  
编辑性检测旨在确定输出或模型是否受知识编辑影响。DEEDYoussef等(2025c)使用仅从已编辑模型提取的特征检测给定事实三元组的编辑性。KETILi等(2025)将输出编辑性检测扩展至多类型识别。Youssef等(2026)直接从已编辑模型探查编辑关系和目标,并使用随机输入集识别已编辑权重。  

#### 知识编辑逆转  
知识编辑逆转旨在将已编辑事实恢复至原始行为,同时不影响无关知识。Youssef等(2025b)通过提示调优逆转上下文内知识编辑,而Youssef等(2026)使用已编辑权重的低秩近似实现参数修改型编辑的全局逆转。与先前关注上下文内编辑或参数修改型编辑全局移除的工作相比,我们研究选择性逆转,即仅逆转目标编辑事实而保留其余已编辑事实。知识编辑逆转与机器遗忘Xu等(2023)、Sendera等(2025)相关,因为两者都旨在移除不期望知识同时最小化对无关行为的影响。然而,编辑逆转目标更具体:除了移除特定编辑的影响,它还试图恢复原始模型行为。  

## 3 问题陈述  
设f_edit表示经一组事实编辑E修改的LLMs。本文考虑一个实际场景,仅可访问已编辑模型f_edit,而原始预训练模型和完整编辑历史不可用。由于现有编辑性检测技术Li等(2025)、Youssef等(2025c)、Youssef等(2026)仅使用已编辑模型即可识别编辑事实,我们假设一组已编辑主体‑关系对已被检测并选定进行逆转。我们将此集合表示为F={(s_i, r_i)}_{i=1}^n。对于每个选定对(s_i, r_i),我们构建一个检索提示p_i(s_i, r_i),它与编辑时使用的提示语义等同但不完全相同。其余已编辑事实表示为R=E\F。这些事实在选择性逆转过程中未知。设f_pref表示编辑前的预训练模型,f_rev表示对f_edit应用选择性逆转后的模型。选择性逆转的目标是将f_edit转换为f_rev,使得:  

- 对于F中每个选定的编辑事实,f_rev的输出行为接近f_pref;  
- 对于R中其余已编辑事实,f_rev的输出行为保持接近f_edit。  

## 4 方法动机  
Youssef等(2026)发现编辑信息主要集中在编辑矩阵的主导奇异子空间中,移除顶部奇异方向可以消除编辑行为并使模型输出回归预训练状态。由于神经网络参数的多语义性质及其中存储知识的丰富性Olah等(2020),一个完整的秩一分量σ_k u_k v_k^⊤可能包含与多个事实相关的信息。近期AdaEditLi和Chu(2025)表明,对于更新矩阵,仅保留顶部奇异向量及这些奇异向量中最大幅值项仍可实现强编辑性能。此发现表明,尽管先定位再编辑的更新通常由完整秩一向量构成,知识相关信息可能在最终更新矩阵中稀疏存在。基于这些观察,我们假设不同编辑事实在编辑矩阵的主导秩一分量中可能稀疏,使其可分离。因此,定位和操作每个编辑的细粒度方式是在每个分量内部操作。这激发了我们的基于谱的逆转框架,该框架通过门控奇异向量项收缩实现选择性逆转。  

## 5 基于谱的逆转框架  
本节介绍我们的基于谱的逆转框架。我们首先在5.1节介绍用于选择性逆转的奇异向量项门控收缩。然后在5.2节描述门控参数的优化。  

见图注  
图2:所提基于谱的逆转框架概览。该框架首先选取已编辑权重矩阵的顶部r个主导奇异分量。然后应用可学习的逐

相似文章