MUtE: 概念擦除与反事实干预的双重框架
摘要
MUtE 引入了一个新颖的框架,用于文本表示中的最优概念擦除和反事实干预,以提升算法公平性,并在NLP模型中实现反事实文本生成。
arXiv:2609.11253v1 Announce Type: new
摘要:从表示中擦除特定概念信息已被证明有助于缓解偏见或解释模型决策。共同目标是将原始表示进行转换,使得目标概念变得不可预测,同时最大限度保留与概念无关的信息。在这项工作中,我们重新审视了概念擦除的最优界限,以推导出一类新颖的擦除函数,这些函数自然地诱导出确定性的双重反事实映射。为弥合理论最优性与实际表示学习之间的差距,我们设计了一种实现方法,该方法对反事实轨迹施加平移偏差——这一约束与许多概念在现代语言模型中的几何表现方式一致。我们的框架实现了概念擦除与反事实生成之间的无缝导航。我们通过实验验证了其在提升下游算法公平性和生成反事实文本方面的有效性。
查看缓存全文
缓存时间: 2026/09/11 08:33
# 概念擦除与反事实干预的双重框架
来源:https://arxiv.org/html/2609.11253
Antoine Saillenfest a\.saillenfest@groupeonepoint\.com
###### 摘要
从表征中擦除特定概念信息已被证明有助于缓解偏见或解释模型决策。其联合目标是转换原始表征,使目标概念变得不可预测,同时最大程度保留与概念无关的信息。本文重新审视概念擦除的最优边界,推导出一类新颖的擦除函数,这些函数自然地诱导出确定性的双重反事实映射。为弥合理论最优性与实际表征学习之间的差距,我们设计了一种实现方法,该方法对反事实轨迹施加平移偏差——这一约束与现代语言模型中许多概念的几何显现方式相契合。我们的框架使得概念擦除与反事实生成之间的无缝导航成为可能。我们通过实证证明了该方法在提升下游算法公平性与生成反事实文本方面的有效性。111代码与数据:https://github.com/toinesayan/MUtE\.
## 1引言
文本表征本质上纠缠了各种各样的潜在概念,从需要算法缓解的敏感人口属性(如性别或种族)到用于可解释性的抽象语义属性(如写作风格或主题)。由于在离散文本空间中进行针对性干预难以自动化且常产生不流畅的产物,表征工程主要直接在连续嵌入空间中隔离并操作这些概念。
概念擦除的具体任务旨在通过擦除函数$R_{avfogel et al., 2020 (https://arxiv.org/html/2609.11253#bib.bib25);Ravfogel et al., 2022a (https://arxiv.org/html/2609.11253#bib.bib27);Chowdhury et al., 2025 (https://arxiv.org/html/2609.11253#bib.bib11)\)\$从一组表征中彻底消除与目标概念相关的信息。从信息论角度看,最优擦除需要在基本权衡中导航:最大化隐私(确保擦除后的表征包含最少的目标概念信息)与最大化效用(最大化保留原始表征中的信息)(Chowdhury et al., 2025 (https://arxiv.org/html/2609.11253#bib.bib11)\)\)。由于概念擦除本质上是与任务无关的,所得表征广泛适用于下游自然语言处理任务,在提升算法公平性(Ravfogel et al., 2020 (https://arxiv.org/html/2609.11253#bib.bib25);Chowdhury and Chaturvedi, 2022 (https://arxiv.org/html/2609.11253#bib.bib9);Lemberger and Saillenfest, 2024 (https://arxiv.org/html/2609.11253#bib.bib20)\)、增强可解释性(Lemberger and Saillenfest, 2024 (https://arxiv.org/html/2609.11253#bib.bib20)\)以及缓解语言模型毒性(Singh et al., 2024 (https://arxiv.org/html/2609.11253#bib.bib31)\)方面展现了有效性。
**图1:MUtE*(MUtE*)连续擦除框架**。分段擦除函数$ff$利用类别条件微分同胚$fif\_\{i\}$将源分布$PiP\_\{i\}$双射映射到共享的不变空间,最大化效用保留。这种结构天然地诱导出一个双重反事实映射($f2−1∘f1f\_\{2\}^{\-1}∘f\_\{1}\)),将样本$xx$及其反事实$x2←1x\_\{2\leftarrow 1\}$锚定在相同的擦除后表征$f(x)f(x)$上。通过先验结构先验(例如自然语言处理中常见的线性平移偏差)约束这些反事实轨迹,将条件映射联系起来,有效解决了最优擦除的函数不可识别性问题。受这些应用驱动,概念擦除发展迅速。通过放宽严格的隐私约束,大量研究处理了线性守卫性(Ravfogel et al., 2023 (https://arxiv.org/html/2609.11253#bib.bib28)\),即通过线性对手防止概念恢复。例如INLP(Ravfogel et al., 2020 (https://arxiv.org/html/2609.11253#bib.bib25)\)、RLACE(Ravfogel et al., 2022a (https://arxiv.org/html/2609.11253#bib.bib27)\)和当前最先进的LEACE(Belrose et al., 2023 (https://arxiv.org/html/2609.11253#bib.bib6)\)等方法通过投影到低维概念零空间实现线性擦除。然而,通用(非线性)概念擦除仍是一个开放挑战。当前方法包括对抗训练(Ganin et al., 2016 (https://arxiv.org/html/2609.11253#bib.bib15);Feder et al., 2021 (https://arxiv.org/html/2609.11253#bib.bib14);Ravfogel et al., 2022b (https://arxiv.org/html/2609.11253#bib.bib26)\)、信息论损失优化(FaRM(Chowdhury and Chaturvedi, 2022 (https://arxiv.org/html/2609.11253#bib.bib9)\)、KRaM(Chowdhury et al., 2023 (https://arxiv.org/html/2609.11253#bib.bib10)\))、贝叶斯优化(PEF(Chowdhury et al., 2025 (https://arxiv.org/html/2609.11253#bib.bib11)\))、从嵌入中过滤排序方向(TaCoJourdan et al. \(2024\) (https://arxiv.org/html/2609.11253#bib.bib18)\)以及通过投影进行密度匹配($L ̄\\overline\{\\text\{L\}\}EOPARD$(Saillenfest and Lemberger, 2025 (https://arxiv.org/html/2609.11253#bib.bib29)\))。然而,这些方法常常为满足严格的隐私边界而牺牲下游效用。此外,这些方法存在严重的计算瓶颈,依赖于广泛的神经网络训练、昂贵的密度估计或有限支撑上的贝叶斯优化,在高维场景中扩展性差。
同时,近期文献揭示了概念擦除与生成反事实表征之间深刻的联系,即对表层文本进行模拟因果干预后嵌入空间的近似。Lemberger and Saillenfest \(2024\) (https://arxiv.org/html/2609.11253#bib.bib20)假设存在结构因果模型和高斯先验,已证明概念擦除可以作为反事实生成的中介映射。受线性擦除技术启发,近期工作推导出在最小位移约束下的线性引导干预(Singh et al., 2024 (https://arxiv.org/html/2609.11253#bib.bib31)\),并通过连续到离散反演技术(Avitan et al., 2025 (https://arxiv.org/html/2609.11253#bib.bib5);Morris et al., 2023 (https://arxiv.org/html/2609.11253#bib.bib21)\)解码为反事实文本。
本文中,我们重新审视了连续表征空间中的离散概念擦除及其最优性。我们形式化了最优擦除函数的结构,并证明它们天然诱导出一个双重的、确定性的反事实映射。为连接理论与实践,我们提出了一种实用的实现方法,该方法对反事实轨迹施加刚性的平移偏差。这种方法实际利用了现代文本编码器常将概念分离为线性方向的现象。
总而言之,我们的主要贡献包括:
- • 我们引入了MUtE*(MaximumUtility-preservingErasure),这是一类针对连续表征的最优擦除函数,其内在定义了一个双重反事实映射(第2节 (https://arxiv.org/html/2609.11253#S2)\))。
- • 我们推导出一种实用且计算高效的实现方法,利用平移偏差执行擦除和反事实表征生成(第3节 (https://arxiv.org/html/2609.11253#S3)\))。
- • 我们通过合成数据和自然语言处理基准测试实证验证了我们的框架,证明了其在偏见缓解和反事实文本生成方面的有效性(第4节 (https://arxiv.org/html/2609.11253#S4)\))。
## 2最优擦除与反事实
本节形式化最大效用保持擦除(MUtE*)的理论基础。在定义问题设定(第2.1节 (https://arxiv.org/html/2609.11253#S2.SS1)\))之后,我们回顾完美擦除(第2.2节 (https://arxiv.org/html/2609.11253#S2.SS2)\))和最大效用保留(第2.3节 (https://arxiv.org/html/2609.11253#S2.SS3)\))的必要条件。假设存在一个预言预测器,我们证明这种最优擦除天然诱导出一个双重反事实映射(第2.4节 (https://arxiv.org/html/2609.11253#S2.SS4)\)),为解决擦除函数固有的不可识别性提供了有原则的几何机制。
### 2.1问题陈述
令$PS\\mathbf\{P\}\_\{\\mathcal\{S\}\}$为任意输入空间$S\\mathcal\{S\}$上的概率分布。令$enc:S→RD\\mathrm\{enc\}:\\mathcal\{S\}\\to\\mathbb\{R\}^\{D\}$为将输入映射到连续表征空间的编码函数,并令$Z=\{1,...,K\}\\mathcal\{Z\}=\\\{1,\\dots,K\\\}$$ (K>1K>1)$表示由真实标签函数$c∗:S→Zc^\{\*\}:\\mathcal\{S\}\\to\\mathcal\{Z\}$分配的离散概念类别集。
我们定义概念变量$ZZ$和表征变量$X∼PXX\\sim\\mathbf\{P\}\_\{X\}$为$S\\mathcal\{S\}$上的随机变量:
$Z(s)=c∗(s)Z(s)=c^\{\*\}(s)$$ (1)$
$X(s)=enc(s)X(s)=\\mathrm\{enc\}(s)$$ (2)$
令$p(x)p(x)$表示$PX\\mathbf\{P\}\_\{X\}$的概率密度函数(PDF)。对于每个概念类别$i∈Zi\\in\\mathcal\{Z\}$,我们引入类别条件表征变量$Xi∼PiX\_\{i\}\\sim\\mathbf\{P\}\_\{i\}$,其相应的条件密度定义为$pi(x):=p(x∣Z=i)p\_\{i\}(x):=p(x\\mid Z=i)$。
概念擦除寻求一个擦除函数$ff$,该函数从表征$XX$(公式2 (https://arxiv.org/html/2609.11253#S2.E2)\))中移除关于$ZZ$(公式1 (https://arxiv.org/html/2609.11253#S2.E1)\))的概念相关信息。我们将擦除后表征定义为$Q=f(X)Q=f(X)$,其分布遵循前推测度$Q=f#PX\\mathbf\{Q\}=f\_\{\\\#\}\\mathbf\{P\}\_\{X\}$,相应的类别条件分布为$Qi\\mathbf\{Q\}\_\{i\}$。
我们做出以下假设:
- • 擦除函数保持潜在维度不变,即$f:RD→RDf:\\mathbb\{R\}^\{D\}\\to\\mathbb\{R\}^\{D\}$。
- • 条件分布$Pi\\mathbf\{P\}\_\{i\}$在$RD\\mathbb\{R\}^\{D\}$上连续且具有完全支撑(即不存在零密度区域)$^{222}$。在我们主要的自然语言处理设定($S=Σ∗\\mathcal\{S\}=\\Sigma^\{\*\}$,其中$Σ\\Sigma$是字母表且$PS\\mathbf\{P\}\_\{\\mathcal\{S\}\}$是语言模型)中,离散文本输入严格映射到$RD\\mathbb\{R\}^\{D\}$中的点质量。为满足连续性和完全支撑约束,我们假设这些离散表征经过了连续平滑(例如,通过核密度估计)。
### 2.2离散概念擦除.
概念擦除从根本上寻求一个变换$ff$,该变换强制$f(X)f(X)$与$ZZ$之间严格的统计独立性。这转化为严格的分布约束:擦除后表征的类别条件分布必须完美对齐(Saillenfest and Lemberger, 2025 (https://arxiv.org/html/2609.11253#bib.bib29)\))。形式化地:
$∀i∈Z,Qi=Q\\forall i\\in\\mathcal\{Z\},\\quad\\mathbf\{Q\}\_\{i\}=\\mathbf\{Q\}$$ (3)$
从信息论角度看,公式3 (https://arxiv.org/html/2609.11253#S2.E3)对应于实现以互信息消失为特征的隐私边界:$I(f(X),Z)=0I(f(X);Z)=0$(Chowdhury et al., 2025 (https://arxiv.org/html/2609.11253#bib.bib11)\))。
然而,至关重要的是,这种纯粹的擦除目标本身并不自足。无限多个映射满足此独立性标准,包括退化的常数函数(例如$f(x)=k∈RDf(x)=k\\in\\mathbb\{R\}^\{D\}$),它们会灾难性地压缩表征空间。因此,任何可行的概念擦除框架必须制定一个联合目标:满足擦除准则,同时最大化保留原始表征中固有的与任务无关的信息(效用)。
### 2.3最大效用保留.
从信息论角度看,保留最大效用要求条件熵消失:$H(X|f(X),Z)=0H(X|f(X),Z)=0$(Chowdhury et al., 2025 (https://arxiv.org/html/2609.11253#bib.bib11)\))。对于概念类别$i∈Zi\\in\\mathcal\{Z\}$进行条件化,等式$H(Xi|f(Xi))=0H(X\_\{i}|f(X\_\{i\}))=0$意味着$XiX\_\{i\}$可以从其擦除后表征中完美恢复。由于正向映射根据定义是确定性的($H(f(Xi)|Xi)=0H(f(X\_\{i\})|X\_\{i\})=0$),这种相互确定性确保$ff$将每个条件分布$Pi\\mathbf\{P\}\_\{i\}$双射地映射到$Qi\\mathbf\{Q\}\_\{i\}$。
在结构上,整合完美擦除约束(公式3 (https://arxiv.org/html/2609.11253#S2.E3)\)),MUtE*(最大效用保持擦除)函数满足:
$∀s∈S,f(X(s))=fc∗(s)(X(s))\\forall s\\in\\mathcal\{S\},\\quad f(X(s))=f\_\{c^\{\*\}(s)\}(X(s))$$ (4)$
其中每个$fi:RD→RDf\_\{i\}:\\mathbb\{R\}^\{D\}\\to\\mathbb\{R\}^\{D\}$是一个微分同胚,将$Pi\\mathbf\{P\}\_\{i\}$转换为$Q\\mathbf\{Q\}$。
这种连续空间表述反映了Chowdhury et al. \(2025\) (https://arxiv.org/html/2609.11253#bib.bib11)引入的最优擦除框架。他们的方法通过类别条件排列实现最优的隐私-效用边界,假设离散支撑具有相等的基数,并且相对于目标分布仅排列不同。我们的框架通过将组合排列替换为微分同胚,将这些最优性原则推广到连续概率测度。
公式4 (https://arxiv.org/html/2609.11253#S2.E4)中样本依赖的分配$c∗(s)c^\{\*\}(s)$阻止了$ff$仅在可观察表征$XX$上操作。为绕过这一限制,Chowdhury et al. \(2025\) (https://arxiv.org/html/2609.11253#bib.bib11)假设条件支撑不相交,保证从表征本身可完美预测概念类别。实际上,高维连续表征不可避免地表现出重叠的支撑,产生不可约的贝叶斯错误,从而阻止严格的确定性。然而,由于现代潜在空间表现出高度的结构可分性,通常允许探测器实现近乎完美的经验分类,我们采用一个易于处理的理论替代方案。我们假设存在一个最优预言预测器$η∗\\eta^\{\*\}$,它能以可忽略的错误恢复概念类别,在我们的公式中将其理想化为精确的:
$∀s∈S,η∗(X(s))=Z(s)=c∗(s)\\forall s\\in\\mathcal\{S\},\\quad\\eta^\{\*\}(X(s))=Z(s)=c^\{\*\}(s)$$ (5)$
在此预言假设下,MUtE*函数(公式4 (https://arxiv.org/html/2609.11253#S2.E4)\))可以表示为一类表征依赖的擦除映射:
$f:RD→RD,x↦fη∗(x)(x)f:\\mathbb\{R\}^\{D\}\\to\\mathbb\{R\}^\{D\},\\quad x\\mapsto f\_\{\\eta^\{\*\}(x)\}(x)$$ (6)$
因为概念擦除在分布层面强制对齐(公式3 (https://arxiv.org/html/2609.11253#S2.E3)\)),有效MUtE*映射的假设空间是无限的。这允许表征空间的任意拓扑扭曲。为解决这种根本的不可识别性,我们接下来利用这些最优擦除函数天然诱导的双重反事实映射。
### 2.4双重反事实映射
令反事实映射$m$相似文章
MANCE:流形感知的概念消除
MANCE 提出了一种流形感知方法,用于从模型激活中消除性别或安全性等概念,同时最小化对其他概念的附带损害,在119个设置中达到了最先进水平。
Uni-Edit:智能编辑是统一模型调优的通用任务
Uni-Edit提出使用智能图像编辑作为单一通用任务,以同时提升统一多模态模型的理解、生成和编辑能力,并配备自动化数据合成流程生成复杂的编辑指令。
ConceptGuard:大型语言模型中上下文敏感遗忘的基准测试
本文介绍了ConceptGuard,这是一个基准测试,用于评估大型语言模型中使用双重用途概念的上下文敏感遗忘能力,揭示了当前遗忘技术在此实际评估框架下表现不佳。
MUX:基于多路复用令牌的连续推理
MUX 提出了一种无损连续推理的方法,通过将离散推理步骤蒸馏到多路复用的潜在令牌中,这些令牌编码了子词的叠加,实现了更高的带宽,并在语言模型推理任务中支持并行探索。
文本编辑能否泛化到视觉生成?统一多模态模型中的跨模态知识编辑基准测试
本文介绍了UniKE,这是首个针对统一多模态模型(UMMs)的跨模态知识编辑基准测试,揭示了显著的模态差距:文本编辑实现了92%的效果,但仅有18.5%迁移到图像生成。它提出了Reasoning-augmented Parameter Editing,以改善跨模态迁移,提升幅度高达18.6个百分点。