在文本到图像扩散模型中认证概念遗忘
摘要
本文介绍了一个用于文本到图像扩散模型概念遗忘的认证框架,提供了对残余泄漏的高置信度保证,并表明标准的基于攻击的评估往往低估了安全风险。
arXiv:2609.12163v1 Announce Type: new
摘要:现有文本到图像(T2I)扩散模型的概念遗忘评估主要依赖于通过自动化对抗性提示搜索获得的攻击成功率。然而,这些指标仅提供有限查询集上的经验证据,而对更广泛提示空间上的残余泄漏大多未量化。这种局限性可能导致高估遗忘效果并低估安全风险。为解决这一问题,我们引入了一种新的T2I概念遗忘认证框架,该框架对残余概念泄漏提供带有有界误差的高置信度保证。我们的方法结合了统计认证和沿概念相关嵌入方向的最坏情况分析,以在用户指定的置信水平下推导泄漏概率的显式上界。我们在三个主要概念类别(即NSFW内容、艺术风格和名人身份)以及六种最先进的遗忘方法上评估了我们的框架。认证泄漏界限一致地比标准攻击成功率高出16.2%,揭示了现有评估协议遗漏的重大残余风险。至关重要的是,我们的结果表明,基于经验攻击的评估可能显著低估残余泄漏,并确立认证为可靠审计T2I扩散模型中概念遗忘的必要补充。
查看缓存全文
缓存时间: 2026/09/14 08:36
# 认证文本到图像扩散模型中的概念遗忘 来源: https://arxiv.org/html/2609.12163 ###### 摘要 现有对文本到图像(T2I)扩散模型中概念遗忘的评估,主要依赖于通过自动化对抗性提示搜索获得的攻击成功率。然而,这些指标仅在有限的查询集上提供了经验证据,而对更广泛提示空间中残留泄露的量化则严重不足。这种局限可能导致高估遗忘效果,并低估安全风险。为填补这一空白,我们引入了一种新型T2I概念遗忘认证框架,为残留概念泄露提供带有有界误差的高置信度保证。我们的方法结合了统计认证与沿概念相关嵌入方向的最坏情况分析,以在用户指定的置信水平下推导出泄露概率的明确上界。我们在三个主要概念类别(即NSFW内容、艺术风格和名人身份)以及六种最先进的遗忘方法上评估了我们的框架。认证泄露界限平均比标准攻击成功率高出16.2%,揭示了现有评估协议所遗漏的大量残留风险。关键的是,我们的结果表明,基于经验攻击的评估可能会显著低估残留泄露,并确立了认证作为可靠审计T2I扩散模型中概念遗忘的必要补充手段。 ¹伦敦帝国理工学院 ²维也纳理工大学 [email protected], [email protected], [email protected] ## 1 引言 文本到图像(T2I)扩散模型,如Stable Diffusion (Rombach et al. 2022 [https://arxiv.org/html/2609.12163#bib.bib1])、SDXL (Podell et al. 2023 [https://arxiv.org/html/2609.12163#bib.bib3]) 和 DALL-E 2 (Ramesh et al. 2022 [https://arxiv.org/html/2609.12163#bib.bib4]),可以被提示生成NSFW内容、模仿受保护的艺术风格以及再现真实个体的样貌,从而引发安全、版权和隐私方面的担忧。概念遗忘方法通过编辑预训练模型,在生成时抑制目标概念(例如关键词、风格或身份),而无需从头开始重新训练,从而缓解了这一问题 (Gandikota et al. 2023 [https://arxiv.org/html/2609.12163#bib.bib5]; Gandikota et al. 2024 [https://arxiv.org/html/2609.12163#bib.bib6]; Lyu et al. 2024 [https://arxiv.org/html/2609.12163#bib.bib7]; Lu et al. 2024 [https://arxiv.org/html/2609.12163#bib.bib8]; Fan et al. 2024 [https://arxiv.org/html/2609.12163#bib.bib9]; Zhang et al. 2024b [https://arxiv.org/html/2609.12163#bib.bib10]; Cywiński and Deja 2025 [https://arxiv.org/html/2609.12163#bib.bib11])。然而,即使这些方法在经验上有效,也没有任何一种能保证该概念不再能被生成。获得这种保证是困难的,因为遗忘方法执行的编辑只是近似的:它们在概念附近局部调整权重或嵌入,而非将其从训练分布中移除,因此编辑后模型在概念附近的行为难以通过解析方式描述。因此,遗忘效果仅通过测量**残留泄露**来经验性验证,即编辑后模型仍能被驱动生成该概念的速率。这通常通过对编辑后模型运行对抗性提示搜索,并报告所得的攻击成功率(ASR)来完成,即一组精选提示集中仍然引出该概念的比例。然而,ASR仅是对有限、经搜索优化的提示空间样本的估计。因此,低ASR只能表明某种特定的搜索方法未能找到攻击,并不能证明不存在攻击。这种不完整性可能会制造虚假的安全感,因为在一个对抗性搜索下被判定安全的提示,曾被另一个搜索反复攻破 (Rando et al. 2022 [https://arxiv.org/html/2609.12163#bib.bib16]; Chin et al. 2023 [https://arxiv.org/html/2609.12163#bib.bib14])。 参见说明 图1:认证流程概述。在本文中,我们通过引入残留泄露的认证框架来解决这一差距。我们直接对感兴趣的概念在整个嵌入空间邻域内的残留泄露进行认证,而非仅针对明确命名或间接引出该概念的有限提示集。为实现这一点,我们引入了图1 [https://arxiv.org/html/2609.12163#S1.F1] 所示的认证流程。简而言之,该框架结合了在连续概念邻域中的对抗性引导以及校准的文本空间和像素空间验证,以确定该概念是否仍可被引出以及是否存活到生成的输出中。这些阶段性的估计随后被组合成一个单一的、高置信度的、端到端残留泄露的有界上界。值得注意的是,该界限在整个概念邻域上一致成立,而不仅限于先前工作中特定搜索碰巧尝试过的那些提示。为证实我们的主张并展示我们提出流程的优势,我们做出以下贡献: - • 我们通过实证证明,基于有限对抗性提示集计算的ASR无法提供残留泄露的可靠上界,实际上使得排除泄露变得不可能。 - • 我们推导出一个统计认证,用于约束T2I模型在对抗性提示下真实再生已遗忘概念的概率,该认证基于连续概念邻域而非有限提示子集。 - • 我们在三个概念类别(即NSFW内容、艺术风格和名人身份)以及两个广泛使用的T2I扩散模型上的六种最先进遗忘方法中实例化了该认证,确立了框架的通用性。 - • 我们提供消融研究以确立我们认证的鲁棒性。据我们所知,这是首个在整个概念邻域上认证已遗忘T2I模型中残留概念泄露的方法,而非仅针对有限提示集。 ## 2 相关工作 概念遗忘方法编辑预训练的T2I扩散模型,以抑制目标概念,而无需从头重新训练。现有方法通过基于梯度的微调 (Gandikota et al. 2023 [https://arxiv.org/html/2609.12163#bib.bib5]; Lu et al. 2024 [https://arxiv.org/html/2609.12163#bib.bib8]; Fan et al. 2024 [https://arxiv.org/html/2609.12163#bib.bib9])、封闭式权重或注意力编辑 (Gandikota et al. 2024 [https://arxiv.org/html/2609.12163#bib.bib6]; Lyu et al. 2024 [https://arxiv.org/html/2609.12163#bib.bib7])、对抗训练 (Zhang et al. 2024b [https://arxiv.org/html/2609.12163#bib.bib10]) 或基于可解释性的特征抑制 (Cywiński and Deja 2025 [https://arxiv.org/html/2609.12163#bib.bib11]) 来实现。对这些方法的现有评估主要关注三个概念类别:NSFW和暴力内容,在I2P提示集上进行评估 (Schramowski et al. 2023 [https://arxiv.org/html/2609.12163#bib.bib21]);艺术风格,通过抑制目标艺术家的风格同时保留不相关的风格进行评估 (Kumari et al. 2023 [https://arxiv.org/html/2609.12163#bib.bib22]);以及名人身份,通过抑制某位知名个体的样貌同时保持其他身份不变进行评估 (Lu et al. 2024 [https://arxiv.org/html/2609.12163#bib.bib8])。Six-CD (Ren et al. 2025 [https://arxiv.org/html/2609.12163#bib.bib23]) 正式化了这一惯例,其基准测试套件围绕这三个类别组织。我们在评估中也采用了相同的三个类别。概念遗忘的有效性和鲁棒性通常通过经验性地搜索在遗忘后仍能引出目标概念的提示来评估,文献根据对手对部署模型的知识来区分攻击类型。静态黑盒对手独立于目标模型构建对抗性提示,依赖于从代理模型的可迁移性。Ring-A-Bell (Tsai et al. 2023 [https://arxiv.org/html/2609.12163#bib.bib12]) 提取概念向量,并在代理视觉编码器上使用遗传算法进行搜索,而MMA-Diffusion (Yang et al. 2024 [https://arxiv.org/html/2609.12163#bib.bib13]) 使用代理模型联合扰动文本和图像输入,而不直接查询目标模型。自适应白盒对手则直接针对部署模型优化提示。P4D (Chin et al. 2023 [https://arxiv.org/html/2609.12163#bib.bib14]) 和 UnlearnDiffAtk (Zhang et al. 2024c [https://arxiv.org/html/2609.12163#bib.bib15]) 都需要访问遗忘模型的权重梯度来优化对抗性提示。此外,Rando et al. (Rando et al. 2022 [https://arxiv.org/html/2609.12163#bib.bib16]) 表明,Stable Diffusion基于规则的安全过滤器可以在大多数保留的不安全提示上被人工红队测试并绕过。在静态和自适应两种设置下,鲁棒性最终都以攻击成功率(ASR)报告,即一个有限的对抗性提示集中成功的比例。因此,现有评估仍然是经验性的,除了测试过的提示集之外,没有提供任何保证。这种评估鸿沟反映了认证方法在其他领域已经成功解决的一个问题。例如,随机平滑为分类器认证了一个鲁棒性半径,而非报告经验对抗准确率 (Cohen et al. 2019 [https://arxiv.org/html/2609.12163#bib.bib17]),而erase-and-check通过单边Hoeffding边界认证,一个大型语言模型安全过滤器在有界对抗性扰动下不会将有害提示错误地标记为安全 (Kumar et al. 2023 [https://arxiv.org/html/2609.12163#bib.bib18])。在另一条研究路线中,认证机器遗忘限制了编辑后模型参数与从头重新训练模型之间的统计距离 (Guo et al. 2020 [https://arxiv.org/html/2609.12163#bib.bib19]; Sekhari et al. 2021 [https://arxiv.org/html/2609.12163#bib.bib20])。然而,这是关于数据移除的保证,而非关于对手是否仍能在推理时引出某个所谓被抑制的概念。这些认证都没有被实例化用于T2I生成流程或当前概念遗忘评估中使用的静态和自适应对抗性提示威胁模型。 ## 3 背景 本节回顾了本文所依据的背景:T2I扩散模型如何从文本生成图像、从此类模型中遗忘一个概念意味着什么,以及所得的编辑如何被常规评估。 ### T2I 扩散模型 潜在扩散模型 (Rombach et al. 2022 [https://arxiv.org/html/2609.12163#bib.bib1]) 通过学习逆转一个固定的前向加噪过程来生成图像。设 $z_t$ 表示扩散时间步 $t$ 的潜在变量,其中 $z_0$ 是图像的无噪声潜在编码,$z_T$ 是最终的噪声潜在变量。前向过程在 $T$ 个时间步上逐步将 $z_0$ 破坏为 $z_T$: $q(z_t \mid z_{t-1}) := \mathcal{N}\left(z_t;\ \sqrt{\alpha_t}\,z_{t-1},\ (1-\alpha_t)\mathbf{I}\right)$,其中 $\alpha_t \in (0,1)$ 是一个固定的方差调度表。一个去噪器 $\varepsilon_\theta$,通过一个带有参数 $\theta$ 的条件 U-Net 实现,被训练来通过预测每一步添加的高斯噪声来逆转此过程: $\mathcal{L}_{\mathrm{LDM}} = \mathbb{E}_{z_t,\varepsilon,t,x}\left[\|\varepsilon - \varepsilon_\theta(z_t, x, t)\|^{2}\right]$,其中 $\varepsilon$ 表示在时间步 $t$ 添加的高斯噪声,而 $x$ 是条件提示的文本嵌入,通过一个预训练的文本编码器 $e$ 获得 (Rombach et al. 2022 [https://arxiv.org/html/2609.12163#bib.bib1])。在推理时,首先将提示编码为 $x$,从高斯噪声采样 $z_T$,并由以 $x$ 为条件的 $\varepsilon_\theta$ 迭代去噪,所得潜在变量被解码到像素空间;我们用 $f_\theta$ 表示这个完整的提示到图像的映射。 ### T2I 扩散模型中的概念遗忘 给定一个预训练模型 $f_\theta$ 和一个目标概念 $c$(例如,NSFW内容、艺术风格或名人身份),概念遗忘将 $\theta$ 编辑为 $\theta'$,使得 $f_{\theta'}$ 不再生成 $c$,且无需在完整训练分布上重新训练。由于编辑只是近似地且仅在模型或其表示的有限部分调整 $\theta$,而不是从训练数据中移除 $c$ 的影响,因此 $f_{\theta'}$ 在与 $c$ 相关的提示或表示附近的行为难以解析描述。第 2 节 [https://arxiv.org/html/2609.12163#S2] 回顾了具体的遗忘算法;此处我们将遗忘泛化为任何从 $f_\theta$ 和 $c$ 产生 $f_{\theta'}$ 的过程。 ### ASR:遗忘鲁棒性量化 编辑 $f_{\theta'}$ 的有效性通常通过攻击成功率(ASR)来量化:给定一个针对概念 $c$ 的有限对抗性提示集 $\mathcal{A}(c)$,$\mathrm{ASR} = \frac{1}{|\mathcal{A}(c)|} \sum_{p \in \mathcal{A}(c)} D\big(f_{\theta'}(p)\big)$,其中 $D(\cdot) \in \{0,1\}$ 是一个二进制检测器,若生成图像中存在 $c$ 则返回 $1$;较低的ASR表示更强的经验鲁棒性。这里,$f_{\theta'}(p)$ 表示在评估协议下为提示 $p$ 生成的输出,为简单起见,此处忽略采样随机性。$\mathcal{A}(c)$ 可由一个*静态*对手(无法访问 $\theta'$)或一个*自适应*对手(完全梯度访问 $f_{\theta'}$)构建;第 2 节 [https://arxiv.org/html/2609.12163#S2] 综述了这两种攻击。我们仅将 $D$ 用作任务特定标准的通用替代,用于决定目标概念是否出现在生成的输出中。 ## 4 揭示 ASR 的局限性 图 2:图表显示,随着预算增加,攻击面单调增长。现有概念遗忘评估报告在固定对抗性查询预算下的攻击成功率(ASR),但尚不清楚此类测量是否提供了残留泄露的稳定估计。为研究此问题,我们研究了 ASR 随攻击预算增加如何变化。为测试这一点,我们使用三种代表性的对抗性提示方法:MMA-Diffusion (Yang et al. 2024 [https://arxiv.org/html/2609.12163#bib.bib13])、P4D (Chin et al. 2023 [https://arxiv.org/html/2609.12163#bib.bib14]) 和 Ring-A-Bell (Tsai et al. 2023 [https://arxiv.org/html/2609.12163#bib.bib12]),攻击了三个为NSFW性概念遗忘的 SD-Turbo 模型。这三个遗忘模型分别使用 ESD (Gandikota et al. 2023 [https://arxiv.org/html/2609.12163#bib.bib5])、UCE (Gandikota et al. 2024 [https://arxiv.org/html/2609.12163#bib.bib6]) 和 TraSCE (Jain et al. 2025 [https://arxiv.org/html/2609.12163#bib.bib32]) 获得。我们在对抗性查询预算 $N \in \{10^2, 10^3, 10^4\}$ 下评估了每种攻击,每个预算使用五个随机种子。图 2 [https://arxiv.org/html/2609.12163#S4.F2] 在对数轴上绘制了 ASR 随查询预算的变化,阴影区域表示跨种子的最小-最大范围。对于所有三种方法,ASR 随着 $N$ 单调上升,并且在 $N=10^4$ 时尚未饱和。
相似文章
ConceptGuard:大型语言模型中上下文敏感遗忘的基准测试
本文介绍了ConceptGuard,这是一个基准测试,用于评估大型语言模型中使用双重用途概念的上下文敏感遗忘能力,揭示了当前遗忘技术在此实际评估框架下表现不佳。
使用概念图在T2I扩散模型中的高效偏见缓解
该论文介绍了CO-ALIGN,一种用于文本到图像扩散模型的偏见缓解方法,它在文本编码器和去噪器中对齐概念图,实现了30%的公平性提升和11.4的FID增益,同时减少了88%的不连贯输出。
循环去噪揭示扩散模型中的超稳定记忆
循环去噪作为一种新颖的提取攻击方法,通过反复对样本进行加噪和去噪,揭示了扩散模型中超稳定的记忆训练图像。该技术无需梯度或权重检查,对隐私审计具有重要意义。
I-CARE:在可控、多样且具代表性的文本到图像模型遗忘设置中干扰相关现象的分析
本文介绍了I-CARE,这是一种系统性分析文本到图像模型机器遗忘中干扰的方法,提供了形式化定义和开源框架,以实现可重复研究。
不确定但确信:揭示扩散语言模型中的表征-置信度差距
本文识别出扩散语言模型中的“表征置信度差距”:内部状态能准确检测输入噪声,但报告的置信度在高噪声下仍保持高位,答案排序能力下降。本文引入了一种轻量级、无需训练的信息提取工具,利用隐藏状态改进排序,而无需修改基础模型。