循环去噪揭示扩散模型中的超稳定记忆

arXiv cs.LG 论文

摘要

循环去噪作为一种新颖的提取攻击方法,通过反复对样本进行加噪和去噪,揭示了扩散模型中超稳定的记忆训练图像。该技术无需梯度或权重检查,对隐私审计具有重要意义。

arXiv:2606.24000v1 Announce Type: new Abstract: 我们引入了循环去噪——在受控噪声幅度下的重复前向和反向扩散——作为一种针对图像扩散模型的提取攻击。受无序固体中随机组织现象的启发,循环去噪暴露了学习分布中标准采样基本无法访问的区域。该动力学将样本推向具有广泛稳定谱的吸引子。最深的吸引子是超稳定的:它们在几乎完全损坏后再生,并持续数千次加噪-去噪循环。其中许多吸引子对应于记忆的训练图像,包括库存照片、品牌水印和网络爬取伪影。该攻击仅需采样器级别的控制,无需梯度、权重检查、提示词、标题或对训练数据的先验知识。与依赖于大规模提示生成和事后相似性或成员推理过滤的生成-过滤攻击不同,我们的主要协议是完全无条件的。我们在Stable Diffusion v1.4和像素空间DDPM中展示了这一现象,显示了潜空间和像素空间扩散模型中的一致行为。在不同噪声幅度下,我们观察到类似屈服转变的现象:低幅度循环产生平凡的吸收不动点或极限环,而较大幅度则引发重排、盆地跳跃以及结构化记忆吸引子盆地中的长期捕获。我们还观察到分层部分吸收、提示稳定盆地以及恢复吸引子集的跨初始条件普遍性。因此,我们的结果表明,循环去噪既是受物理学启发的生成景观探测器,也是记忆审计的实用工具,对隐私、版权合规和模型指纹识别具有重要意义。
查看原文
查看缓存全文

缓存时间: 2026/06/24 07:50

# 循环去噪揭示扩散模型中的超稳定记忆 来源:https://arxiv.org/html/2606.24000 Rishabh Sharma1,2Stefano Martiniani1,2,3,4 1纽约大学西蒙斯计算物理化学中心 2纽约大学软物质研究中心,物理系 3纽约大学神经科学中心 4纽约大学库朗数学科学研究所 \{rs10125, sm7683\}@nyu\.edu ###### 摘要 我们引入了循环去噪——在受控噪声幅度下重复进行前向和反向扩散——作为一种针对图像扩散模型的提取攻击。受无序固体中随机组织的启发,其中循环机械扰动将系统退火成越来越稳定的构型,循环去噪暴露了学习分布中标准采样在很大程度上无法触及的区域。我们发现这些动力学将样本推向具有广泛稳定性谱的吸引子,其中最深的吸引子表现出超稳定性:它们可以从近乎完全破坏的状态中再生,并在数千次加噪-去噪循环中持续存在。这些深层吸引子中有许多对应于记忆的训练图像,包括库存照片、品牌水印和网络爬虫伪影。我们的提取攻击只需要采样器级别的控制——能够将样本部分加噪到中间扩散时间步,然后再去噪回来——但不需要梯度或权重检查。关键的是,循环去噪不需要预先了解训练数据、标题或提示。相比之下,先前针对生产级扩散模型的生成-过滤攻击通常依赖于从已知或疑似训练标题进行大规模提示生成,然后进行事后相似度搜索或成员推断过滤来识别记忆候选。虽然循环去噪也可以与提示一起应用,但我们的主要协议是完全无条件的。我们在潜在扩散模型Stable Diffusion v1.4和较小的像素空间DDPM中演示了这一现象,显示了在潜在空间和像素空间扩散模型中一致的行为。在不同噪声幅度下,我们观察到类似屈服转变的现象:低幅度循环产生琐碎的吸收固定点(无特征、近乎单色的图像)或极限环(图像空间中的行进/振荡图灵模式),而较大幅度则引发重排、盆地跳跃以及在结构化记忆吸引子盆地中的长寿命捕获。我们进一步观察到层次化部分吸收,其中粗略场景布局冻结而精细细节保持扩散,以及提示稳定盆地和恢复吸引子集的跨初始条件普遍性。这些共同将循环去噪确立为一种受物理学启发的生成景观探针和记忆审计实用工具,对隐私、版权合规和模型指纹识别具有意义。 ## 1 引言 大型生成模型在海量网络规模数据上进行训练。它们的能力依赖这些数据集,但风险也同样存在:模型可能保留并复现特定的训练示例,包括受版权保护的艺术品、专有媒体、个人照片、带水印的库存图像以及从网络抓取的其他敏感伪影。因此,理解此类数据何时以及如何从训练模型中恢复,对于隐私、版权合规和模型审计至关重要。 现有的扩散模型提取攻击表明,记忆图像有时可以恢复,但它们以不同方式依赖模型采样动力学外部的信号或机制。一种经典且计算昂贵的方法是生成-过滤:对于文本条件模型如Stable Diffusion,攻击使用已知或疑似对应训练示例的标题提示模型,为每个标题生成大量样本,然后应用事后过滤、聚类、相似度搜索或成员推断程序来隔离记忆输出(Carlini等,2023 (https://arxiv.org/html/2606.24000#bib.bib4))。对于提示不可用的无条件模型,记忆候选则通过将大量生成样本与训练集比较来识别,这种策略主要在训练集已知且可搜索的基准规模设置中实用(Carlini等,2023 (https://arxiv.org/html/2606.24000#bib.bib4))。后续攻击使用不同信号,如单步去噪行为(Webster,2023 (https://arxiv.org/html/2606.24000#bib.bib5))或辅助分类器(Chen等,2025 (https://arxiv.org/html/2606.24000#bib.bib11)),但仍依赖标题、训练数据访问或单独训练的检测器。 循环去噪转而利用采样器自身的长时间动力学来提出记忆候选:决定检查什么的是吸收情节和长停留时间,而不是标题、训练集查找或辅助检测器。我们的方法受驱动无序系统物理学的启发(Corté等,2008 (https://arxiv.org/html/2606.24000#bib.bib1); Sharma和Karmakar,2025 (https://arxiv.org/html/2606.24000#bib.bib3); Mungan等,2025 (https://arxiv.org/html/2606.24000#bib.bib2); Zhang和Martiniani,2026 (https://arxiv.org/html/2606.24000#bib.bib14))。该设置概念简单:例如,无序固体有一个崎岖的景观,包含许多亚稳态构型,可以通过受控幅度进行循环扰动,如反复剪切。构型从一个循环到另一个循环发生变化,直到动力学达到一个抵抗进一步变化的状态,即吸收态。驱动幅度控制哪些吸收态可达。弱扰动将系统困在浅盆地中;更强扰动将其从这些盆地中弹出,使其探索景观中更深、更稳定的区域。在更高幅度下,系统屈服并各态遍历地探索能量景观。因此,随着循环扰动幅度的增加,观察到从吸收态到扩散态的转变。 我们通过*循环去噪*将此思想引入扩散模型。从图像或潜在表示开始,我们反复应用前向加噪到受控幅度γ\\gamma,然后再反向去噪回到γ=0\\gamma=0,使用一个循环的输出初始化下一个循环。从频闪观测的角度,即在每个完成的加噪-去噪循环结束时,模型轨迹遍历其学习到的生成景观。扩散噪声水平γ\\gamma扮演驱动幅度的角色:通过变化γ\\gamma,我们调节循环扰动的强度,并探测哪些状态可达且保持稳定。接近单位值的频闪余弦相似度长平台标记吸收事件;解码这些状态产生候选记忆图像。111补充视频:https://rishabh-tifr.github.io/cyclic-denoising/movies 这一过程揭示了一个类似屈服现象的稳定性谱。在低幅度下,系统无法充分探索,轨迹坍缩到琐碎的吸收态。这些要么是由无特征(近乎单色)图像组成的琐碎固定点,要么是由简单的图灵振荡模式组成的极限环。在中等幅度下,对景观的某些探索成为可能,动力学揭示简单的记忆伪影,如标志和网页模板。在更高幅度下,动力学能够逃脱浅盆地,探索景观的更大区域,并隔离出持续数百至数千个循环的更深吸引子。我们展示了许多这些吸引子并非一般样本:它们对应于记忆的训练图像和重复的网络爬虫伪影。这产生了一种由模型自身动力学驱动的无提示提取攻击,仅需采样器级别的控制,无需预先了解或访问训练数据。记忆化的标志是动力学的:当频闪轨迹锁入一个盆地并持续数百至数千个循环时,动力学本身将该状态标记为记忆候选。我们不是生成独立样本然后事后搜索记忆样本;长寿命吸收决定了检查哪些状态。此外,该协议对初始条件不敏感:可以从通用图像、模型生成样本或纯噪声开始循环。 我们在Stable Diffusion v1.4和基于CIFAR-10训练的像素空间DDPM中演示了这一现象。在两种设置中,记忆数据并非作为孤立的罕见样本出现,而是作为由持续循环扰动暴露的动态稳定吸引子。我们的结果表明了一种探测扩散模型中记忆化的新动力学途径:在生成景观中作为深盆地存在且标准采样极少遇到的训练示例,可以通过循环动力学访问。因此,循环去噪既提供了受物理学启发的扩散模型生成景观动力学探针,又提供了记忆审计的实用工具。 我们的主要贡献包括: - •**循环去噪作为扩散模型生成景观的动力学探针**。我们引入了循环去噪,一种反复前向-反向扩散协议,用于遍历生成景观。通过将一个循环的输出馈入下一个循环,该协议将采样转化为由循环幅度γ\\gamma控制的频闪动力学系统。受驱动无序系统中随机组织和机械退火的启发,它探测学习到的生成景观的稳定性结构,而不是从中抽取独立样本。 - •**吸收态、极限环、盆地跳跃和超稳定吸引子**。我们展示了扩散模型在重复的加噪-去噪循环下表现出丰富的长时间动力学。在低幅度下,轨迹可能坍缩到琐碎的吸收固定点或简单极限环;在更大幅度下,动力学变得间歇,在吸引子盆地中长时间停留,其间穿插着盆地间的短暂探索跳跃。一些盆地限制轨迹数百至数千个循环,最深的吸引子是超稳定的,在严重破坏后再生,并在持续循环扰动下持久存在。 - •**类似屈服现象的转变和幅度依赖性稳定谱**。变化循环幅度γ\\gamma揭示了一个从非屈服的低幅度行为到间歇探索的动力学转变,随着幅度增加,轨迹在盆地间跳跃并暂时困在长寿命吸引子中。恢复的吸引子集系统性地依赖于γ\\gamma:低幅度产生琐碎固定点或极限环,中等幅度恢复简单标志和网络爬虫伪影,更高幅度隔离出更深、更丰富的记忆图像。因此,γ\\gamma充当稳定性过滤器,选择模型吸引子集的不同子集。 - •**无提示、不依赖训练数据的提取攻击**。我们展示了许多非平凡吸引子对应于记忆的训练图像,产生一种仅需采样器级别控制的提取攻击——能够将样本部分加噪到中间扩散时间步并去噪回来。该攻击无需预先了解训练数据、标题或提示,也不使用梯度、权重检查、事后聚类或成员推断来提出候选:记忆候选直接作为循环动力学中的持久状态出现。 - •**稳定性作为提示模型的记忆化诊断**。我们将循环去噪扩展到提示条件采样,并测量提示移除后的稳定性。移除后的稳定性与记忆化正相关:提示稳定的概念盆地去相关最快,而真正记忆的训练图像覆盖广泛的稳定性范围,最深的保持超稳定。这使得移除后的去相关时间成为针对候选提示-图像对的γ\\gamma依赖性记忆化动力学测试。 参见图注Figure 1:无条件循环去噪将潜在表示驱动向Stable Diffusion v1.4景观中的吸引子。\(a\) 从单个ImageNet测试图像开始,在γ=0\.86\\gamma=0\.86下,10410^\{4\}循环无条件循环轨迹的解码快照;15×1515\\times 15网格显示每第4个循环,按阅读顺序,从左上角开始。经过初始瞬态(快照逐循环变化后),动力学锁定到第一个吸引子——一个带有黄色椅子的房间——持续超过2000个循环。短暂的瞬态将轨迹带入第二个吸引子(白色沙发场景,灰色墙上的画),该吸引子存活了相似数量的循环,然后另一个较长的瞬态将轨迹返回到同一第二个盆地。\(b\) 沿轨迹的连续潜在变量znz\_\{n\}和zn−1z\_\{n\-1\}之间的余弦相似度。接近单位值的平台对应盆地内的停留;急剧下降标记盆地间转变,与\(a\)中的定性变化匹配。本工作中的余弦相似度均在频闪观测下测量——在每个完成循环结束时。\(c\) 来自每个吸引子的示例潜在变量的单一前向-反向循环,γ=0→0\.86→0\\gamma=0\\rightarrow 0\.86\\rightarrow 0。房间布局在近乎完全破坏后再生,而精细细节如墙面艺术品则随机波动——这是吸引盆地的标志,其中主导场景模板被锁定而外围内容保持扩散。右列:反向图像搜索为两个吸引子检索到近重复的网络图像,对应多个供应商网站上反复组合到同一房间布局上的电商模板场景。这些模板在许多供应商网站中重复出现,使其很可能在网络规模的训练爬虫中被重复。独立地,Somepalli等\(2023 (https://arxiv.org/html/2606.24000#bib.bib10)\)将这两个相同场景(他们的图2)标记为Stable Diffusion v1.4生成中最常复现的,并将其追溯到重复的LAION训练图像——这是训练集层面的确认,即此处仅凭循环(无训练集访问)恢复的吸引子是真正的记忆内容。这两个场景也出现在类似的产品标题下,提及展示的艺术品而非房间本身,暗示了它们在学到的生成景观中接近的可能机制。循环去噪因此仅从模型动力学中暴露这些记忆模板。反向图像搜索的URL列于附录(表1 (https://arxiv.org/html/2606.24000#A1.T1))。 ## 2 相关工作 ### 2\.1 扩散和生成模型的动力学视角 近期工作开始将生成模型不仅视为采样器,也视为动力学系统,其轨迹揭示了学习分布中的结构。对于扩散模型,前向加噪过程和学习的反向去噪过程提供了一个自然的扰动-重建实验。Sclocchi等人\(2025 (https://arxiv.org/html/2606.24000#bib.bib6)\)展示了单个前向-后向扩散设置,或单个U型转弯,可以探测数据的层次结构:在层次生成模型中,重建高层特征如类别身份的概率在超过阈值扩散时间后急剧下降,而低层细节在整个扩散过程中平滑演化。他们的结果f

相似文章

扩散模型的时间差分学习

arXiv cs.LG

本文提出了一种用于扩散模型的时间差分(TD)学习目标,该目标在去噪轨迹上强制跨时间一致性。它将去噪重新表述为强化学习中的策略评估问题,展示了在样本质量(FID)上的显著改进,尤其适用于少步采样器。

通过填充提取扩散语言模型中的训练数据

arXiv cs.CL

本文介绍了infilling extraction(填充提取)方法,这是一种通过使用任意二进制掩码从扩散语言模型中提取训练数据的新方法,表明此类模型比之前认为的更容易受到记忆化攻击。