DiSCO:通过分布引导的对比提示优化防御文本到图像生成

arXiv cs.AI 论文

摘要

DiSCO是一种免训练的黑盒防御方法,用于文本到图像模型,通过分布引导的对比提示优化防止生成不安全内容(NSFW),显著降低攻击成功率。

arXiv:2608.17067v1 公告类型:新 摘要:随着文本到图像生成模型的进展,它们引发了关键的安全问题,特别是生成不安全内容(NSFW),如暴力和裸露,并被红队对抗攻击进一步加剧。现有防御主要基于白盒假设运行,依赖于文本编码器优化、权重编辑或推理时干预,并且从根本上无法扩展到专有模型。基于LLM提示重写的黑盒替代方案提供了更广泛的适用性,但在我们识别为良性对抗问题的关键领域失败:提示在语言上安全,但由于模型学习的数据分布仍会触发有害生成。我们提出DiSCO,一种零样本、严格的黑盒防御,完全在提示级别作为即插即用模块运行,无需模型重训练、微调或访问模型内部。DiSCO通过束搜索执行分布引导的后缀扩展,通过对比目标模型自身生成的安全和不安全图像池进行对比评分优化,并通过迭代自适应反馈直到产生安全内容。我们证明DiSCO在I2P基准测试下,面对多种红队攻击,持续增强无防御和有防御模型的安全性,分别实现37.7%和25.13%的ASR降低,同时保持语义保真度并提高图像连贯性。作为一种黑盒、与架构无关的模块,DiSCO可以轻松应用于任何文本到图像系统,无需对模型本身进行任何更改。
查看原文
查看缓存全文

缓存时间: 2026/08/19 09:50

# DiSCO:通过分布引导的对比提示优化防御文本到图像生成  
来源:https://arxiv.org/html/2608.17067  
Motasem Alfarra  
单位:高通AI研究  
\[0.4em\]\{tong\.zhang\.1, carlos\.hinojosa, bernard\.ghanem\}@kaust\.edu\.sa  
\{malfarra, clouizos\}@qti\.qualcomm\.com  
†\\dagger同等贡献  

Carlos Hinojosa  
单位:高通AI研究  
\[0.4em\]\{tong\.zhang\.1, carlos\.hinojosa, bernard\.ghanem\}@kaust\.edu\.sa  
\{malfarra, clouizos\}@qti\.qualcomm\.com  
†\\dagger同等贡献  

Christos Louizos  
单位:高通AI研究  

Bernard Ghanem  
\[0.6em\] 阿卜杜拉国王科技大学 (KAUST)  

###### 摘要  
随着文本到图像生成模型的发展,它们引发了关键的安全问题,特别是生成不适合工作环境(NSFW)的内容(如暴力和裸露),而红队对抗攻击进一步加剧了这一问题。现有防御主要基于白盒假设,依赖文本编码器优化、权重编辑或推理时干预,从根本上无法扩展到专有模型。基于大型语言模型提示重写的黑盒替代方案具有更广泛的适用性,但在我们识别出的一个关键场景中存在缺陷,即良性对抗问题:提示在语言层面是安全的,但由于模型学习到的数据分布,仍然会触发有害生成。我们提出DiSCO,这是一种无需训练的严格黑盒防御,完全在提示层面作为即插即用模块运行,无需模型重训练、微调或访问模型内部。DiSCO通过束搜索执行分布引导的后缀扩展,并通过目标模型自身生成的安全与不安全图像池的对比评分进行优化,迭代自适应反馈直至生成安全内容。我们证明,在32种系统-攻击设置和5个随机种子下,DiSCO在NudeNet下将平均攻击成功率(ASR)从23.6%降低到2.4%,在Q16下从8.3%降低到1.7%,同时保持或提升生成质量。作为一种黑盒、架构无关的模块,DiSCO可以轻松应用于任何文本到图像系统,无需对模型本身进行任何更改。  

**警告**:本文包含本质上具有冒犯性的模型输出。  
††高通AI研究是高通技术公司的倡议。  
††免责声明。本文中呈现的所有图像均在阿卜杜拉国王科技大学 (KAUST) 使用机构计算资源生成,仅用于评估和报告文本到图像模型的安全行为。这些实验中生成的潜在不安全内容仅用于研究评估,在机构监督下处理,且不重新分发。  

## 1 引言  
文本到图像生成的出现已经改变了各行业的工作流程\[13, 19, 15, 17, 3, 22, 7\],使用户能够从自然语言描述中合成逼真的图像。诸如Stable Diffusion\[20\]、SD 3\[4\]和Flux\[10\]等模型展示了卓越的生成能力,但这一进步同时也引入了关键的安全漏洞。在内容安全领域,这些模型可能通过无防御的生成或通过故意操纵输入提示(称为对抗攻击)来产生不适合工作环境(NSFW)的内容\[12, 1\],包括描绘暴力、裸露和其他有害图像。开源文本到图像模型日益普及进一步放大了这些风险,因为用户可以自由地与缺乏足够安全防护措施的系统交互,引发了负责任部署的迫切关注。红队对抗攻击的发现相应地引发了围绕文本到图像系统的日益严重的安全担忧。这些攻击涵盖了从不依赖模型访问的黑盒方法(用于制作对抗提示)\[24, 27\],到利用梯度和内部表示进行针对性提示优化的白盒方法\[32, 26\]。最近,基于大型语言模型的攻击,例如APT\[14\],通过生成既可规避自动检测器又可规避人工审查的人类可读对抗提示,进一步提高了门槛。这些攻击日益复杂化,要求防御机制同样具有鲁棒性和适应性。作为回应,一系列防御措施已经出现。白盒方法通过权重微调\[5, 31\]、交叉注意力编辑\[8\]或推理时引导\[21, 28\]来干预生成管道,但它们本质上无法扩展到专有或闭源模型。一种轻量级的黑盒替代方案是基于大型语言模型的提示重写\[33, 9\],它通常能中和包含明确不安全意图的提示;然而,它暴露了一个更根本的失败模式,即文本上良性的提示仍然会触发不安全的图像。我们将此形式化为良性对抗问题:一个提示p′对于生成模型G而言是良性对抗的,如果p′被语言级评估认为是安全的,但G(p′)却产生不安全的视觉内容。最近的证据表明,这是系统性的而非偶然的,良性提示可能会无意中引发有害生成\[11\],并且即使在模型权重受损的情况下,该问题依然存在\[25\],这表明纯文本空间防御存在差距。有鉴于此,我们将防御良性对抗提示视为一个分布对齐问题:不修改G,而是优化提示,将生成从模型学习到的输出分布的不安全区域转移到安全区域,如图1(左)所示。  

**图1**:(左)文本上安全的提示并不保证安全的生成。DiSCO通过分布引导的反馈优化提示,将生成引导向更安全的区域,从而解决了这一差距,而无需访问或修改底层模型。(右)DiSCO在多种无防御和已防御的文本到图像模型上显著降低了攻击成功率(ASR),作为即插即用的黑盒安全增强模块,无需修改底层模型。  

在本文中,我们研究了分布引导的提示优化作为针对不安全文本到图像生成的黑盒防御的效果。具体来说,我们探索如何通过目标模型自身安全和不安全输出的对比评分,系统性地将良性对抗提示引向安全生成区域。我们提出了DiSCO,这是一种无需训练的严格黑盒防御,完全在提示层面作为即插即用模块运行,无需模型重训练、微调或访问模型内部。DiSCO以包含对抗内容的提示为起点,通过分布引导的对比后缀扩展束搜索进行优化,并通过迭代自适应反馈,根据剩余有害内容的严重程度调整优化目标。我们进行了一项全面的实证研究,评估在I2P基准\[21\]上引入DiSCO对抗最新攻击的影响。我们的实验表明,为现有的无防御和已防御方法配备DiSCO,在所有评估的攻击下都能持续提高安全性,如图1(右)所示。DiSCO是模块化且通用的,我们展示了它如何全面提高最新防御的鲁棒性,从无需训练的推理时方法到基于微调的方法。我们的贡献总结如下:  
- • **问题**:我们形式化了文本到图像安全中的*良性对抗*场景,其中文本上安全的提示由于模型学习的输出分布,仍然可能引发不安全生成。  
- • **方法**:我们引入了DiSCO,一种无需训练的、*严格黑盒*且*即插即用*的提示优化模块,通过分布引导的对比后缀搜索引导生成,无需重训练、微调或访问模型内部。  
- • **结果**:在I2P上针对四种红队攻击,DiSCO在无防御和已防御系统中均持续提升安全性。在5个随机种子和32种系统-攻击设置下,它在NudeNet下将平均攻击成功率(ASR)从23.6%降低到2.4%,在Q16下从8.3%降低到1.7%,同时保持或提升了语义保真度和感知质量。  

## 2 方法论  

**图2**:DiSCO概览。(左)通过使用I2P数据集从目标模型生成图像,并通过分类器共识(NudeNet和Q16)过滤,构建模型特定的安全和不安全参考池。(右)DiSCO接受一个良性对抗提示,通过在CLIP嵌入空间中进行对比束搜索扩展优化的后缀词元,并在不修改模型本身的情况下,将目标模型的生成从不安全引导至安全。  

我们研究了分布引导的提示优化对文本到图像生成安全性的影响,如图2所示。我们观察到,传统的防御方法要么修改模型的内部参数,要么仅在文本层面运行,忽略了输入提示与模型自身视觉输出分布之间的关系。因此,我们的目标是研究引入一个由模型自身安全和不安全生成区域引导的提示级优化模块,对增强对抗鲁棒性可能产生的影响。  

### 2.1 问题定义与评估协议  
令P为文本提示空间,X为图像空间。文本到图像生成器是一个(可能是随机的)映射G: P→X,在给定提示p∈P时生成图像x∼G(p)。我们研究红队攻击,即制作对抗提示以增加不安全生成可能性的攻击:攻击算法A将初始提示(或模板)映射到p_adv=A(p)。在许多已部署的黑盒管道中,首先应用基于语言的净化器或大型语言模型重写模块R,产生重写后的提示p'=R(p_adv),该提示在语言上是良性的,然后系统生成x∼G(p')。我们关注的场景是,语言级净化不足,因为安全性取决于p'与由G诱导的*视觉*输出分布之间的对齐。  

##### 良性对抗提示。令SafeText: P→{0,1}表示语言级安全评估,SafeImg: X→{0,1}表示图像级安全评估。我们说p'∈P相对于G是*良性对抗的*,如果它通过了文本级检查,但仍有很高概率产生不安全图像:  
SafeText(p')=1 且 P_{x∼G(p')}[SafeImg(x)=0] ≥ 0.5.  (1)  
这一现象促使我们将防御视为一个*分布对齐*问题:不修改G,而是优化输入提示,使其诱导的生成偏离G学习的输出分布的不安全区域,转向安全区域。  

##### 防御设置(严格黑盒,提示级)。我们考虑一个提示级防御D: P→P,它将(通常是重写的)提示p'转换为优化后的提示p*=D(p'),之后生成器未经修改地运行:x*∼G(p*), p*=D(p').  (2)  
防御无权访问G的参数、梯度、注意力图或中间激活;它只能查询G以获取生成的图像。在较高层次上,我们寻求在保留p'用户意图的同时,减少不安全生成:  
min_D E_{p'}[P_{x∼G(D(p'))}[SafeImg(x)=0]]  
s.t. Sem(D(p'), p') ≥ τ,  (3)  
其中Sem(·, ·)衡量语义保真度(例如,文本-图像或文本-文本对齐),τ是保真度阈值。Sem(·, ·)的一个例子是著名的CLIP Score\[18\]。  

##### 评估协议和指标。我们使用*攻击成功率*(ASR)报告鲁棒性:在测试系统(无防御、基线防御或增强防御)下,产生不安全图像的已评估提示的比例:  
ASR = 1/|Q| ∑_{q∈Q} I[SafeImg(x_q)=0], x_q∼G(p_q),  (4)  
其中Q是评估的提示集,p_q是生成器对应的输入提示。我们使用两个互补的图像安全分类器(例如,NudeNet和Q16)计算ASR,并报告语义保真度/生成质量指标(例如,基于CLIP的对齐和ImageReward),以验证安全性的提升并非来自过度的语义漂移或输出质量的退化。除非另有说明,报告的ASR值是在NudeNet下测量的,这是先前工作中的标准评估器,允许与之前发布的数据进行直接比较。  

### 2.2 分布引导的对比后缀优化  
根据问题表述,我们现在准备介绍我们的防御:分布引导的对比后缀优化(DiSCO)。DiSCO是一个严格的黑盒提示级模块,它通过仅使用从G的*可观察输出*获得的反馈来优化*提示*,从而引导目标生成器G走向安全生成。简而言之,给定一个(可能经过净化的)输入提示p',DiSCO执行自回归*后缀扩展*,并选择在CLIP嵌入空间中最大化对比分布的后缀。

相似文章

一次重写解决所有问题?面向文本到图像提示优化的类型感知修复分配

arXiv cs.AI

本文介绍了类型感知修复分配(TARA),这是一个无需训练的框架,将文本到图像提示优化分解为原子修复分配,其中每个失败的命题被路由到类型条件的修复操作符。实验表明,TARA在DSG和TIFA基准测试上跨四个生成器取得了最佳语义准确性,在保持图像质量的同时优于VisualPrompter。

自监督提示优化

Papers with Code Trending

本文提出了一种名为自监督提示优化(SPO)的框架,该框架通过输出对比来优化大语言模型的提示词,无需外部参考,显著降低了成本和数据需求。

生成式推荐中的难度感知语义ID优化

arXiv cs.AI

本文提出DASO,一种针对生成式推荐的树感知后训练方法,通过分析rollout组并根据前缀匹配深度重新分配,解决GRPO中的难度不匹配问题,在公开基准测试中提升性能。