@QuixiAI: https://arxiv.org/abs/2509.21401 这是我在至少一小时内看到的最酷的东西 @TroyDoesAI @elder_plinius @ma…

X AI KOLs Following 论文

摘要

提出了JaiLIP方法,通过使用损失引导扰动生成不可察觉的对抗图像来破解视觉语言模型,实现了高毒性并优于现有方法。

https://t.co/tkErgozCSI 这是我在至少一小时内看到的最酷的东西 @TroyDoesAI @elder_plinius @maximelabonne @FernandoNetoAi https://t.co/wN9vxlXukV
查看原文
查看缓存全文

缓存时间: 2026/06/29 12:37

https://t.co/tkErgozCSI 这至少是我一小时里看到的最酷的东西了 @TroyDoesAI @elder_plinius @maximelabonne @FernandoNetoAi https://t.co/wN9vxlXukV


通过损失引导的图像扰动实现视觉-语言模型越狱

来源:https://arxiv.org/html/2509.21401

摘要

视觉-语言模型(VLM)在生成多模态推理任务方面具有卓越的能力。然而,由于不同类型的攻击向量,VLM的潜在误用或安全对齐问题显著增加。在各种攻击向量中,最近的研究表明,基于图像的扰动在生成有害输出方面尤为有效。在现有文献中,许多现有技术被提出用于越狱VLM,但存在性能不稳定和扰动可见的问题。在本研究中,我们提出了一种基于损失引导的图像扰动越狱方法(JaiLIP),这是一种图像空间中的越狱攻击,它通过联合优化干净图像与对抗图像之间的均方误差(MSE)损失以及模型的有害输出损失来最小化一个联合目标。我们使用Perspective API和Detoxify的标准毒性指标对所提方法在VLM上进行了评估。实验结果表明,我们的方法生成了高度有效且难以察觉的对抗图像,在产生毒性方面优于现有方法。此外,我们在交通领域评估了该方法,以证明该攻击在特定领域的毒性文本生成之外的实际应用性。我们的研究结果强调了基于图像的越狱攻击的实际挑战以及为VLM开发高效防御机制的必要性。

警告:本文包含被视为冒犯性的数据、提示和模型输出示例。

I 引言

视觉-语言模型(VLM)(例如,LLaVA 15、BLIP-2 12 和 MiniGPT-4 1)通过增强大型语言模型(LLM)的能力,使其能够在各种多模态任务中进行推理 3, 13, 2。这些模型将强大的视觉编码器与语言模型相结合,使其能够根据图像和文本生成开放式回复。然而,视觉编码器的集成引发了LLM的严重安全问题 9, 23。最近的评估(如MaTT基准测试)表明,即使是像GPT-4这样最先进的LLM,在数学推理方面也只达到中等准确率。此外,许多正确答案并不包含完整的解释,这表明模型可能并非真正在进行推理 7。因此,LLM的攻击向量和防御机制最近引起了广泛关注 33, 11, 20

越狱攻击是最常研究的攻击向量,能够绕过VLM的安全对齐并生成有害或有毒的输出 30, 28, 8。此类对抗策略通常分为三类 16, 14:基于文本的越狱,通过提示注入或角色扮演等技术操纵文本提示以绕过对齐 34;基于图像的对抗越狱,使用扰动或中毒图像误导视觉编码器 24;以及跨模态越狱,结合文本和图像操作以增加绕过安全机制的机会 25。我们的工作聚焦于图像空间的对抗方法,并引入了一种新颖的优化框架,确保既难以察觉又高效。

虽然已有多种方法探索了VLM的越狱,但只有少数方法成功绕过了安全对齐;这为越狱攻击性能的改进留下了空间 18, 6。现有方法通常依赖于相关图像或图像-文本组合来绕过对齐机制。然而,很少有方法直接利用模型本身优化图像,以根据攻击者定义的目标语料生成有害句子。一些现有技术采用了基于PGD的扰动。在本研究中,我们的目标是识别PGD方法的局限性,并通过集成额外的优化策略来提高基于PGD的越狱攻击的有效性。

基于PGD 19 的扰动技术被广泛用于优化图像以绕过LLM的安全对齐。然而,这些越狱攻击的成功在很大程度上取决于扰动水平。增加扰动水平可以提高攻击成功率,但也会导致更明显、可感知的扰动。此外,此类攻击的普适性尚未在更广泛的有害行为或多样化应用领域中得到充分探索。这两个因素是现有方法的主要局限性。

基于这些局限性,我们旨在提高越狱攻击的有效性,同时保持最小的扰动可见性,并探索其在更广泛领域的适用性。我们提出了JaiLIP,该方法在保留tanh重参数化以确保有效像素范围的同时,最小化联合的MSE和模型损失,通过基于损失的优化(受 (L_2) 攻击启发 5)引导模型生成有害响应。我们对 Carlini 和 Wagner 5 开发的方法进行了定制。该方法通过应用基于tanh的重参数化来确保有界的像素级修改,从而解决了PGD风格技术 24 的局限性,进而以难以察觉的扰动实现更高的攻击成功率。特别地,我们使用MSE损失来控制与原始图像的扰动,帮助对抗图像在视觉上保持相似,同时仍能引导模型产生有害输出。我们研究的主要贡献如下:

  • • 我们提出了一种损失引导的越狱技术,它在图像空间中操作,并联合优化MSE损失和模型的有害输出损失。
  • • 我们使用BLIP-2和MiniGPT-4进行了大量的实证仿真,证明了在毒性方面的攻击成功率显著提高。
  • • 我们将评估扩展到交通领域,进一步证明了我们提出的攻击向量在特定领域毒性之外的适用性和泛化能力。

II 文献综述

将视觉模块集成到LLM中导致了VLM的发展,由于其多模态特性引入了新的漏洞。Liu等人 14 的一项著名综述系统地将攻击向量分类为对抗性、越狱、提示注入和数据中毒。在本文中,我们探讨了VLM特有的攻击面,并强调了视觉输入如何被利用。Zou等人 25 引入了对多模态语言模型的组合对抗攻击,其中多个良性组件(例如,文本或视觉)被组合以产生绕过安全对齐的有害输入。与单次越狱不同,他们的方法表明,即使每个单独元素都是良性的,安全机制也可能失效。他们在LLaVA和GPT-4V等模型上的实验表明,组合输入可能对VLM造成脆弱性。此外,Qi等人 24 提出了一种对VLM的视觉对抗性越狱攻击,其中使用PGD在小型有害语料上优化单个对抗图像以绕过安全对齐。他们的发现表明,仅视觉输入就能使MiniGPT-4、InstructBLIP和LLaVA等VLM失去对齐。

随着这些漏洞变得更加明显,出现了使用多模态攻击框架检查VLM鲁棒性的新方法论。Liu等人 17 引入了Arondight,这是一个自动红队框架,结合了强化学习与多模态提示生成,在绕过GPT-4等模型的安全对齐方面取得了高成功率。大约在同一时间,Yang等人 29 提出了对比子图像分心越狱(CS-DJ),该方法使用查询分解和对比子图像来分散多模态大型语言模型(MLLM)的注意力并绕过对齐。该方法将有害查询分解为子查询,并将其与视觉上复杂的无关图像配对,从而在GPT-4o、GPT-4V和Gemini-1.5-Flash等模型上实现了更高的越狱成功率。Ma等人 18 提出了Visual-RolePlay(VRP),这是一种针对MLLM的通用越狱方法。VRP通过在图像中嵌入一个角色扮演角色,诱导模型扮演该角色并执行有害指令,同时忽略安全对齐。实验表明,VRP实现了高攻击成功率,突出了基于角色的多模态提示对安全对齐的风险。

最近的工作集中在通过组合多模态优化来提高攻击有效性。Ying等人 31 扩展了Qi等人 24 提出的视觉对抗攻击思想。他们提出了一种双模态对抗提示(BAP)方法来越狱VLM。通过联合设计文本和视觉提示,BAP有效绕过了安全对齐并产生了有害输出。在多个LVLM上的实验表明,该方法实现了高攻击成功率和强迁移性,突显了多模态系统对组合跨模态对抗输入的脆弱性。Wang等人 26 引入了多模态链接(MML)攻击,该攻击通过受密码学启发的编码-解码方案在文本和图像模态中嵌入恶意目标,实现了高成功率,并且即使针对GPT-4o也难以检测。Niu等人 21 提出了一种基于最大似然的MLLM越狱方法,引入了图像越狱提示(imgJP),绕过安全对齐。他们的方法在数据普遍性、跨模型(如MiniGPT-v2、LLaVA和InstructBLIP)的迁移性方面表现强劲,并进一步通过基于构造的方法扩展到LLM越狱。与这些方法相比,我们的框架专注于视觉输入,并将攻击建模为一个组合的MSE损失和模型损失优化问题。它能够生成匹配有害文本目标的扰动图像,而无需任何文本提示。与Qi等人 24 在像素空间中使用PGD风格的更新优化对抗扰动不同,我们的方法引入了一种损失引导的公式,该公式联合最小化感知失真(通过MSE)和最大化攻击有效性,同时通过 tanh 重参数化确保有效的像素值。类似地,Ying等人 31 依赖于结合文本和图像输入的双模态对抗提示,而我们的方法完全基于图像,不需要任何文本条件,证明了仅优化的图像就能越狱VLM。

III 方法论

提出的JaiLIP框架旨在图像空间中生成难以察觉的对抗扰动,以从VLM中产生有害的文本响应。该框架公式化了一个优化问题,该问题联合最小化视觉扰动并最大化生成目标有毒输出的可能性。给定一张干净图像 (x \in [0,1]^{3 \times H \times W}) 和一组有害目标句子 (\mathcal{T} = {t_1, t_2, …, t_B}),目标是生成一个扰动图像 (x_{\text{adv}}),使其在视觉上与 (x) 相似,但导致模型 (M) 输出一个或多个来自 (\mathcal{T}) 的有害响应。

为了实现这一点,我们优化以下损失函数:

[ \mathcal{L}{\text{total}}(x{\text{adv}}) = \underbrace{\frac{1}{3HW}\sum_{i=1}^{3HW}\big(x_{\text{adv},i} - x_i\big)^2}{\mathcal{L}{\text{MSE}}} + c \cdot \underbrace{\mathcal{L}{\text{model}}(M(x{\text{adv}}), \mathcal{T})}_{\text{Attack Loss}} \quad (1) ]

其中 (\mathcal{L}{\text{MSE}}) 通过均方误差确保难以察觉性,(\mathcal{L}{\text{model}}) 是当将 (x_{\text{adv}}) 与采样的有毒目标批次对齐时VLM产生的损失。超参数 (c) 控制难以察觉性和攻击有效性之间的权衡。

为了确保扰动图像保持在有效像素空间 ([0,1]) 内,我们使用 tanh 空间重参数化。输入图像通过 (w = \tanh^{-1}(2x - 1)) 变换,对抗图像通过 (x_{\text{adv}} = \frac{1}{2}(\tanh(w) + 1)) 恢复。这种变量替换保证了在 (w) 上的梯度更新总能生成 (x_{\text{adv}}) 的有效像素值。

在每次迭代中,我们采样一批 (B) 个有毒目标 ({t_1, …, t_B} \subset \mathcal{T})。然后对抗图像被归一化并复制以形成大小为 (B) 的批次。批次中的每个图像与相应的有毒目标配对,这些输入-输出对被送入模型。攻击损失被计算为批次中所有样本的平均交叉熵损失:

[ \mathcal{L}{\text{model}} = \frac{1}{B}\sum{i=1}^{B} \text{CE}(M(x_{\text{adv}}^{(i)}), t_i), ]

其中 CE 表示模型输出与有毒目标之间的交叉熵。

优化通过梯度下降在 (w) 上进行,使用 Adam 优化器,学习率 (\eta),迭代次数 (T)。在每一步,计算模型损失、MSE失真损失和总损失,并反向传播梯度以更新 (w)。此外,我们采样当前的对抗图像并使用核采样解码VLM的响应,为攻击进展提供定性反馈。

我们提出的方法在算法1(https://arxiv.org/html/2509.21401v2#alg1)中概述。我们的方法完全基于图像,在攻击过程中不使用任何文本提示。这种设计确保了扰动应用于视觉输入。

相似文章

JoyAI-VL-Interaction: 实时视觉-语言交互智能

Hugging Face Daily Papers

本文介绍了JoyAI-VL-Interaction,一个开源8B规模的视觉-语言模型,可实时持续运行,自主决定何时响应或委派。它包含一个完整的可部署系统和一个训练配方,在人类评估中优于Doubao和Gemini。