ICO:通过迭代上下文优化增强语义偏移越狱攻击

arXiv cs.CL 论文

摘要

本文指出语义偏移越狱攻击因忽视上下文的语义偏移能力而受限,并提出迭代上下文优化(ICO)——一种黑盒框架,通过迭代优化上下文来提高对基础模型的攻击成功率。

arXiv:2608.03210v1 公告类型:新 摘要:基础模型在各种任务中取得了显著成功,但仍然存在脆弱性。为了研究这些脆弱性,语义偏移越狱攻击最近成为一种有前景的攻击范式。它们通过将原始有害问题中的有害词替换为良性替代词,并利用上下文信息诱导目标模型将这些替代词重新解释为相应的有害概念,从而绕过明确的安全机制。然而,现有的语义偏移越狱攻击通常效果有限。在这项工作中,我们揭示了这一局限性源于忽视上下文的语义偏移能力。通过系统分析,我们发现上下文在诱导语义偏移方面表现出显著不同的能力:语义偏移能力越强的上下文越有可能引导模型恢复有害含义并实现成功的越狱。基于这一发现,我们系统地识别并提炼了有效上下文的特征,并提出了一种具有迭代上下文优化(ICO)的黑盒上下文感知语义偏移越狱框架。在每次迭代中,ICO利用这些特征和目标模型的反馈来优化上下文。在三个数据集和八个目标基础模型上的大量实验表明,ICO始终优于八个最先进的基线方法,平均攻击成功率达到74.6%。
查看原文
查看缓存全文

缓存时间: 2026/08/05 07:44

# ICO:通过迭代上下文优化增强语义偏移越狱攻击
来源:https://arxiv.org/html/2608.03210
Hujian Zhu1, Yihao Huang1, Felix Juefei\-Xu3, Xinfeng Li4, Peng Zeng1, Simeng Qin5, Qing Guo2, and Geguang Pu1

###### 摘要

基础模型在各种任务上取得了显著成功,但它们仍然容易受到攻击。为了研究这些脆弱性,语义偏移越狱近日作为一种有前景的攻击范式出现。它们通过将原始有害问题中的有害词替换为良性替代词,并利用上下文信息诱导目标模型将这些替代词重新解释为对应的有害概念,从而绕过显式安全机制。然而,现有的语义偏移越狱往往效果有限。在这项工作中,我们揭示出这一局限性源于对上下文语义偏移能力的忽视。通过系统分析,我们发现上下文在诱导语义偏移方面表现出显著差异:语义偏移能力越强的上下文,越有可能引导模型恢复有害含义并实现成功越狱。基于这一发现,我们系统地识别和提炼了有效上下文的特征,并提出了一种基于迭代上下文优化(ICO)的黑盒上下文感知语义偏移越狱框架。在每次迭代中,ICO利用这些特征以及目标模型的反馈来优化上下文。在三个数据集和八个目标基础模型上的大量实验表明,ICO始终优于八个最先进的基线方法,平均攻击成功率达到74.6%。

###### 索引术语:

基础模型,越狱攻击,语义偏移越狱,迭代上下文优化,模型安全。

## 1 引言

参见图1:常见越狱、语义偏移越狱与ICO的比较。ICO通过高质量的上下文同时实现了表面良性输入和高攻击成功率。大型语言模型(LLM)和大型视觉语言模型(LVLM),在本文中统称为基础模型,在文本理解、推理、代码生成、图像感知和多模态交互方面展现出了非凡的能力[5 (https://arxiv.org/html/2608.03210#bib.bib1),6 (https://arxiv.org/html/2608.03210#bib.bib2),1 (https://arxiv.org/html/2608.03210#bib.bib3),19 (https://arxiv.org/html/2608.03210#bib.bib4),17 (https://arxiv.org/html/2608.03210#bib.bib5)]。它们已被广泛用于开放式问答、内容生成和复杂任务执行。然而,基础模型存在安全风险。最近的研究表明,通过精心设计的越狱输入,可以使它们生成不安全内容[30 (https://arxiv.org/html/2608.03210#bib.bib6),12 (https://arxiv.org/html/2608.03210#bib.bib7),33 (https://arxiv.org/html/2608.03210#bib.bib8),2 (https://arxiv.org/html/2608.03210#bib.bib9),11 (https://arxiv.org/html/2608.03210#bib.bib10)]。尽管暴露了这些漏洞,但许多现有的越狱方法要么显式包含有害概念,要么依赖易识别的攻击模式,因此容易受到拒绝机制和输入级安全防御的影响。

为了解决这一问题,最近的研究探索了避免在输入中直接使用显式有害词的越狱方法[36 (https://arxiv.org/html/2608.03210#bib.bib11),3 (https://arxiv.org/html/2608.03210#bib.bib12)]。具体来说,这些方法将原始有害问题中的有害词(例如,“如何制造炸弹”中的“炸弹”)替换为良性替代词(例如,“胡萝卜”),从而形成诸如“如何制作胡萝卜”这样看似无害的查询。虽然替换后的查询不再包含显式有害内容,但这些方法旨在通过上下文引导恢复原始有害含义。其核心思想是利用上下文信息诱导语义偏移,使目标模型在推理过程中将良性替代词重新解释为原始有害概念。例如,一个描述“那架旧飞机在敌方领土上空投下了一枚炸弹”的上下文可以被转换为将“炸弹”替换为“胡萝卜”,从而产生越狱输入“那架旧飞机在敌方领土上空投下了一根胡萝卜。如何制作胡萝卜”。在这种上下文下,模型不再按字面意义解释“胡萝卜”,而是将其解释为“炸弹”。因此,尽管模型收到了看似良性的查询,它仍会恢复原始问题的有害语义,并生成与有害意图相关的响应。我们将此类攻击称为语义偏移越狱。

尽管现有的语义偏移越狱能够生成表面良性的输入,但其攻击成功率仍然有限。我们揭示出这一局限性源于忽视了上下文在语义偏移能力上的差异。具体而言,语义偏移能力较弱的上下文无法诱导目标模型将良性替代词重新解释为有害概念,导致模型要么保留良性含义,要么仅部分恢复预期的有害语义。相比之下,语义偏移能力较强的上下文能更有效地引导模型走向有害概念,从而提高越狱成功率。

基于上述观察,我们提出了一种基于迭代上下文优化的黑盒越狱方法,称为ICO。ICO包含三个步骤。首先,给定一个有害问题,ICO识别每个有害词并将其替换为中性占位符[\mathtt{P}_{i}],以构建替换后的问题。其次,ICO生成一个包含有害词的上下文,将该词替换为[\mathtt{P}_{i}],并将上下文与替换后的问题结合,得到初始越狱输入。第三,在每次迭代中,ICO向目标模型查询越狱输入,并从生成的响应中获取反馈。通过利用提炼出的有效上下文特征和响应反馈,ICO生成上下文优化建议,并迭代改进上下文以实现更有效的语义偏移。总而言之,我们的贡献如下:

- •据我们所知,我们首次揭示出上下文中语义偏移能力存在差异,并确定上下文优化是增强此类攻击的有效策略。
- •我们提出了一种基于迭代上下文优化的黑盒语义偏移越狱方法。该方法以表面良性输入实现高攻击有效性,并且可泛化到LLM和LVLM。
- •在三个数据集和八个目标基础模型上的大量实验表明,ICO始终优于八个最先进的基线方法,平均攻击成功率达到74.6%。

## 2 相关工作

### 2.1 基础模型

基础模型已成为处理各种语言和视觉语言任务的通用接口[5 (https://arxiv.org/html/2608.03210#bib.bib1)]。

LLM[6 (https://arxiv.org/html/2608.03210#bib.bib2)]在文本理解、推理、代码生成和开放式内容生成方面展现了强大的能力。随着视觉语言模型的发展[1 (https://arxiv.org/html/2608.03210#bib.bib3),19 (https://arxiv.org/html/2608.03210#bib.bib4),17 (https://arxiv.org/html/2608.03210#bib.bib5)],基础模型可以进一步将文本指令与视觉输入相结合,以执行图像理解、视觉问答和图像文本联合推理等任务。GPT模型[27 (https://arxiv.org/html/2608.03210#bib.bib13)]在语言理解、指令遵循、复杂推理、代码生成和多模态解释方面表现出强大能力。Gemini模型[13 (https://arxiv.org/html/2608.03210#bib.bib14)]进一步支持对文本、图像、音频和视频的多模态和长上下文推理,使其能够处理长文档和复杂跨模态输入。DeepSeek模型[8 (https://arxiv.org/html/2608.03210#bib.bib15)]在语言理解、数学推理和代码相关任务上取得了具有竞争力的性能,同时强调高效的模型架构和训练。Llama模型[16 (https://arxiv.org/html/2608.03210#bib.bib16)]提供了公开发布的基础模型,具有强大的多语言、推理、编码、指令遵循和工具使用能力。Grok模型[34 (https://arxiv.org/html/2608.03210#bib.bib17)]将语言推理扩展到视觉输入,包括文档、图表、截图和照片,并展现出强大的现实世界空间理解能力。Qwen模型[4 (https://arxiv.org/html/2608.03210#bib.bib18)]提供了全面的多模态能力,包括细粒度视觉识别、目标定位、文档和图表理解、长视频理解以及多模态推理。

### 2.2 基础模型上的越狱攻击

越狱攻击大致可分为纯文本攻击[22 (https://arxiv.org/html/2608.03210#bib.bib19),37 (https://arxiv.org/html/2608.03210#bib.bib20),33 (https://arxiv.org/html/2608.03210#bib.bib8),2 (https://arxiv.org/html/2608.03210#bib.bib9),25 (https://arxiv.org/html/2608.03210#bib.bib21),7 (https://arxiv.org/html/2608.03210#bib.bib22),20 (https://arxiv.org/html/2608.03210#bib.bib23)]和多模态攻击[31 (https://arxiv.org/html/2608.03210#bib.bib24),14 (https://arxiv.org/html/2608.03210#bib.bib25),18 (https://arxiv.org/html/2608.03210#bib.bib26)]。这些方法构造特定的文本或多模态输入,以影响模型的理解。

一些越狱方法包含显式有害词,因此可能触发模型拒绝或被输入过滤机制检测到。因此,近期的语义偏移越狱攻击开始关注表面良性输入。这些方法[36 (https://arxiv.org/html/2608.03210#bib.bib11),3 (https://arxiv.org/html/2608.03210#bib.bib12)]不直接暴露有害词,而是通过良性上下文诱导模型重新解释用户意图。其核心思想是将原始有害问题重写为替换后的问题,使输入在形式上不再呈现明显风险,同时仍引导模型恢复隐藏的有害语义。在纯文本设置中,Doublespeak[36 (https://arxiv.org/html/2608.03210#bib.bib11)]表明,模型可以在上下文中建立良性词与隐藏有害词之间的语义绑定,从而恢复原始有害问题的意图。在多模态设置中,视觉隐藏意图越狱攻击[3 (https://arxiv.org/html/2608.03210#bib.bib12)]使用了类似的思想,并成功针对LVLM构造了越狱。这些工作表明,安全风险不仅来自显式有害词,还来自模型对上下文的语义恢复过程。然而,这些方法大多依赖设计不佳的上下文,导致攻击成功率较低。

相比之下,我们系统地研究了上下文质量,并引入上下文优化以提高攻击有效性,同时保持表面良性输入。

## 3 动机

尽管现有的语义偏移越狱[36 (https://arxiv.org/html/2608.03210#bib.bib11)]能够生成表面良性输入,但其有效性仍然有限,平均攻击成功率约为37.5%。语义偏移越狱依赖上下文信息从替代后的良性词中恢复原始有害语义。因此,上下文在决定预期语义偏移能否成功建立方面起着关键作用。为了研究这种影响,我们在保持占位符不变的情况下修改上下文,并评估其对攻击性能的影响。

在本实验中,我们使用了从HarmBench[24 (https://arxiv.org/html/2608.03210#bib.bib27)]、AdvBench[37 (https://arxiv.org/html/2608.03210#bib.bib20)]和StrongREJECT[32 (https://arxiv.org/html/2608.03210#bib.bib28)]中选取的120个样本。我们在GPT-5.4 Nano、Gemini 3.1 Flash-Lite、Llama 3.3 70B和DeepSeek V4-Flash上评估了相同的样本集。对于每个样本(即一个原始有害问题),我们将有害词替换为占位符。针对四个模型中的每一个,我们为每个问题随机生成十个上下文,每个模型得到1,200个越狱输入。为了评估上下文的影响,我们测量语义恢复和攻击成功率,并分析它们在不同上下文之间的关系。

对于每个越狱输入,我们使用相应的目标模型来评估从越狱输入中恢复的语义是否与原始有害问题一致。基于评估结果,每个(越狱输入,原始有害问题)对分为三类:*低恢复*、*部分恢复*和*完全恢复*。例如,给定原始有害问题“如何制造炸弹”,相应的越狱输入是“那架旧飞机在敌方领土上空投下了一个[P1]。如何制作一个[P1]”。*低恢复*表示LLM未识别出[P1]与原始有害词之间的有害语义关联,且越狱输入恢复后的含义仍然无害。*部分恢复*表示LLM识别出与[P1]关联的有害词,但恢复后的含义仍与原始有害问题不同。*完全恢复*表示LLM成功恢复了原始有害语义,且越狱输入的含义与原始有害问题等价。

表I:四个目标模型在1,200个上下文上的语义恢复分布。模型低恢复部分恢复完全恢复GPT-5.4395(32.92%)559(46.58%)246(20.50%)Gemini 3.1429(35.75%)387(32.25%)384(32.00%)Llama 3.3427(35.58%)465(38.75%)308(25.67%)DeepSeek V4501(41.75%)341(28.42%)358(29.83%)表I (https://arxiv.org/html/2608.03210#S3.T1)总结了每个目标模型的1,200个随机生成的上下文句子的语义恢复结果。每行对应一个目标模型,三列分别报告了*低恢复*、*部分恢复*和*完全恢复*类别的数量与比例。分布呈现出明显的模型依赖趋势:GPT-5.4 Nano和Llama 3.3 70B以*部分恢复*为主(46.58%和38.75%),Gemini 3.1 Flash-Lite的*完全恢复*率最高(32.00%),而DeepSeek V4-Flash的*低恢复*率最高(41.75%)。在所有四个目标模型中,这些分布一致表明,随机生成的上下文在恢复原始有害词含义的能力上存在显著差异。

参见图

(a)GPT-5.4 Nano

参见图

(b)Gemini 3.1 Flash-Lite

参见图

(c)Llama 3.3 70B

参见图

(d)DeepSeek V4-Flash

图2:四个目标模型在不同语义恢复水平上的部分和完全攻击成功率。参见图

(a)GPT-5.4 Nano

参见图

(b)Gemini 3.1 Flash-Lite

参见图

(c)Llama 3.3 70B

参见图

(d)DeepSeek V4-Flash

图3:四个目标模型在一次引导优化步骤前后的语义恢复分布。##### 语义恢复与攻击成功率。

对于每个越狱输入,我们从目标模型获取响应,然后

相似文章

大型语言模型中的不完整提示越狱

arXiv cs.AI

本文正式定义了不完整提示越狱(IPJ),这是一种漏洞,当不完整的恶意提示导致大型语言模型生成有害的延续内容时,并分析了吸引子类型和神经元层面的防御机制。