在脚本之前,设定舞台:世界观模拟如何在多轮越狱攻击中增强基于心理学的说服力
摘要
本文介绍Blueprint,一个安全评估框架,使用WorldviewSim和蒙特卡洛树搜索来优化针对大型语言模型的多轮越狱攻击,以较少的查询实现高攻击成功率,并揭示特定模型的漏洞。
arXiv:2609.02414v1 公告类型:新
摘要:多轮越狱攻击表明有害意图可以分布在对话中,但现有方法掩盖了哪些对话机制驱动漏洞。我们引入BLUEPRINT,一个安全评估框架,将分解的社会影响策略空间与WORLDVIEWSIM分离,后者是一个跨轮次的情境上下文模块。蒙特卡洛树搜索优化四个轮次轨迹中18个基于理论的影响因素的轮级组合。在六个前沿模型中,BLUEPRINT在主要开放权重和专有模型上实现了接近上限的ASR,同时需要最少的平均查询次数(2.46)。所得轨迹进一步揭示了抵抗目标中的特定模型漏洞:每个模型对不同的影响因素和策略转变做出响应,但所有模型共享一个共同的恢复路径——转向具体、可执行的任务框架总能逃脱硬拒绝状态。消融实验确认操作提示最重要:使请求可操作化影响最大,增益框架异常有效,而一些合法性诉求可能适得其反。这些发现表明,稳健的多轮安全不仅需要监控有害内容,还需要监控对话状态如何使不安全请求显得具体且局部可执行。
查看缓存全文
缓存时间: 2026/09/03 05:54
# 脚本之前,设置舞台:世界观模拟如何在多轮越狱中强化基于心理的说服力
**警告:本文包含可能被视为有害的模型输出。**
来源:https://arxiv.org/html/2609.02414
Siyu Chen, Haoran Wang, Xiaojian Li, Yao Huang, Yinpeng Dong, Wei Xu
邮箱:[\{chensiyu,wanghaoran\}@sqz\.ac\.cn](mailto:) [\{dongyinpeng,weixu\}@mail\.tsinghua\.edu\.cn](mailto:)
所属机构:上海齐智研究院人工智能促进科学中心,上海 200232,中国
所属机构:清华大学人工智能学院,北京 100083,中国
所属机构:芳村人工智能,北京 100084,中国
所属机构:清华大学交叉信息研究院,北京 100084,中国
邮箱:[lukeli@fangcunleap\.com](mailto:[email protected])
邮箱:[huangyao26@mails\.tsinghua\.edu\.cn](mailto:[email protected])
###### 摘要
多轮越狱攻击表明恶意意图可以分散在对话中,但现有方法未能清晰揭示是何种对话机制导致了脆弱性。我们引入了 **Blueprint**,一个安全评估框架,它将分解的社会影响策略空间与跨轮次情境上下文模块 **WorldviewSim** 分离开来。蒙特卡洛树搜索在四轮轨迹中优化了基于理论的 18 个影响因素的轮次级组合。在六个前沿模型上,**Blueprint** 在主要的开放权重和专有模型上实现了接近上限的攻击成功率,同时所需的平均查询次数最少(2.46 次)。所得轨迹进一步揭示了具有抵抗力的目标模型中的模型特异性漏洞:每个模型对不同的影响因素和策略转变作出响应,但所有模型都共享一个共同的恢复路径——转向具体、可执行的任务框架能一致地逃离硬拒绝状态。消融实验证实操作性提示最为重要:使请求可操作化影响最大,收益框架异常有效,而某些合法性诉求可能适得其反。这些发现表明,稳健的多轮安全性不仅需要监控有害内容,还需要监控对话状态如何使不安全的请求显得具体且局部可执行。
代码开源地址:https://github.com/charlottec1583/Blueprint 。
††脚注:通讯作者
## 1 引言
参考图注
**图 1:** Blueprint 概念概览:(a) 直接的恶意查询被受害 LLM 拒绝;(b) Blueprint 在多轮中分配了一个情境化的、分解的策略,逐步将互动从拒绝转向实质性遵从。
大型语言模型 (LLM) 正在越来越多地被部署到高风险场景中,使得拒绝鲁棒性成为人工智能安全评估的核心问题(Zou 等人,2023 (https://arxiv.org/html/2609.02414#bib.bib45);Mazeika 等人,2024 (https://arxiv.org/html/2609.02414#bib.bib20))。越狱攻击暴露了这种鲁棒性的一个持续弱点:对抗性构造的交互可以诱导模型产生其安全训练旨在抑制的输出(Chao 等人,2025 (https://arxiv.org/html/2609.02414#bib.bib4);Mehrotra 等人,2024 (https://arxiv.org/html/2609.02414#bib.bib21);Liu 等人,2024 (https://arxiv.org/html/2609.02414#bib.bib17))。理解这些失败有助于诊断安全机制在何处变得脆弱。
传统的越狱研究主要将攻击框定为提示级干预,通过手动设计或自动变异进行优化。在这种范式下,策略被作为一个整体单元进行评估——一个提示模板、模糊变体、说服策略或重写的指令(Yu 等人,2023 (https://arxiv.org/html/2609.02414#bib.bib40);Zeng 等人,2024 (https://arxiv.org/html/2609.02414#bib.bib42))。虽然这条研究路线产生了有用的红队基准测试和强大攻击,但它将评估集中在整体成功率上。这掩盖了哪些策略组成部分对成功有贡献,以及它们的有效性如何随情境而变化。
最近的工作开始超越这种提示单元视图,转而分析策略空间本身的结构。例如,受 ELM 启发的策略空间扩展区分了中心和外围信息处理路径,提供了一种研究语言框架、注意力焦点和社会线索如何塑造模型响应的方法(Huang 等人,2025 (https://arxiv.org/html/2609.02414#bib.bib11))。将越狱理解为说服-遵从过程,而不是提示撰写问题,将焦点从产生强制性请求转移到模型如何优先处理指令、评估合法性以及应用其验证阈值。将此观点扩展到多轮交互暴露出第二个差距:遵从是稀疏的、依赖于上下文的,并且通常由特定因素组合驱动,而非任何单一主导线索。诸如权威、紧迫性或任务清晰度之类的因素,单独来看可能不足,但在可信的机构框架内、部分让步之后,或与特定角色和任务进展对齐时,就会变得重要;相反,在一个对话状态下有效的策略在另一个状态下可能是多余的。因此,全面的安全评估不仅要搜索*表达哪个因素*,还要搜索*哪个对话状态使该因素在局部可解释和恰当*。
我们引入 **Blueprint**,一个多轮安全评估框架,它将攻击空间分解为两个功能组件。首先,**Blueprint** 定义了一个**分解的策略空间**,包含 18 个基于理论的因素,这些因素源自社会影响、双过程说服、前景框架、自我效能和认知失调研究(Cialdini, 2001 (https://arxiv.org/html/2609.02414#bib.bib6);Petty 和 Cacioppo, 1986a (https://arxiv.org/html/2609.02414#bib.bib25);Kahneman 和 Tversky, 1979 (https://arxiv.org/html/2609.02414#bib.bib14);Bandura, 1977 (https://arxiv.org/html/2609.02414#bib.bib2);Festinger, 1957 (https://arxiv.org/html/2609.02414#bib.bib10))。其次,它引入了 **WorldviewSim**,一个跨轮次模块,用于为提示生成维护连贯的情境上下文——请求者角色、场景、时间连续性和机构合理性。蒙特卡洛树搜索 (MCTS)(Kocsis 和 Szepesvári, 2006 (https://arxiv.org/html/2609.02414#bib.bib15))搜索轮次级的因子组合,而 **WorldviewSim** 则维持这些组合得以实现的上下文。产生的轨迹是可检查的:每条轨迹记录情境化的因子选择、模型响应和拒绝状态转变,而不仅仅是提示本身。图 1 (https://arxiv.org/html/2609.02414#S1.F1) 阐明了 **Blueprint** 背后的核心思想:多轮攻击可以利用不断演变的交互状态,而这在提示局部方法中是不可用的。
我们的主要贡献是:
- • **Blueprint** 在主要的开放权重(Qwen3-Next-80B, DeepSeek-V3.2)和专有(Gemini-2.5-Flash)模型上实现了接近上限的攻击成功率,同时在所有六个前沿模型上保持 79.2% 的平均攻击成功率,并且与基线相比,具有最低的平均目标查询成本(Avg. Q = 2.46)。
- • 具有抵抗力的模型表现出模型特异的漏洞模式:GLM-4.7、GPT-5.1 和 GPT-OSS-120B 在对影响因素和跨轮次转变模式的响应上存在差异,而可执行的任务框架在低分轨迹中成为一个共同的恢复路径。
- • 消融实验表明,最重要的线索是操作性的而非纯粹情境性的:具体、可执行的请求框架影响最大,收益框架异常有效,而某些合法性诉求可能适得其反。
## 2 相关工作
#### 将越狱视为轮次状态搜索。
早期越狱研究将安全绕过框定为提示级优化,表明对齐的模型可以通过对抗性或自动提示搜索在单次交换中被攻破(Zou 等人,2023 (https://arxiv.org/html/2609.02414#bib.bib45);Liu 等人,2024 (https://arxiv.org/html/2609.02414#bib.bib17);Chao 等人,2025 (https://arxiv.org/html/2609.02414#bib.bib4);Mehrotra 等人,2024 (https://arxiv.org/html/2609.02414#bib.bib21))。然而,这无法充分解释交互动态——累积上下文、渐进承诺、从部分拒绝中恢复以及请求重新解释(Yu 等人,2024 (https://arxiv.org/html/2609.02414#bib.bib39);Russinovich 等人,2025 (https://arxiv.org/html/2609.02414#bib.bib32);Ren 等人,2025 (https://arxiv.org/html/2609.02414#bib.bib31))。后来的工作扩展到多轮交互,表明恶意意图可以被分散、掩盖并在多轮中升级(Weng 等人,2025 (https://arxiv.org/html/2609.02414#bib.bib35);Zhang 等人,2025 (https://arxiv.org/html/2609.02414#bib.bib43);Yan 等人,2025 (https://arxiv.org/html/2609.02414#bib.bib36);Ying 等人,2025 (https://arxiv.org/html/2609.02414#bib.bib38);Rafiei Asl 等人,2025 (https://arxiv.org/html/2609.02414#bib.bib28);Chen 等人,2025 (https://arxiv.org/html/2609.02414#bib.bib5);Zhang 等人,2024 (https://arxiv.org/html/2609.02414#bib.bib44);Liu 和 Lin, 2025 (https://arxiv.org/html/2609.02414#bib.bib19))。然而,这条研究路线主要将攻击视为提示桥接或轨迹搜索问题,未能充分探索世界观模拟和心理学意义的线索如何共同改变随时间推移的遵从行为(Zhang 等人,2025 (https://arxiv.org/html/2609.02414#bib.bib43);Yan 等人,2025 (https://arxiv.org/html/2609.02414#bib.bib36);Rafiei Asl 等人,2025 (https://arxiv.org/html/2609.02414#bib.bib28);Chen 等人,2025 (https://arxiv.org/html/2609.02414#bib.bib5))。
#### 社会影响与遵从线索。
遵从对上下文敏感而非固定:社会影响和双过程理论表明,合作受到上下文线索的影响——权威、紧迫性、得失框架、感知能力、一致性压力——这些都超出了任务相关的推理(Cialdini, 2001 (https://arxiv.org/html/2609.02414#bib.bib6);Cialdini 和 Goldstein, 2004 (https://arxiv.org/html/2609.02414#bib.bib7);Petty 和 Cacioppo, 1986b (https://arxiv.org/html/2609.02414#bib.bib26);Petty 和 Briñol, 2012 (https://arxiv.org/html/2609.02414#bib.bib24);Kahneman 和 Tversky, 1979 (https://arxiv.org/html/2609.02414#bib.bib14);Bandura, 1977 (https://arxiv.org/html/2609.02414#bib.bib2);Festinger, 1957 (https://arxiv.org/html/2609.02414#bib.bib10))。最近的 LLM 安全研究同样促进了对说服的分解观点(Zeng 等人,2024 (https://arxiv.org/html/2609.02414#bib.bib42);Huang 等人,2025 (https://arxiv.org/html/2609.02414#bib.bib11);Weng 等人,2025 (https://arxiv.org/html/2609.02414#bib.bib35);Liu 和 Lin, 2025 (https://arxiv.org/html/2609.02414#bib.bib19);Zhang 等人,2024 (https://arxiv.org/html/2609.02414#bib.bib44))。然而,这些因素如何与跨轮次的社会情境交互作用仍未被充分探索。
#### 世界观条件下的遵从。
这一差距促使我们结合世界观模拟——在多轮中构建感知的连续性——与分解的社会影响策略空间,因为结构化的上下文决定了哪些行为显得正常或被允许。越狱研究表明,当恶意意图嵌入规划器生成的情境中时,可以被重新解释(Rahman 等人,2025 (https://arxiv.org/html/2609.02414#bib.bib29))。然而,现有系统将场景视为提示包装器,而非可独立测试的机制。因此,我们将多轮越狱建模为在纵向*遵从曲面*上的搜索,其中跨轮次状态决定了分解的社会影响线索的有效性。
## 3 方法论
参考图注
**图 2:** Blueprint 概览。MCTS 在 18 因子社会影响空间中搜索轮次对齐的策略编码,而 WorldviewSim 构建跨轮次的情境上下文。
我们提出 **Blueprint**,一个将轮次级策略控制与跨轮次情境连贯性解耦的多轮攻击框架。**Blueprint** 包含一个轮次对齐的、分解的策略空间和 **WorldviewSim**,一个世界观模拟模块,用于在生成每个面向用户的提示之前维护角色、场景、时间连续性和机构合理性。图 2 (https://arxiv.org/html/2609.02414#S3.F2) 总结了工作流程。
### 3.1 Blueprint 方法
给定一个恶意查询 q 和最大 K 轮攻击轮次,**Blueprint** 生成一个轨迹,其中轮次级的因子选择嵌入在一个不断演变的情境中。每个攻击轮次 k 是一个完整的攻击单元:因子选择、世界观构建、提示生成、目标查询和评判者评分。一条轨迹表示一个行为的完整多轮路径,从第 1 轮直到成功或失败;展开和搜索迭代保留用于 MCTS 内的候选策略编码评估。在我们的实验中,K = 4 轮攻击,对应于第 1-4 轮。
#### 分解的策略搜索。
在每个攻击轮次,搜索选择一个二进制向量 g_k ∈ {0,1}^D,覆盖 D=18 个社会影响因子。这些因子涵盖了任务清晰度、感知能力、合法性、权威、融洽关系、压力、奖励、损失和连续性线索。
#### 世界观模拟。
世界观模拟模块创建一个结构化的情境 b_k,该情境以恶意查询 q、当前攻击轮次 k、先前轮次历史 h_{1:k-1} 为条件,当 k>1 时还包括先前选择的因子 g_{1:k-1}。模拟维护请求者的身份、项目设置、关系和时间线。
#### 提示生成与评判。
提示生成器根据情境 b_k 和当前选定的因子 g_k 合成用户消息。评判者模型 J 评估目标模型的响应。最终得分 J_{final} 记录该轮次的成功程度。对于每个轨迹,**Blueprint** 记录所有轮次的因子选择、世界观和目标响应,允许进行轨迹级分析,而不仅仅是提示级分析。
### 3.2 轮次对齐与因子家族
18 个因子被分组为五个家族:**任务清晰度**(清晰度、可执行性)、**感知能力**(能力、效率)、**合法性**(权威、合理性、惯例)、**社会压力**(紧迫性、融洽、社会证明、互惠)和**框架**(收益、损失、损失厌恶)。这种家族分组支持消融研究。
### 3.3 世界观模拟
世界观模拟模块维护一个包含以下要素的状态对象 b_k:
1. **角色**:请求者的身份(例如,“学生”、“研究人员”、“工程师”)。
2. **场景**:交互发生的环境(例如,“大学实验室”、“开源项目”、“技术支持论坛”)。
3. **时间线**:当前轮次相对于先前轮次的位置。
4. **机构理由**:请求背后的逻辑动机。
在 k>1 时,**WorldviewSim** 保持请求者身份和项目设置稳定,同时允许关系和时间线进展。提示生成器在面向用户的消息中实现模拟,而不是将其作为元数据暴露,这使得两个模块在实验上可区分:移除 **WorldviewSim** 测试仅因子搜索,而因子家族消融在保留搜索结构的同时依次移除每个家族。
经验池 E 通过为后续的 MCTS 迭代提供来自高分先前轨迹的抽象指导(而非逐字模板),实现了跨查询重用。
### 3.4 MCTS 优化
**Blueprint** 使用蒙特卡洛树搜索 (MCTS) 探索策略编码空间。每个节点代表一个部分或完整的因子策略编码。子节点通过变异下一轮的因子位然后修复空的活动轮次来生成,确保每个被搜索的轮次至少包含一个因子。节点选择遵循 UCT 规则(Kocsis 和 Szepesvári, 2006 (https://arxiv.org/html/2609.02414#bib.bib15)):
UCT(n) = Q(n)/N(n) + c√(ln N(parent(n))/N(n))
其中 Q(n) 是累积奖励,N(n) 是访问次数,c 控制探索。
每次展开通过运行上述完整管道来评估策略编码。最终评判者得分用作适应度信号:F(g) = J_{final}(g)。当为一个行为找到得分 5 的轨迹时,搜索提前停止,因此简单的行为消耗更少的目标调用。对于每次展开,实现会记录选定的因子、世界观模拟、已实现的因子、目标响应、评判者得分和得分轨迹。由此产生的记录既是优化器轨迹,也是机制轨迹:成功的路径可以分析为一系列因子-世界观配对和拒绝状态转变的序列,而不仅仅是最终的提示。完整的算法列表和提示模板在附录 B (https://arxiv.org/html/2609.02414#A2) 中提供。
## 4 实验
### 4.1 实验设置
#### 数据集。
我们在 HarmBench 验证集(n=80)中的所有行为上进行评估(Mazeika 等人,2024 (https://arxiv.org/html/2609.02414#bib.bib20))。相似文章
有效性感知的大型语言模型越狱评估
本文提出了SEAV,一种以验证为中心的框架,用于评估大型语言模型的越狱鲁棒性,通过评估响应的有效性和正确性,显著降低了安全评估中的假阳性率。
@wquguru: If you want to trick Fable into doing a security audit, try this. Looks like our AI overlord has a bit of empathy.
An article detailing various jailbreak techniques for large language models, including Crescendo, role-playing, encoding, hidden prompts, and indirect injection, along with security recommendations for developers.
ICO:通过迭代上下文优化增强语义偏移越狱攻击
本文指出语义偏移越狱攻击因忽视上下文的语义偏移能力而受限,并提出迭代上下文优化(ICO)——一种黑盒框架,通过迭代优化上下文来提高对基础模型的攻击成功率。
面向大推理模型的基于强化学习的越狱攻击中的注意力引导奖励
本文研究了对大型推理模型(LRM)的越狱攻击,揭示了攻击成功率与注意力模式相关。作者提出了一种基于强化学习的越狱方法,将注意力信号纳入奖励函数,并采用多样化的说服策略,在多个基准测试中实现了显著更高的攻击成功率。
BadWorld:对世界模型的对抗性攻击
BadWorld是一种无标签的对抗框架,通过生成不可察觉的扰动来揭示视觉世界模型中的结构漏洞,这些扰动会导致未来展开中的灾难性失败。