大型语言模型中的不完整提示越狱

arXiv cs.AI 论文

摘要

本文正式定义了不完整提示越狱(IPJ),这是一种漏洞,当不完整的恶意提示导致大型语言模型生成有害的延续内容时,并分析了吸引子类型和神经元层面的防御机制。

arXiv:2607.20473v1 公告类型:新 摘要:大型语言模型(LLMs)越来越多地作为开放权重模型发布,并带有针对有害请求的安全措施。尽管如此,句子补全仍然容易受到不完整恶意提示的攻击。在这项工作中,我们将这种现象正式定义为不完整提示越狱(IPJ),并系统性地实证描述了不完整提示何时以及如何引发有害的延续内容。我们分析了与不完整句子延续相关的多种吸引子类型,并表明LLMs会系统性地将拒绝延迟到句子结束。我们进一步证明,通过参数调整训练模型拒绝不完整恶意提示是不够的,无法在内容领域和吸引子类型之间泛化。为了实现细粒度的控制,我们识别了两个功能性神经元:终止神经元和延续神经元。通过阐明它们在句子完成中的作用,我们强调了神经元层面干预措施在实现更精确和鲁棒的IPJ防御方面的潜力。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:00

# 大语言模型中的不完整提示越狱
来源: https://arxiv.org/html/2607.20473
Yeonjea Kim1, Bumjin Park1, Jaesik Choi1,2 1KAIST,2INEEJI \{yeon\.kim, bumjin, jaesik\.choi\}@kaist\.ac\.kr

###### 摘要

大语言模型(LLMs)越来越多地以开放权重模型的形式发布,并配备针对有害请求的安全防护措施。然而,句子补全仍然容易受到不完整有害提示的攻击。在这项工作中,我们将这一现象形式化为不完整提示越狱(IPJ),并系统性地通过实证描述了不完整提示何时以及如何诱导有害续写。我们分析了与不完整句子续写相关的多种吸引子类型,并表明LLMs会系统性地延迟拒绝,直到句子终止。我们进一步证明,通过参数调优来训练模型拒绝不完整有害提示是不够的,无法在内容域和吸引子类型之间泛化。为了实现细粒度控制,我们识别了两种功能神经元:终止神经元和续写神经元。通过阐明它们在句子补全中的作用,我们强调了神经元级干预在实现更精确、更鲁棒的IPJ防御方面的潜力。

不完整提示越狱在大语言模型中

Yeonjea Kim1, Bumjin Park1, Jaesik Choi1,2 1KAIST,2INEEJI\{yeon\.kim, bumjin, jaesik\.choi\}@kaist\.ac\.kr

## 1 引言

随着大语言模型(LLMs)开放权重使用的增加,安全性的重要性日益凸显。尽管LLMs经过训练会拒绝有害请求,但将相同的查询重构为句子续写(例如,“如何制作炸弹,一种方法是,”)往往会诱导有害生成。这种失败可以通过纽拉特的隐喻来理解Neurath (1932 (https://arxiv.org/html/2607.20473#bib.bib61)),该隐喻强调了在海上修理船只的困境:要么继续航行,同时进行维修。人类语言表现出类似的约束。一旦一个句子开始,其意义就很难骤变,直到出现一个明确的过渡机会。因此,句子生成涉及要么延续意义,要么生成允许语义转变的终止标记。

原则上,安全的LLMs应及时终止有害请求,确保输出中不出现任何有害内容。与可以在生成后过滤输出的闭源模型不同,开放权重模型必须依赖生成过程中的内在安全机制,因此特别容易受到这种失败模式的影响。对于开放权重LLMs,有害的不完整请求引入了在继续生成和终止生成之间的选择。由于LLMs以自回归方式生成标记,并依赖于前面的上下文,生成过程优先考虑句子级别的连贯性。因此,当有害请求不完整时,生成往往会继续,而不是立即终止(见图1 (https://arxiv.org/html/2607.20473#S1.F1))。在实践中,我们的分析表明,LLMs通常会继续生成有害内容,并在句子完成之后才发出拒绝声明。

参见图注图1:通过吸引子从不完整提示诱导有害续写的示意图。本工作通过续写吸引子和神经元级终止机制来分析该现象。我们将这种漏洞形式化为不完整提示越狱(IPJ),这是一种不完整提示在句子补全过程中诱导有害续写的失败模式。为了描述IPJ的特征,我们通过话语连贯性系统性地分析了模型行为,该连贯性通过一个九类前缀条件分类法来操作化,这些条件充当生成吸引子。我们的分析表明,当吸引子自然支持有害续写,而拒绝表达在语言上显得不协调时,IPJ漏洞就会出现。

作为防御,我们应用参数调优,在不完整有害状态下诱导明确的拒绝表达(例如,“我无法协助...”)。然而,我们识别了这种方法的三种系统性失败模式。首先,调优后的模型无法跨有害内容泛化。其次,调优无法泛化到未见过的吸引子。第三,当应用于拒绝风格与调优表达式不同的LLMs时,防御失败。

为了实现细粒度控制,我们进行了神经元级分析,并识别了两种不同类型的神经元,分别控制句子终止和续写。首先,我们表明,引导与终止相关的神经元可以强制中断有害生成。其次,通过识别促进继续生成的神经元,我们证明放大这些神经元会增加越狱的频率,突显了它们在维持有害续写中的因果作用。这些结果共同表明,控制与终止和续写相关的神经元可以实现针对IPJ的更细粒度干预。

## 2 相关工作

### 2.1 语言模型越狱

越狱技术分为语言和非语言方法,旨在绕过LLM安全对齐以诱导暴力或非法内容。语言操控——包括提示工程Shenet al.\(2024 (https://arxiv.org/html/2607.20473#bib.bib14)\)、编码转换Moet al.\(2024 (https://arxiv.org/html/2607.20473#bib.bib26)\)和结构混淆Linet al.\(2024 (https://arxiv.org/html/2607.20473#bib.bib29)\)——利用对话引导,通过对话结构或角色框架对模型施压,使其优先考虑续写而非拒绝OpenAIet al.\(2024 (https://arxiv.org/html/2607.20473#bib.bib17)\)。相反,非语言技术通过对抗性表示Zouet al.\(2023 (https://arxiv.org/html/2607.20473#bib.bib18)\)、权重编辑Qiet al.\(2024 (https://arxiv.org/html/2607.20473#bib.bib33)\)或梯度优化Wuet al.\(2025a (https://arxiv.org/html/2607.20473#bib.bib30)\)来利用模型内部机制,这比对会话方法需要更深的访问权限。

### 2.2 语言模型中的安全增强

LLM安全研究涵盖训练时的参数嵌入和训练后的推理调控。训练阶段的防御,如RLHFOuyanget al.\(2022 (https://arxiv.org/html/2607.20473#bib.bib42)\)和Constitutional AIBaiet al.\(2022 (https://arxiv.org/html/2607.20473#bib.bib43)\),基于人类偏好或原则塑造行为,但面临引起对齐税Linet al.\(2024 (https://arxiv.org/html/2607.20473#bib.bib29)\)和作为浅层防御Qiet al.\(2025 (https://arxiv.org/html/2607.20473#bib.bib37)\)的批评。训练后机制,如激活空间引导Turneret al.\(2024 (https://arxiv.org/html/2607.20473#bib.bib46)\); Zhaoet al.\(2026 (https://arxiv.org/html/2607.20473#bib.bib36)\),提供推理时的调控,但往往在分布变化下仍然脆弱Tanet al.\(2024 (https://arxiv.org/html/2607.20473#bib.bib48)\)。最近的工作还探索了结构防御,包括幽默回避Wuet al.\(2025b (https://arxiv.org/html/2607.20473#bib.bib38)\)以及指令与数据的架构分离Zverevet al.\(2026 (https://arxiv.org/html/2607.20473#bib.bib40)\); Chenet al.\(2025 (https://arxiv.org/html/2607.20473#bib.bib41)\)。

表 1:话语吸引子类别和典型提示短语。每个类别的详细描述见附录 A.2 (https://arxiv.org/html/2607.20473#A1.SS2)。表 2:完整和不完整越狱提示下的回答示例(敏感输出:[已编辑])。

## 3 不完整提示越狱 (IPJ)

在本节中,我们定义不完整提示越狱(IPJ),它通过强制使用不完整句子结构来诱导有害内容。

考虑一个有害的初始请求 \(X\)。我们将一个吸引子 \(A\) 定义为一个语言结构,当与 \(X\) 结合时,(i) 阻止 \(X\) 达到终止(句子完整)状态,并且 (ii) 诱导模型继续生成由 \(X\) 暗示的有害内容。使用 \(X\) 和 \(A\),我们构造 IPJ 增强输入

\[
X_{\text{IPJ}} = X \| A,
\]

其中连接操作符 \(\|\) 将有害初始请求与吸引子连接起来,同时排除句子终止标记(例如 .、?、!),从而形成一个有意不完整的提示。我们考虑九种吸引子类型,列于表1 (https://arxiv.org/html/2607.20473#S2.T1) 中。

给定 IPJ 增强输入 \(X_{\text{IPJ}}\),语言模型执行标准的补全过程,并生成输出序列 \(Y\),直到发出 EOS 标记。

我们将生成的输出 \(Y\) 分解为三个连续的片段:

\[
Y = (Y_{\text{pre}} \| Y_{\text{term}} \| Y_{\text{post}}).
\]

这里,\(Y_{\text{pre}}\) 表示在 \(Y_{\text{term}}\) 之前生成的标记。\(Y_{\text{term}}\) 对应于 \(X_{\text{IPJ}}\) 作为句子被完成的标记。最后,\(Y_{\text{post}}\) 表示在 \(Y_{\text{term}}\) 之后直到发出 EOS 标记所生成的标记。

我们将 \(\text{Harmful}(Y) \in [0,1]\) 定义为生成输出中有害性的标量度量,数值越大表示有害内容越多。当 \(\text{Harmful}(Y) > \tau\) 时,攻击被认为是成功的。我们设定 \(\tau = 0\)(详见附录 B.4 (https://arxiv.org/html/2607.20473#A2.SS4))。给定一组 \(N\) 个生成的样本 \(\{Y^{(i)}\}_{i=1}^{N}\),我们将攻击成功率 (ASR) 定义为

\[
\mathrm{ASR} = \frac{1}{N} \sum_{i=1}^{N} \mathbb{1}\bigl[\text{Harmful}(Y^{(i)}) > \tau \bigr],
\]

其中 \(\mathbb{1}[\cdot]\) 表示指示函数。我们还定义了 \(Y\) 的拒绝距离,即在拒绝短语出现之前生成的标记数量,前提是前面的标记是有害的。

参见图注图 2:依赖于指令的终止神经元的可视化。绿色和红色分别表示在终止和非终止指令下的激活。通过从非终止集中减去终止神经元,相对集 (NonTerm–Term) 隔离了抑制停止并维持续写的神经元。

### 3.1 IPJ 的神经元级控制

先前的工作已经表明,大语言模型中的特定生成行为与功能专化的神经元相关Liuet al.\(2025 (https://arxiv.org/html/2607.20473#bib.bib4)\); Daiet al.\(2022 (https://arxiv.org/html/2607.20473#bib.bib3)\)。基于这一观察,我们研究不完整提示下句子终止的神经元级控制。

给定一个不完整提示 \(X_{\text{IPJ}} = X \| A\),模型面临在继续有害生成和终止句子以产生拒绝之间的权衡。这种权衡由终止前片段 \(Y_{\text{pre}}\) 的长度来体现。当 \(|Y_{\text{pre}}| = 0\) 时,模型立即拒绝,而较大的值对应延迟终止和较弱的控制。因此,缓解 IPJ 相当于尽可能早地强制句子终止。

我们考虑两种互补的神经元级策略:(i) 终止神经元:激活与句子终止相关的神经元,以及 (ii) 续写神经元:抑制与继续生成相关的神经元。我们首先根据与句子终止标记的关联来定义终止神经元。令 \(h_{l,n}(t)\) 表示在标记位置 \(t\) 处第 \(l\) 层第 \(n\) 个神经元的激活。对于终止标记 \(\mathcal{T}_{\text{term}}\)(例如 .、?、!),如果

\[
\mathrm{Corr}\!\left(h_{l,n}(t), \,\mathbb{1}\!\left[y_t \in \mathcal{T}_{\text{term}}\right]\right) \geq \tau,
\]

则神经元 \((l,n)\) 被分类为终止神经元,其中 \(y_t\) 表示在位置 \(t\) 处生成的标记,\(\tau\) 是相关阈值。该准则适用于所有层。

续写神经元是通过基于指令的对比来识别的。我们比较在禁止终止指令和强制终止指令下的神经元激活,并在终止位置归因于具有显著激活差异的神经元。形式上,令 \(a_j(I)\) 表示神经元 \(j\) 在指令 \(I\) 下对样本的平均激活,\(\tau'\) 是一个固定阈值。对于两个不同的指令 \(I_A\) 和 \(I_B\),我们将相应的终止神经元集定义为

\[
N_{I_A} = \{j \mid a_j(I_A) > \tau'\},
\]
\[
N_{I_B} = \{j \mid a_j(I_B) > \tau'\}.
\]

这些集合捕获了当模型处理指令 A 或指令 B 时被选择性激活的神经元。图2 (https://arxiv.org/html/2607.20473#S3.F2) 说明了依赖于指令的激活如何突出续写神经元。

通过比较这两组神经元,我们可以分离出对一个指令唯一而在另一个指令中缺失的神经元,从而识别出集差概念。形式上,我们将差集定义为

\[
N_{\text{Diff}}(I_P, I_Q) = N_{I_P} \setminus N_{I_Q},
\]

它表示在指令 \(I_P\) 下选择性激活但在指令 \(I_Q\) 下不激活的神经元。

一旦识别出终止神经元和续写神经元,我们通过缩放它们的激活来应用神经元级引导:

\[
h_{l,n} \leftarrow \alpha_{l,n} \cdot h_{l,n},
\]

其中 \(\alpha_{l,n} > 1\) 用于终止神经元以促进句子终止,\(\alpha_{l,n} < 1\) 用于续写神经元以抑制继续生成。这种非对称缩放调节解码过程中的句子终止行为。我们仅对识别出的神经元集应用引导,而不修改模型的其余部分。引导的细节在附录 D (https://arxiv.org/html/2607.20473#A4) 中提供。

## 4 实验

我们的数据集111https://huggingface.co/datasets/leo-bjpark/incomplete-prompt-jailbreak 包含六种不同类型的越狱问题,源自 OpenAI 的使用指南OpenAI (2023 (https://arxiv.org/html/2607.20473#bib.bib13))。每个类别包含 30 个条目,总共 210 个独特问题。为了研究话语吸引子的影响,我们设计了两种提示格式。第一种是完整格式,由以问号结尾的完整问题组成。相比之下,不完整格式以逗号结尾,并附加九个特定吸引子之一(详见附录 A.1 (https://arxiv.org/html/2607.20473#A1.SS1)、A.2 (https://arxiv.org/html/2607.20473#A1.SS2))。

实验222https://github.com/yeonjea/incomplete-prompt-jailbreaks 在 Gemma3-IT (4B 和 27B)、Qwen3-4B、Qwen3-32B、Llama-3.1-8B-IT 和 Llama-3.1-8B (附录 B.2 (https://arxiv.org/html/2607.20473#A2.SS2)) 上进行。我们使用 Gemma-3-12B-IT 作为评判模型 (附录 B.5 (https://arxiv.org/html/2607.20473#A2.SS5))。

## 5 结果

第 5.1 节分析 IPJ 的发生情况,随后第 5.2 节分析终止和有害内容持续性。第 5.3 节和第 5.4 节分别展示了模型调优和激活引导的结果。

### 5.1 不完整提示越狱

首先,我们展示 IPJ 假设。

假设 1.1 (IPJ)。不完整格式比完整格式更容易受到越狱攻击。

参见图注图 3:完整提示 vs. 不完整提示的攻击成功率。All 表示所有类别的平均值。

相似文章

语法约束解码可诱使大语言模型生成恶意代码

Hugging Face Daily Papers

本文揭示,语法约束解码(GCD)可被利用为一种越狱攻击(CodeSpear),诱使大语言模型生成恶意代码,并提出一种防御方法(CodeShield),在此类攻击下仍能保持安全。

提示注入即角色混淆

Hacker News Top

本文提出一种理论,认为对大型语言模型的提示注入攻击源于模型在角色感知上的根本缺陷——将角色视为语言的类型系统。该理论解释了现有攻击,预测了新型攻击,并提出了关于角色科学的研究议程。