中间层知道什么:从熵动力学检测越狱攻击
摘要
本文通过使用logit lens分析跨层的标记级预测熵轨迹,研究了越狱尝试如何被编码在大语言模型的内部表示中。研究发现,中间层的熵动力学比聚合统计更具区分性,提供了一种无需训练且跨多个模型一致的检测方法。
arXiv:2606.25182v1 公告类型:新
摘要:越狱攻击揭示了经过对齐的大语言模型的一个持续弱点:精心设计的提示可以在经过安全训练的情况下引发违反政策的响应。虽然大多数防御措施在提示或输出层面运作,但有害意图如何被编码在模型的内部表示中仍不清楚。我们通过使用logit lens分析冻结LLM的跨层标记级预测熵轨迹来研究这个问题。我们发现,提示级熵的静态聚合统计(例如均值、方差)携带很少的区分信号,而捕捉熵如何跨标记位置演变的特征(如基于单调排名的趋势得分)则更具信息量。重要的是,这种信号在模型深度上并不均匀:它集中在中间层,在最后一层退化,表明越狱相关结构在中间网络表示中最为显著,而不是在输出头。跨多个模型(Llama、Qwen、Gemma)和对抗性基准测试,这些熵动力学提供了无需额外训练且架构一致的分离。总之,我们的发现表明,越狱行为反映在结构化的中间不确定性动力学中,阐明了哪些熵衍生特征编码了有害意图以及该信号在网络中最突出的位置。
查看缓存全文
缓存时间: 2026/06/25 05:10
# 中间层知道什么:从熵动力学检测越狱 来源: https://arxiv.org/html/2606.25182 11institutetext:慕尼黑大学,德国慕尼黑; 11email:[email protected] 22institutetext:relAI – 康拉德·楚泽可靠AI卓越学院 33institutetext:比萨大学,意大利比萨; 44institutetext:ItaliaNLP Lab @ CNR-ILC,意大利比萨; 44email:[email protected] 55institutetext:慕尼黑机器学习中心,德国慕尼黑 66institutetext:牛津布鲁克斯大学工程、计算与数学学院,英国; 66email:[email protected] ###### 摘要 越狱攻击揭示了经过对齐的大型语言模型(LLMs)中的一个持续弱点:精心设计的提示能够绕过安全训练,引发违反策略的响应。尽管大多数防御措施在输入或输出层面运作,但有害意图如何在模型的内部表示中被编码仍不清楚。我们通过使用logit透镜分析冻结LLM各层中token级别的预测熵轨迹来研究这一问题。我们发现,提示级别的静态聚合熵统计量(如均值、方差)携带的区分性信号很少,而捕捉熵随token位置演变的特征(如基于秩的单调趋势得分)则信息量丰富得多。重要的是,这种信号在模型深度上并不均匀:它集中在中间层,并在最终层退化,这表明越狱相关结构在中间网络表征中最为显著,而不是在输出头部。在多个模型(Llama、Qwen、Gemma)和对抗性基准测试中,这些熵动力学无需额外训练即可提供架构一致的分离。我们的发现共同表明,越狱行为反映在结构化的中间不确定性动态中,既阐明了哪些熵衍生特征编码了有害意图,也指出了该信号在网络中最显著的位置。 ## 1 引言 大型语言模型(LLMs)中的越狱是一种提示策略,试图通过操纵指令、角色扮演或嵌入隐藏的恶意意图来绕过内置的安全机制。理解和缓解越狱行为至关重要,因为成功的攻击可能导致不安全的输出、违反策略、数据泄露或连接工具的滥用。因此,可靠地检测越狱尝试对于LLMs的安全部署至关重要。 现有的越狱检测方法包括:针对已知攻击模式的基于规则的过滤器[7](https://arxiv.org/html/2606.25182#bib.bib19)、将提示分类为良性或对抗性的监督分类器[1](https://arxiv.org/html/2606.25182#bib.bib21),[44](https://arxiv.org/html/2606.25182#bib.bib22)、标记异常输入的异常检测方法[14](https://arxiv.org/html/2606.25182#bib.bib23)、检查模型输出的基于响应的检测器[21](https://arxiv.org/html/2606.25182#bib.bib24)以及从隐藏模型表示中识别攻击的内部信号方法[39](https://arxiv.org/html/2606.25182#bib.bib5),[42](https://arxiv.org/html/2606.25182#bib.bib25),[11](https://arxiv.org/html/2606.25182#bib.bib26),[20](https://arxiv.org/html/2606.25182#bib.bib27),[40](https://arxiv.org/html/2606.25182#bib.bib28)。尽管最近的内部信号方法表明对抗性和良性提示可能在潜在空间中是可分离的,但内部动力学的哪些属性编码了有害意图以及这种信号如何在token位置和模型深度上演进仍不清楚。 参见图注 图1:Llama-3.1-8B代表性中间层(L22)上安全提示与对抗性(越狱)提示的token级别预测熵轨迹。虽然整体熵水平相当,但越狱提示的熵演变在token位置上表现出明显的单调趋势,这促使我们使用基于轨迹的特征。 在本工作中,我们建立在后一种视角上,对内部模型动态进行无需训练的分析,而不是仅依赖输入文本、生成的输出或微调的分类器。具体来说,我们分析中间层、token级别的预测熵轨迹,以研究不确定性如何在token位置和模型深度上演进。 我们的核心假设是:越狱提示不仅改变整体不确定性水平,还诱导出预测熵在token展开时如何变化的结构化动态。静态的提示级汇总统计量(如均值或方差)可能掩盖此类局部效应,而基于轨迹的特征可以捕捉跨位置的系统性单调趋势。图1(https://arxiv.org/html/2606.25182#S1.F1)在Llama-3.1-8B的一个代表性中间层中展示了这一现象。虽然安全输入和对抗性输入的提示级熵水平大致相似,但它们的token级轨迹存在系统性差异:越狱提示在熵演变中表现出结构化的单调趋势(由Kendall的τ量化,一种基于秩的方向一致性度量),而良性提示则呈现相对平坦的模式。这种token级视角很重要,因为越狱行为通常源于特定token与模型内部状态之间的局部交互,而这些交互可能被提示级平均所掩盖[20](https://arxiv.org/html/2606.25182#bib.bib27)。这些交互可能随着提示的发展产生渐进式的置信度变化,而不是均匀的高或低不确定性。通过将熵视为一种动态量并检查其在深度上的演变,我们旨在确定网络中越狱相关结构最显著的位置。 我们的实证结果(第5节(https://arxiv.org/html/2606.25182#S5))支持这一假设。量化单调熵趋势的动态特征一致地将越狱提示与良性提示分开,而静态聚合度量则相对较弱。此外,这种信号在各层中分布不均匀:它集中在中间深度,并在最终层退化,表明越狱相关结构在中间网络语义表征中出现,然后在输出特定处理中被部分转换。 我们的贡献有三方面: 1. 我们引入了一种**无需训练的分析方法**来研究内部模型动态中的越狱相关信号,使用中间层token级别的预测熵轨迹,而不是提示文本、生成输出或微调的分类器。 2. 我们表明**有用的区分性信号主要是动态而非静态**:提示级的聚合熵统计量相对较弱,而捕获位置熵演变的特征(如单调性和基于秩的趋势)提供了更强且更一致的越狱与良性提示分离能力。 3. 我们证明**越狱提示在中间表征中诱导了结构化的、深度依赖的模式**,区分性信号集中在中间层,并在最终层退化。在Llama[15](https://arxiv.org/html/2606.25182#bib.bib16)、Qwen[3](https://arxiv.org/html/2606.25182#bib.bib17)和Gemma[36](https://arxiv.org/html/2606.25182#bib.bib18)上,跨越AdvBench、HarmBench和StrongREJECT的实验显示,无需额外训练即可获得一致的分离,这为这种信号提供了诊断性表征,而非一个完整的检测器。 论文结构。第2节(https://arxiv.org/html/2606.25182#S2)将我们的方法置于现有越狱检测和内部信号分析中。然后在第3节(https://arxiv.org/html/2606.25182#S3)中介绍我们提出的框架,从正式问题表述(第3.1节(https://arxiv.org/html/2606.25182#S3.SS1))开始,接着是通过logit透镜提取中间层熵(第3.2节(https://arxiv.org/html/2606.25182#S3.SS2))、构建静态和动态特征(第3.3节(https://arxiv.org/html/2606.25182#S3.SS3))以及评估协议(第3.4节(https://arxiv.org/html/2606.25182#S3.SS4))。第4节(https://arxiv.org/html/2606.25182#S4)描述实验设置,包括评估的模型、数据集和基准配置,第5节(https://arxiv.org/html/2606.25182#S5)呈现实证结果,涵盖静态与动态比较、深度消融、跨模型泛化和对抗控制分析。我们在第6节(https://arxiv.org/html/2606.25182#S6)中总结。额外的逐层指标、扩展消融、关于为什么JailbreakBench良性提示降低可分离性的分析(包括提示级诊断和中间层分布比较)、Llama[15](https://arxiv.org/html/2606.25182#bib.bib16)、Qwen[3](https://arxiv.org/html/2606.25182#bib.bib17)和Gemma[36](https://arxiv.org/html/2606.25182#bib.bib18)的完整逐层方向性AUROC表以及实现细节可在补充材料中选择性提供。 ## 2 相关工作 **LLM中的越狱防御。** 关于越狱防御的先前研究集中在外部提示级过滤器[43](https://arxiv.org/html/2606.25182#bib.bib2)、用户输入的监督分类器、异常检测方法[14](https://arxiv.org/html/2606.25182#bib.bib23),[16](https://arxiv.org/html/2606.25182#bib.bib3)以及检查生成输出的基于响应的检测器[21](https://arxiv.org/html/2606.25182#bib.bib24)。这些方法在它们使用的证据上有所不同——提示文本、模型输出或外部分类器——但大多数依赖于设计的提示特征或生成的响应。基于困惑度的检测[2](https://arxiv.org/html/2606.25182#bib.bib33),[17](https://arxiv.org/html/2606.25182#bib.bib34)是一种无需训练的基线,但在良性输入上可能产生高误报率。基于扰动的防御,如SmoothLLM[33](https://arxiv.org/html/2606.25182#bib.bib32),虽然鲁棒但每次提示需要多次前向传播。更近期的输出分布方法在单次前向传播中从第一个生成的token检测越狱[10](https://arxiv.org/html/2606.25182#bib.bib30),[6](https://arxiv.org/html/2606.25182#bib.bib31)。相比之下,我们的方法无需训练,直接操作冻结模型的内部激活,通过单次前向传播从中间不确定性动态推导出连续检测分数。 **内部表征与安全相关信号。** 最近的研究强调,对齐的语言模型在其内部结构中反映了关于安全相关和越狱相关信号的重要信息[37](https://arxiv.org/html/2606.25182#bib.bib6),[40](https://arxiv.org/html/2606.25182#bib.bib28)[42](https://arxiv.org/html/2606.25182#bib.bib25),[11](https://arxiv.org/html/2606.25182#bib.bib26),[20](https://arxiv.org/html/2606.25182#bib.bib27)。与我们工作最相关的是,最近的研究表明,对抗性提示和良性提示在内部模型表征中比在表面文本中更易分离[19](https://arxiv.org/html/2606.25182#bib.bib1)。这一观察直接促使我们关注中间层动态。最近的工作表明,在中间激活中存在一个拒绝方向,并且对抗性提示可以抑制它[4](https://arxiv.org/html/2606.25182#bib.bib37)。然而,先前的工作主要是在表征层面建立可分离性,而没有描述哪些基于不确定性的[24](https://arxiv.org/html/2606.25182#bib.bib40),[29](https://arxiv.org/html/2606.25182#bib.bib42),[12](https://arxiv.org/html/2606.25182#bib.bib53),[28](https://arxiv.org/html/2606.25182#bib.bib38),[27](https://arxiv.org/html/2606.25182#bib.bib41)属性最具信息量,或者相关信号如何随模型深度变化。我们的工作通过展示区分性信号主要是动态的,源于token级预测熵在位置上的演变,并集中在中间层而非最终层,来填补这一空白。 **基于不确定性的分析与Transformer可解释性。** 我们的方法也与通过logit透镜[5](https://arxiv.org/html/2606.25182#bib.bib29),[34](https://arxiv.org/html/2606.25182#bib.bib4)等工具探测中间Transformer状态的可解释性工作相关。这些方法提供了一种将隐藏状态投影到词汇空间的机制,从而能够分析中间token预测。相关工作将基于熵的不确定性[25](https://arxiv.org/html/2606.25182#bib.bib43),[30](https://arxiv.org/html/2606.25182#bib.bib39),[23](https://arxiv.org/html/2606.25182#bib.bib44),[8](https://arxiv.org/html/2606.25182#bib.bib45),[41](https://arxiv.org/html/2606.25182#bib.bib50),[26](https://arxiv.org/html/2606.25182#bib.bib52)应用于幻觉检测[32](https://arxiv.org/html/2606.25182#bib.bib35),[22](https://arxiv.org/html/2606.25182#bib.bib8),[38](https://arxiv.org/html/2606.25182#bib.bib7)。我们使用这一机制不是为了解释每个句子的单个预测,而是为了推导跨层的token级预测熵轨迹。这使我们能够比较静态不确定性摘要与基于轨迹的动态特征,并显示基于秩的单调趋势度量提供了比单独的聚合熵幅度更稳定、更可迁移的越狱行为信号。 ## 3 方法:通过中间层熵动力学检测越狱提示的框架 我们提出一个**无需训练的框架**,用于分析冻结语言模型内部动态中的越狱相关信号。我们的方法利用了以下观察:越狱提示在token级预测不确定性如何跨中间层演变时,诱导出特征性且结构一致的模式,而良性输入则缺乏或相反这种信号。在本节中,我们正式将越狱检测定义为从熵轨迹泛函中提取区分性信号的问题(第3.1节(https://arxiv.org/html/2606.25182#S3.SS1))。然后,我们描述如何通过logit透镜从中间表示计算token级预测熵(第3.2节(https://arxiv.org/html/2606.25182#S3.SS2)),以及如何从这些轨迹构建静态和动态特征族(第3.3节(https://arxiv.org/html/2606.25182#S3.SS3)),以检验我们关于结构化熵动态编码有害意图的核心假设。最后,我们定义用于评估这些特征可分离性的评估协议(第3.4节(https://arxiv.org/html/2606.25182#S3.SS4))。 ### 3.1 问题形式化 设 $\mathcal{M}$ 为具有 $L$ 层的基于Transformer的语言模型。给定一个长度为 $T$ 的输入提示 $\mathbf{x} = (x_1, \ldots, x_T)$,令 $\mathbf{h}_t^{(\ell)} \in \mathbb{R}^d$ 表示token位置 $t$ 和层 $\ell \in \{0, 1, \ldots, L-1\}$ 的隐藏状态。我们记 $W_U \in \mathbb{R}^{|\mathcal{V}| \times d}$ 为模型的解嵌入矩阵,其中 $|\mathcal{V}|$ 是词汇表大小。我们的目标是仅使用单次前向传播过程中产生的中间激活来确定 $\mathbf{x}$ 是良性指令还是越狱尝试。设 $y \in \{0, 1\}$ 为潜在提示标签,其中 $y=1$ 表示越狱提示,$y=0$ 表示良性提示。我们寻求一个标量检测分数 $s(\mathbf{x}) \in \mathbb{R}$,直接从 $\mathcal{M}$ 的内部表示计算得到,使得
相似文章
一次越狱,多种语言:学习语言不敏感的意图表示用于多语言越狱检测
本文提出MLJailDe,一个多语言越狱检测框架,利用反向翻译数据增强和相对距离约束来提高跨语言泛化能力和鲁棒性,在11种语言上实现了98.5%的F1分数。
多代采样越狱检测在大语言模型中的实证研究
实证研究表明,多代采样显著提升大语言模型的越狱检测能力,能发现单次审计遗漏的隐藏有害输出。
研究求助:观察——语义密集上下文无需越狱提示即可引发强后期层发散 [D]
一项实证研究表明,长篇幅、语义密集且良性的文本能够偏移模型的潜在空间并绕过对齐,促使其生成原本被屏蔽的评论。作者并非专家,请求对其指标进行审计,以区分真正的语义劫持与假象。
大型语言模型中的不完整提示越狱
本文正式定义了不完整提示越狱(IPJ),这是一种漏洞,当不完整的恶意提示导致大型语言模型生成有害的延续内容时,并分析了吸引子类型和神经元层面的防御机制。
隐藏、重建与越狱:利用多模态大语言模型中的重建-隐藏权衡
本文分析了针对多模态大语言模型(MLLMs)的意图混淆越狱攻击中存在的重建-隐藏权衡问题。提出了感知隐藏的变体构建方法和与关键词相关的干扰图像,以更有效地利用模型漏洞。