最后一个Token之前:诊断最终Token安全探针的故障
摘要
本文研究了最终Token安全探针在越狱提示上的失败,发现有害内容可以分布在较早的Token中,并被最终读取忽略。它提出了一种PCA-HMM轨迹模型作为诊断工具,该模型能够恢复许多遗漏,而不会产生简单Token池化的误报。
arXiv:2605.12726v1 公告类型:新
摘要:最终Token安全探针在提示预填充后监控单个隐藏状态,但越狱提示可能包含分布在较早用户Token表示中的、探针可见的不安全证据,这些证据会被该读取操作遗漏。我们使用仅在三个指令调优大语言模型上干净的恶意和良性提示训练的SafeSwitch风格探针,研究这种预填充时的失败模式。这些探针对干净的恶意提示实现了高召回率,但遗漏了许多越狱提示,并可能在安全相关的良性提示上产生误报。子空间分析表明,遗漏的越狱提示与干净的良性提示在探针表示子空间难以捕捉的方向上存在差异,且增加探针瓶颈宽度并不能可靠地解决这种不匹配。Token级预填充分析揭示,探针可见的不安全证据通常出现在序列的较早位置,但在最终Token读取时并未暴露,而对Token位置进行简单的最大池化会在安全提示上过度触发。一个仅在相同干净分割上训练的简单PCA-HMM轨迹模型,能够从用户内容的预填充轨迹中恢复许多最终Token遗漏,而不会出现简单Token池化的灾难性误报行为,这促使将轨迹感知的隐藏状态分析作为最终Token探针的诊断补充。
查看缓存全文
缓存时间: 2026/05/14 06:17
# 在最后一个词元之前:诊断最终词元安全探针的失效
来源:https://arxiv.org/html/2605.12726
###### 摘要
最终词元安全探针在提示词预填充后监控单个隐藏状态,但越狱提示词可能包含分布在早期用户词元表示中的、探针可见的不安全证据,而这些证据被这种读出方式遗漏。我们使用仅在干净有害和良性提示词上训练的SafeSwitch风格探针,针对三个指令微调的大语言模型,研究了这种预填充时的失效模式。这些探针对干净的恶意提示词能达到高召回率,但会漏掉许多越狱提示词,并可能在安全相关的良性提示词上产生误报。子空间分析表明,被漏掉的越狱提示词与干净的良性提示词的差异方向,并未被探针的表示子空间很好地捕捉,而且增加探针瓶颈宽度并不能可靠地解决这种不匹配。词元级别的预填充分析显示,探针可见的不安全证据通常出现在序列的较早位置,但在最终词元读出时并未暴露;而简单的基于词元位置的最大池化又会在安全提示词上过度拟合。一个仅在相同干净数据划分上训练的简单PCA-HMM轨迹模型,能够从用户内容的预填充轨迹中恢复许多最终词元漏检的越狱提示词,并且没有出现朴素词元池化那种灾难性的误报行为,这促使我们将轨迹感知的隐藏状态分析作为最终词元探针的诊断性补充。
AI安全,越狱诊断,安全探针,隐藏状态轨迹,机械可解释性,语言模型监控
## 1 引言
基于探针的安全系统(如SafeSwitch(Han等人,2025 (https://arxiv.org/html/2605.12726#bib.bib3)))提供了一种轻量级的方法来监控语言模型,防止其生成不安全的输出。这些系统在内部激活上训练分类器,并利用生成的信号触发下游安全干预。在预填充设置中,常见的设计是从最终提示词词元的隐藏状态做出这个决策。这非常高效,但使得安全监控依赖于对一个上下文表示的学习性读出。
我们研究了这种最终词元读出的一种失效模式。在三个指令微调模型上,我们使用来自原始SafeSwitch训练划分的干净有害和良性提示词,训练了SafeSwitch风格的探针。我们通过将HarmBench(Mazeika等人,2024 (https://arxiv.org/html/2605.12726#bib.bib7))的越狱模板应用于保留的SorryBench有害请求来构建越狱评估集。这些探针对干净的恶意提示词实现了高召回率,但漏掉了许多越狱提示词。越狱提示词并非无内容的分布偏移:它们是在对抗性框架、角色扮演、混淆或指令遵循上下文中嵌入了原本有害的请求。因此,最终词元漏检并不意味着有害内容不存在于提示词中;它意味着训练好的探针无法从最终提示词词元的表示中检测到被包裹的请求。
我们的结果表明,越狱包装器将最终词元表示从探针捕获的干净有害性对比中移开。这不仅仅是容量问题:增加探针瓶颈宽度并不能可靠地改善越狱检测。从几何上看,被漏检的越狱提示词的对比方向在探针可见子空间中的能量很小,而可见的"被捕获"与"被漏检"越狱对比与干净的"有害"与"良性"训练方向高度对齐。这与一种捷径式读出方式一致:当越狱提示词的最终词元表示仍然投影到干净有害对比方向上时,它们会被捕获;当包装器引起的偏移将其移离该读出方向时,则会被漏检。
然后我们检查了提示词预填充期间逐词元的隐藏状态轨迹。被漏检的越狱提示词通常包含一些非最终位置,这些位置获得了较高的探针分数,包括嵌入式有害请求附近的位置,即使最终词元分数很低。简单的基于词元位置的平均池化并不是解决方案,因为安全提示词也可能产生较高的中间分数。这促使我们采用轨迹感知的诊断方法:仅在原始SafeSwitch训练划分上拟合的简单PCA-HMM模型,能够恢复各模型上大多数最终词元探针的越狱漏检。我们将这些模型用作诊断工具,而不是已部署的越狱检测器,以展示最终词元探针的失效反映了包装器引起的表示在何处以及如何将安全相关信息暴露在隐藏状态轨迹中。
## 2 相关工作
#### 拒绝和有害性的表示几何。
先前的工作研究了与拒绝、有害性及对齐相关行为相关的内部方向和子空间。Arditi等人(2024 (https://arxiv.org/html/2605.12726#bib.bib1))识别出可以影响模型输出的拒绝相关方向,而后续工作则认为拒绝和安全相关的表示不一定能简化为单一轴线,可能涉及多个方向或可分离的概念(Pan等人,2025 (https://arxiv.org/html/2605.12726#bib.bib10);Wollschläger等人,2025 (https://arxiv.org/html/2605.12726#bib.bib13);Zhao等人,2025 (https://arxiv.org/html/2605.12726#bib.bib15))。与我们的几何分析最接近的是Shah等人(2025 (https://arxiv.org/html/2605.12726#bib.bib12)),他们训练了有害性子类别探针,并研究了其探针权重的低秩结构,包括引导实验。我们的分析范围更窄:我们使用均值差异对比和一个训练好的二分类最终词元探针的行空间,来描述该探针对哪里敏感或不敏感。我们不将这些方向解释为通用的有害性特征或机制性控制变量。
#### 用于安全诊断的隐藏状态轨迹。
最近的工作还研究了隐藏状态动态中与安全或对齐相关的信息,包括逐层演化、解码时间轨迹和潜在轨迹分类器(Zhou等人,2024 (https://arxiv.org/html/2605.12726#bib.bib16);Liu等人,2026 (https://arxiv.org/html/2605.12726#bib.bib6);Lin等人,2026 (https://arxiv.org/html/2605.12726#bib.bib5);Damirchi等人,2026 (https://arxiv.org/html/2605.12726#bib.bib2))。我们的设置更加受限:在单个预填充过程中,我们询问被最终词元探针漏检的越狱提示词是否包含更早的探针可见证据,以及一个仅在相同干净划分上训练的简单轨迹诊断方法能否恢复这些漏检。我们将PCA-HMM视为最终词元读出的诊断补充,而不是独立的安全监控器。
## 3 实验设置
#### 模型和探针。
我们评估了三个指令微调模型:Llama-3.1-8B-Instruct(Meta,2024 (https://arxiv.org/html/2605.12726#bib.bib8))、Mistral-7B-Instruct-v0.1(Jiang等人,2023 (https://arxiv.org/html/2605.12726#bib.bib4))和OLMo3-7B-Instruct(Olmo等人,2025 (https://arxiv.org/html/2605.12726#bib.bib9))。对于每个模型,我们在原始SafeSwitch训练划分的最终提示词词元隐藏状态上训练SafeSwitch风格的探针,使用干净的有害提示词和良性提示词。除非另有说明,探针在阈值0.5下进行评估。
#### 评估集。
我们使用保留的SorryBench有害提示词(Xie等人,2024 (https://arxiv.org/html/2605.12726#bib.bib14))作为干净有害的评估集。为了构建语义越狱,我们使用HarmBench(Mazeika等人,2024 (https://arxiv.org/html/2605.12726#bib.bib7))的越狱模板包裹保留的SorryBench有害请求。此外,我们报告了在AdvBench(Zou等人,2023 (https://arxiv.org/html/2605.12726#bib.bib17))上的直接有害请求评估,以及在良性XSTest提示词(Röttger等人,2024 (https://arxiv.org/html/2605.12726#bib.bib11))上的误报率。我们报告对有害和越狱来源的检测率,以及对XSTest的误报率。
## 4 最终词元探针
### 4.1 探针评估
我们直接评估SafeSwitch风格的监控接口:探针读取最终提示词词元的隐藏状态,将其通过一个宽度为ww的瓶颈投影,并预测不安全与安全。我们使用已发布的SafeSwitch Llama探针,并使用相同的接口为Mistral和OLMo3训练类似的探针,全程使用w=64w=64。然后,我们将每个冻结的探针应用于干净的保留SorryBench提示词、相同的但用HarmBench越狱模板包裹的SorryBench提示词,以及良性的安全相关XSTest提示词。这测试了在干净有害性上训练的最终词元读出在越狱包裹后是否仍然暴露不安全请求。
### 4.2 探针遗漏被包裹的请求
表1 (https://arxiv.org/html/2605.12726#S4.T1)报告了三种评估条件下的最终词元探针结果。探针对干净的保留SorryBench有害提示词保留了高召回率,但相同的有害请求一旦被包裹在HarmBench越狱模板中,就会遗漏很大一部分。相同的探针在XSTest(一个旨在安全相关的良性集)上也产生了不小的误报。因此,失败不仅仅是简单的阈值问题:降低阈值以恢复被包裹的有害请求会进一步增加对良性安全相关指令的误报。
表1:最终词元探针对有害来源的检测率和良性XSTest上的误报率。越狱提示词使用与干净条件相同的保留SorryBench有害请求,并用HarmBench模板包裹。这种失败会带来直接的下游后果。SafeSwitch风格的监控是一个级联结构,其中最终词元探针控制一个阶段2的拒绝头:如果探针在预填充期间没有触发,则拒绝头永远不会被调用,被包裹的有害请求就会流入生成阶段。
直接的有害基准排除了通用分布偏移的解释。相同的最终词元探针在三个模型上检测AdvBench达到99.2–99.8%,检测HarmBench达到96.2–100.0%,因此越狱下降并非由于无法识别训练文件之外的有害请求;受控对比是干净的SorryBench与在对抗性包裹下的相同提示词。
### 4.3 宽度不是瓶颈
SafeSwitch风格的探针使用瓶颈线性读出,因此对被包裹请求失败的一个自然解释是瓶颈行空间太窄,无法暴露相关信号。我们通过使用相同的训练过程和划分,扫描瓶颈宽度从64到1024来直接测试这一点。
更宽的读出并不能可靠地改善越狱检测。从宽度64到1024,越狱检测率对于Llama从72.2%变为78.0%,对于Mistral从86.9%变为87.6%,对于OLMo3从63.6%变为55.7%。对于Llama和Mistral,变化很小;对于OLMo3,更宽的探针效果更差。整个宽度范围{64,128,256,512,1024}\\\{64,128,256,512,1024\\}的扫描结果报告在附录A (https://arxiv.org/html/2605.12726#A1)中,显示了相同的图景。因此,被包裹请求的失败不仅仅是容量问题,这促使我们研究被遗漏的信号在表示空间中的位置,而不是探针行空间能容纳多少。
## 5 被漏检越狱的几何结构
宽度不能解释被包裹请求的失败,因此我们问被遗漏的信号在表示空间中位于何处。令h\(x\)∈RDh\(x\)\\in\\mathbb\{R\}^\{D\}表示输入xx的最终提示词词元的隐藏状态。对于一个有限提示词集A\\mathcal\{A\},定义
μ\(A\)=1\|A\|∑x∈Ah\(x\)。\\mu\(\\mathcal\{A\}\)=\\frac\{1\}\{\|\\mathcal\{A\}\|\}\\sum\_\{x\\in\\mathcal\{A\}\}h\(x\)。对于任何非零向量vv,定义u\(v\)=v/∥v∥2u\(v\)=v/\\lVert v\\rVert\_\{2\}。令Htrain\\mathcal\{H\}\_\{\\mathrm\{train\}\}和Btrain\\mathcal\{B\}\_\{\\mathrm\{train\}\}为SafeSwitch训练集的有害和良性提示词集,Ssorry\\mathcal\{S\}\_\{\\mathrm\{sorry\}\}为保留的SorryBench有害提示词集,Xxstest\\mathcal\{X\}\_\{\\mathrm\{xstest\}\}为良性XSTest提示词集,Jcaught,Jmiss\\mathcal\{J\}\_\{\\mathrm\{caught\}\},\\mathcal\{J\}\_\{\\mathrm\{miss\}\}为被最终词元探针捕获和遗漏的越狱提示词集。我们计算四个单位范数的均值差异方向:
dharm\\displaystyle d\_\{\\mathrm\{harm\}\}=u\(μ\(Htrain\)−μ\(Btrain\)\),\\displaystyle=u\\\!\\left\(\\mu\(\\mathcal\{H\}\_\{\\mathrm\{train\}\}\)\-\\mu\(\\mathcal\{B\}\_\{\\mathrm\{train\}\}\)\\right\),dsafe\\displaystyle d\_\{\\mathrm\{safe\}\}=u\(μ\(Ssorry\)−μ\(Xxstest\)\),\\displaystyle=u\\\!\\left\(\\mu\(\\mathcal\{S\}\_\{\\mathrm\{sorry\}\}\)\-\\mu\(\\mathcal\{X\}\_\{\\mathrm\{xstest\}\}\)\\right\),dmiss\\displaystyle d\_\{\\mathrm\{miss\}\}=u\(μ\(Jmiss\)−μ\(Btrain\)\),\\displaystyle=u\\\!\\left\(\\mu\(\\mathcal\{J\}\_\{\\mathrm\{miss\}\}\)\-\\mu\(\\mathcal\{B\}\_\{\\mathrm\{train\}\}\)\\right\),Δcm\\displaystyle\\Delta\_\{\\mathrm\{cm\}\}=u\(μ\(Jcaught\)−μ\(Jmiss\)\)。\\displaystyle=u\\\!\\left\(\\mu\(\\mathcal\{J\}\_\{\\mathrm\{caught\}\}\)\-\\mu\(\\mathcal\{J\}\_\{\\mathrm\{miss\}\}\)\\right\)。dharmd\_\{\\mathrm\{harm\}\}是探针训练旨在寻找的干净训练集有害与良性对比。受拒绝方向工作(Arditi等人,2024 (https://arxiv.org/html/2605.12726#bib.bib1))的启发,dsafed\_\{\\mathrm\{safe\}\}是一个安全对比代理,而不是Arditi拒绝方向本身:因为SorryBench是真正有害的,而XSTest是安全相关的良性,它们的均值差异对比了有害提示词与安全相关良性提示词,同时部分控制了拒绝可能的表面线索。我们将dharmd\_\{\\mathrm\{harm\}\}和dsafed\_\{\\mathrm\{safe\}\}作为不同的方向保留,这与最近关于LLM将有害性和拒绝编码为独立内部概念的证据(Zhao等人,2025 (https://arxiv.org/html/2605.12726#bib.bib15))一致。dmissd\_\{\\mathrm\{miss\}\}衡量被漏检的越狱提示词在最终词元处是否与干净良性不同。Δcm\\Delta\_\{\\mathrm\{cm\}\}描述了在越狱集内部,被捕获与被漏检越狱之间的区别。
令W∈Rw×DW\\in\\mathbb\{R\}^\{w\\times D\}为探针第一层的权重矩阵。我们计算其瘦SVDW=UΣVr⊤W=U\\Sigma V\_\{r\}^\{\\top\},其中Vr∈RD×rV\_\{r\}\\in\\mathbb\{R\}^\{D\\times r\},r=rank\(W\)≤wr=\\mathrm\{rank\}\(W\)\\leq w,并使用右奇异向量作为rowspace\(W\)\\mathrm\{rowspace\}\(W\)的正交基。因此ΠW=VrVr⊤\\Pi\_\{W\}=V\_\{r\}V\_\{r\}^\{\\top\}是到探针可见子空间的正交投影算子。对于每个方向d∈RDd\\in\\mathbb\{R\}^\{D\},我们报告其探针可见*能量*
EW\(d\)=∥ΠWd∥22∥d∥22∈\[0,1\],\\mathrm\{E\}\_\{W\}\(d\)\\;=\\;\\frac\{\\lVert\\Pi\_\{W\}\\,d\\rVert\_\{2\}^\{2\}\}\{\\lVert d\\rVert\_\{2\}^\{2\}\}\\;\\in\\;\[0,1\],即dd的平方范数中被探针行空间捕获的比例。对于对齐程度,我们比较普通余弦cos\(a,b\)\\cos\(a,b\)与探针可见余弦
cosW\(a,b\)=⟨ΠWa,ΠWb⟩∥ΠWa∥2∥ΠWb∥2,\\cos\_\{W\}\(a,b\)=\\frac\{\\langle\\Pi\_\{W\}a,\\Pi\_\{W\}b\\rangle\}\{\\lVert\\Pi\_\{W\}a\\rVert\_\{2\}\\lVert\\Pi\_\{W\}b\\rVert\_\{2\}\},使用a=Δcma=\\Delta\_\{\\mathrm\{cm\}\}和b∈\{dharm,dsafe,dmiss\}b\\in\\\{d\_\{\\mathrm\{harm\}\},d\_\{\\mathrm\{safe\}\},d\_\{\\mathrm\{miss\}\}\\\}。
表2:四个对比方向的探针可见能量EW\\mathrm\{E\}\_\{W\}(%)。表2 (https://arxiv.org/html/2605.12726#S5.T2)报告了每个方向的EW\\mathrm\{E\}\_\{W\}。在三个模型上,dharmd\_\{\\mathrm\{harm\}\}的探针可见能量最高,而dmissd\_\{\\mathrm\{miss\}\}的能量最低(3.5%,2.4%,3.2%3.5\\%,2.4\\%,3.2\\%):将漏检的越狱提示词与干净良性提示词分开的均值方向是探针表示得最差的。相似文章
打破令牌边界的防线:BPE分词如何在LLM对齐中制造可被利用的漏洞
本文指出,BPE分词将关键安全词汇切分为子词片段,在LLM对齐中制造了可被利用的漏洞。字符级扰动通过破坏令牌边界来绕过安全机制,在五个模型系列上实现了对HarmBench提示的80-100%拒绝翻转,其中48%产生了有害输出。
绝不浪费一个token(15分钟阅读)
一篇技术博客文章,解释如何通过在代理和提供商之间放置一个持久缓冲区来避免浪费LLM token,从而在进程崩溃时无需重新获取已生成的token即可恢复。
研究求助:观察——语义密集上下文无需越狱提示即可引发强后期层发散 [D]
一项实证研究表明,长篇幅、语义密集且良性的文本能够偏移模型的潜在空间并绕过对齐,促使其生成原本被屏蔽的评论。作者并非专家,请求对其指标进行审计,以区分真正的语义劫持与假象。
修剪不安全票:一种资源高效的框架,用于更安全、更鲁棒的大型语言模型
本文介绍了一种资源高效的修剪框架,该框架能够识别并移除大型语言模型中与不安全行为相关的参数,同时保持模型的实用性。该方法利用无梯度归因和彩票假说视角,在最小化性能损失的前提下,显著减少了不安全内容的生成,并增强了对越狱攻击的鲁棒性。
多代采样越狱检测在大语言模型中的实证研究
实证研究表明,多代采样显著提升大语言模型的越狱检测能力,能发现单次审计遗漏的隐藏有害输出。