有害性传播动态:大型语言模型中对抗意图的逐层轨迹
摘要
该论文在大型语言模型中识别出有害性传播动态,并介绍了 Herald,一个轻量级的输入调节器,它利用跨层激活模式高效检测有害提示。
arXiv:2609.13534v1 公告类型:新
摘要:我们识别出 \textbf{有害性传播动态 (HPD)}:对于有害提示,最后一个token的隐藏状态在学到的有害方向上的投影随Transformer深度单调上升,而良性提示则保持平坦或振荡。这种跨层特征反映了有害意图作为一种 \emph{逐步解析的} 语义属性:表面形式早期出现,而语用意图后期巩固,使得 \emph{轨迹形状} 比任何单层快照更具信息性。此外,基于LDA的有害方向,每层学习,跨随机分割保持稳定(成对余弦相似度 $>0.97$),支持投影序列作为可复现的结构化信号。基于HPD,我们引入 \textbf{\herald{}}(\textbf{H}armful \textbf{E}ncoding \textbf{R}ecognition via \textbf{A}ctivation \textbf{L}ayer \textbf{D}ynamics)。这个轻量级的输入调节器从跨层投影序列中提取七维特征记录,包括斜率、曲率、单调性、起始层及相关统计量,并使用288参数的MLP进行分类。\herald{} 每层存储一个 $d$ 维方向(对于32层、$d{=}4096$ 的模型为 $262$\,KB),训练期间无需梯度计算,推理时仅增加 $2.6{\times}10^{-6}$ 预填充FLOPs。在八个提示有害性基准和四个模型家族上,\herald{} 在OLMo2-7B上实现了平均F1为 $89.3$,在对抗性越狱检测上超越所有测试的守护模型($98.4$ vs.\ $96.9$ F1),并在每个骨干网上优于先前基于潜变量的方法 $2.3$-$4.1$ 个F1点。每个实例的轨迹提供机器可读的审计记录,揭示有害性 \emph{何时} 和 \emph{如何} 出现,提供比单层方法更优的可解释性。
查看缓存全文
缓存时间: 2026/09/15 08:35
# 有害性传播动态:大型语言模型中对抗性意图的逐层轨迹 来源:https://arxiv.org/html/2609.13534 Noor Islam S. Mohammad 所属单位:伊斯坦布尔理工大学计算机科学系 通讯作者:[[email protected]](mailto:[email protected]) ###### 摘要 我们识别出**有害性传播动态(HPD)**:对于有害提示,最后一个token的隐藏状态在学到的有害方向上的投影值随Transformer深度增加而单调上升,而良性提示的投影值则保持平坦或呈振荡。这种跨层特征反映了有害意图是一种**逐步显现**的语义属性:表层形式早期出现,而语用意图在后期巩固,这使得**轨迹形状**比任何单层快照更具信息量。此外,基于LDA的有害方向是逐层学习的,在不同随机划分下保持稳定(成对余弦相似度 > 0.97),这支持了将投影序列作为可复现的结构化信号。 基于HPD,我们引入了**Herald**(基于激活层动态的有害编码识别)。该轻量级输入审核器从跨层投影序列中提取七维特征记录:斜率、曲率、单调性、起始层及相关统计量,并使用一个288参数的MLP进行分类。Herald为每层存储一个一维方向(对于32层、d=4096的模型,占用262KB),训练过程中无需梯度计算,推理时仅增加约2.6×10⁻⁶的prefill FLOPs。在八项提示有害性基准测试和四个模型家族中,Herald在OLMo2-7B上平均F1达到89.3,在对抗性越狱检测上超越所有已测试的守护模型(F1达98.4 vs 96.9),并在每个骨干网络上比先前基于潜在空间的方法高出2.3-4.1个F1点。逐实例轨迹提供了机器可读的审计记录,揭示有害性**何时**以及**如何**涌现,相比单层方法具有可解释性优势。 ###### 关键词 LLM安全,输入审核,机械可解释性,表征几何,越狱检测 ## 1 引言 大型语言模型的安全部署需要超越对齐微调的防御措施。即使是良好对齐的模型也容易受到对抗性和间接提示的影响(Perez et al., 2022; Greshake et al., 2023; Ganguli et al., 2022; Carlini et al., 2023),而且对齐可能以牺牲通用能力为代价(Askell et al., 2021)。输入审核在生成前筛选请求,是一种互补的安全保障,它可以阻止不安全的提示,同时避免对有害输入进行完整前向传播的全部开销。现有的审核方法占据两个极端。守护模型(Markov et al., 2023; Vidgen et al., 2023)准确但需要额外的大型模型开销(一个7B守护模型约14GB)。基于潜在空间的方法(Ryu et al., 2024; Li et al., 2025)轻量,但仅依赖**单层**的隐藏状态,丢弃了表征在深度上递进所携带的信息。 我们的出发点是:有害性是一个逐步显现的信号。先前关于Transformer表征几何的研究表明,不同语言属性在不同深度被编码:早期层编码句法,中间层编码语义,后期层编码与任务相关的语用(Jawahar et al., 2019; Tenney et al., 2019; Geva et al., 2021)。我们探究**有害性**是否遵循这一模式,特别是提示表征在所有层上投影到有害方向上的轨迹本身是否是一个具有区分性的信号。 **核心观察(HPD)**:将每层最后一个token的隐藏状态投影到逐层LDA有害方向上,会产生一个轨迹 {pₗ}ₗ₌₁ᴸ,该轨迹在有害提示和良性提示之间存在显著差异(第3节)。对于有害输入(特别是越狱提示),轨迹从早期层的近零值单调稳定上升到后期层的强正值。良性提示则保持平坦或振荡,没有系统性的方向性增长。我们称此为**有害性传播动态(HPD)**。 关键在于,HPD并**非**仅仅重述了众所周知的“后期层表征更具区分性”的事实。轨迹的**形状**包含超出最终值的信息:起始层、增长的单调性以及曲率各自独立地贡献了信息(第7.1节),且轨迹分类与仅使用终端值分类的差距,在对抗性越狱检测——最具实际重要性的检测目标——上最大。 **与表征工程的关系**:Zou et al. (2023c) 表明,激活空间中的线性方向可以引导和探测模型行为。HPD在另一个不同方向上扩展了这一见解:我们不是学习单一的探针或引导向量,而是追踪有害方向如何**跨层演化**,并将由此产生的轨迹视为分类的一等数据对象。这种跨层动态视角与固定深度的激活空间探测正交。 Herald通过四个步骤利用HPD: (i) 使用仅一次无梯度的前向传播在训练集上学习逐层LDA有害方向 vₗ; (ii) 将每层最后一个token的隐藏状态投影到 vₗ 上得到标量 pₗ; (iii) 提取一个紧凑的七维特征向量 φ(p),捕捉轨迹的斜率、曲率、单调性、起始层及相关统计量; (iv) 使用一个在CPU上几秒钟内训练好的288参数MLP对 φ 进行分类。 **贡献**: - • 我们识别并形式化描述了**有害性传播动态**,这是有害提示的一个跨层特征,其逐层有害投影值随深度增加而单调上升。我们证明LDA有害方向收敛到稳定的轴(在五次划分间成对余弦相似度 > 0.97),并表明这种稳定性对于基于轨迹的分类是必要的。 - • 我们引入了**Herald**,一个无梯度的轨迹审核器,需要 O(Ld) 内存(32层模型为262KB),运行时开销可忽略不计(占prefill FLOPs的 2.6×10⁻⁶),这使其区别于守护模型和全协方差潜在方法。 - • Heral在对抗性越狱检测上超越了所有已测试的守护模型,并在八项基准测试和四个模型家族上的平均F1上优于所有基于潜在空间的基线方法,比先前的潜在方法提高了2.3–4.1个F1点。 - • 我们展示轨迹特征提供了**类别特定的可解释性**:越狱提示表现出早期起始(l* ≈ 7)和高单调性(0.83),而社会刻板印象起始较晚(l* ≈ 19)且增长不一致(0.58)。这种结构信息对于任何单层方法都是不可见的。 - • 在八项基准测试中进行的全面消融分析,隔离了方向学习、层覆盖、token位置、归一化、分类器容量和收缩正则化的贡献,为跨层安全方法建立了一个可复现的评估框架。 ## 2 相关工作 #### LLM安全与对齐。 RLHF(Christiano et al., 2017; Stiennon et al., 2020)和DPO(Rafailov et al., 2023)提升了模型安全性,但对齐模型仍然容易受到对抗性提示的影响(Ganguli et al., 2022; Perez et al., 2022; Zou et al., 2023c)。我们解决的是互补的输入审核问题,它在生成前而非训练时起作用。 #### 输入审核。 守护模型(Markov et al., 2023; Vidgen et al., 2023)实现了强大的分类能力,但需要第二个大型模型。基于规则的过滤器(Röttger et al., 2021)可解释但脆弱。基于潜在空间的方法(Ryu et al., 2024; Li et al., 2025)高效利用宿主模型的激活,但仅从单个选定层进行分类。Herald则将完整的跨层投影序列作为输入,捕捉有害性如何涌现而非其峰值位置。 #### 表征几何与线性探测。 LLM隐藏空间中的线性方向编码了语义上有意义的概念(Mikolov et al., 2013; Park et al., 2024)。探测研究证实,各层编码了从句法到语用的越来越抽象的属性(Jawahar et al., 2019; Tenney et al., 2019; Rogers et al., 2020)。Zou et al. (2023c) 展示了通过对比激活加法学习的读取向量可以探测和引导行为;Markov et al. (2023) 进一步表明真值方向遵循线性几何。Herald区别于所有这些方法:我们学习**逐层分离的**LDA方向,并对由此产生的跨层轨迹进行分类,而非仅对任何固定深度的投影进行分类。 #### 拒绝与安全方向。 Park et al. (2024) 在残差流中识别出一个线性的“拒绝方向”,并表明消融该方向会移除安全行为。这与我们的工作互补:我们通过追踪有害方向如何在跨层中积累投影质量来监测**输入**侧,而非干预**输出**侧。这两个方向在概念上也不同——拒绝方向描述生成时行为,而HPD方向描述推理时对提示意图的编码。 #### 用于异常检测的轨迹与时间序列方法。 斜率、曲率和单调性等时间序列特征是异常检测中的标准工具(Christ et al., 2018)。Herald将此范式转移到LLM激活空间,将跨层投影视为结构化的时间信号,进行有原则的特征提取和紧凑分类。 #### LLM治理与结构化评估。 结构化、可复现的评估被日益认为是负责任部署的关键(Ganguli et al., 2022; Vidgen et al., 2023)。Herald的逐实例轨迹构成了机器可读的审计记录,揭示有害性**何时**以及**如何**涌现,直接支持需要超越二进制安全/不安全标签的治理工作流。 ## 3 有害性传播动态 ### 3.1 定义与观察 #### 设置。 设 x 为长度为 T 的提示,由 L 层 LLM 处理,hₗ ∈ ℝᵈ 表示第 l 层最后一个token的隐藏状态。对于每一层,我们学习一个有害方向 vₗ ∈ ℝᵈ(在第4节正式定义),并计算余弦投影 pₗ(x) = ⟨ hₗ/‖hₗ‖, vₗ/‖vₗ‖ ⟩ ∈ [-1, 1]。序列 {pₗ}ₗ₌₁ᴸ 是提示 x 的**有害轨迹**。 #### 经验观察。 在以WildGuardMix训练的Llama-3.1-8B-Instruct骨干网络上,有害提示产生的轨迹具有三个特征阶段:(i) 早期层(l ≲ 8)投影值接近零,(ii) 中间层稳定单调上升,以及 (iii) 后期层(pₗ ≳ 0.4)为强正值。良性提示产生平坦或振荡的轨迹,平均投影接近零且无系统性漂移。这种模式——我们称之为**有害性传播动态(HPD)**——在测试的所有四个模型家族(Llama-3.1-8B, Mistral-7B, OLMo2-7B, Qwen-3-8B)、多样化的伤害类别和提示释义中都保持稳定。 ### 3.2 理论基础 HPD与Transformer的分层计算假说一致(Jawahar et al., 2019; Tenney et al., 2019):早期层处理表层形式(分词产物、标点和词汇身份),而后期层编码日益抽象的语义和语用属性。我们用以下命题精确化这一点。 ###### 命题 3.1(非正式) 假设 (i) 有害意图是一个语用-语义属性,主要编码在Transformer后期层;(ii) LDA有害方向 vₗ 是第 l 层最优Fisher判别器的一致估计量;(iii) 有害表征在 vₗ 上的投影随 l 增加而在期望上增大,而良性表征保持有界。那么,有害提示的期望轨迹是单调递增的,而良性轨迹对所有 l 满足 E[pₗ] ≈ 0。 假设 (i) 和 (iii) 在附录B中得到经验验证,且与先前的探测结果一致(Tenney et al., 2019; Geva et al., 2021)。假设 (ii) 由附录H中的方向稳定性分析验证:在独立划分上学习的 vₗ 的成对余弦相似度在每个层和骨干网络上都超过0.97(表12),证实LDA收敛到一个稳定的总体方向,而非拟合采样噪声。 **为何是轨迹,而不仅仅是最终值?** 最终投影 pₗ 确实具有信息性(表3)。然而,两个提示可能具有相似的 pₗ 值,但轨迹形状却显著不同:一个逐渐揭示有害意图的越狱提示(早期起始、单调上升)和一个在最终层因巧合而落在有害方向附近的边界提示(无一致性上升、晚期起始)具有非常不同的风险状况。轨迹特征——特别是起始层 l* 和单调性——能够区分这些情况,而...
相似文章
超越交互界面的安全性:基于大型语言模型潜在状态的有害内容检测
本文提出通过轻量级MLP探测器分析LLaMA-3.1-8B的激活状态,以高F1分数检测有害提示,为大型外部护栏模型提供了一种经济高效的替代方案。
一个高效且模块化的框架,用于大语言模型的定向危害缓解
本文提出一个模块化框架,使用激活的LoRA适配器和上下文感知路由机制,以高效缓解大语言模型中的危害,同时改善安全对齐并保持任务性能。
多模态大语言模型安全格局的演变:新兴威胁与防护措施综述
一篇综述论文,系统分析了多模态大语言模型不断演变的安全格局,涵盖了对抗性攻击、数据投毒、越狱和幻觉等新兴威胁,并回顾了更新后的安全策略。
AI水印使用时,大型语言模型对有害提示的响应差异
研究发现,AI文本水印改变了语言模型对有害提示的响应,可能增加对对抗攻击的脆弱性并影响智能体行为。
真相深藏:通过潜在意图验证反制语义伪装
本文识别了大型语言模型中的一种漏洞,称为语义伪装,并提出了潜在意图验证,这是一种轻量级探测防御,能显著提高对抗性攻击的检测率。