ForeSight: 通过早期安全信号蒸馏增强风险监控
摘要
ForeSight是一个框架,通过分析第一个令牌的隐藏状态来预测大型语言模型的有害输出,提高早期风险监控效率。
arXiv:2609.13737v1 Announce Type: new
摘要:随着大型语言模型(LLMs)的日益部署,有害内容的生成已成为一个关键的安全问题。现有的安全措施在输入、输出或流式生成阶段运行,而依赖于表层令牌或输出logits的早期风险方法可能因初始信号微弱而受限,并且使用密集表示的内部检测器可能保留高度纠缠和冗余的安全无关信息。因此,尚不清楚生成后最早的隐藏状态是否已经包含关于最终响应有害性的可靠信号。为了解决这一差距,我们提出了ForeSight,一个第一令牌输出风险预测框架,将微弱且冗余的早期安全信号蒸馏为紧凑的、层感知的风险表示。在五个安全基准和两个目标模型上的实验表明,ForeSight在仅依赖第一令牌隐藏状态的情况下,实现了优越且高效的早期风险预测。代码可在以下地址获取:https://github.com/Scabbards1500/Foresight
查看缓存全文
缓存时间: 2026/09/15 08:41
# 通过早期安全信号精炼增强风险监控 来源:https://arxiv.org/html/2609.13737 韩林††贡献相等 魏晨龙††贡献相等 单位:西交利物浦大学 邮箱:[[email protected]](mailto:) 徐灵 单位:西交利物浦大学 邮箱:[[email protected]](mailto:) 牛涵言 单位:西交利物浦大学 曹琦 单位:西交利物浦大学 黄世洲 单位:华东师范大学 杨洋 单位:上海大学 朱晓辉 单位:西交利物浦大学 朱耀††通讯作者 单位:浙江大学 ###### 摘要 随着大型语言模型(LLMs)的广泛部署,生成有害内容已成为关键的安全问题。现有安全防护机制在输入、输出或流式生成阶段运行,而依赖表面词元或输出逻辑值的早期风险方法可能因初始信号薄弱而效果不佳,使用密集表示的内部状态检测器则可能保留高度纠缠且与安全无关的冗余信息。因此,目前尚不清楚生成后的最早隐藏状态是否已包含关于最终响应有害性的可靠信号。为解决这一空白,我们提出ForeSight——一个首词元输出风险预测框架,它将微弱且冗余的早期安全信号精炼为紧凑的、层级感知的风险表示。在五个安全基准测试和两个目标模型上的实验表明,ForeSight仅依赖首词元隐藏状态就能实现高效且优越的早期风险预测。代码已在以下地址公开:https://github.com/Scabbards1500/Foresight **免责声明:** 本文包含可能令部分读者感到不适的冒犯性内容。 ## 1 引言 图 1:首词元输出风险估计概览。与事后检测、流式检测或基于密集内部状态的检测器不同,ForeSight 从首词元隐藏状态中稀疏的安全相关信号预测最终响应的有害性。 随着大型语言模型(LLMs)的大规模部署,有害提示可能引发有毒、有偏见或危险的输出,带来重大社会风险(Zou 等人,2023b)。因此,在生成过程中尽早检测输出级别的风险至关重要,以便在有害内容完全生成之前采取措施。现有的安全机制在生成的不同阶段应对这一挑战。输入侧审核在生成前过滤不安全的提示(Mozafari 等人,2020;Caselli 等人,2021),但提示级别的风险不一定能预测输出级别的有害性,因为安全对齐的模型可能会拒绝有害提示,而越狱攻击或微妙的重新表述仍可能引发不安全响应(Shen 等人,2024;Wei 等人,2023)。响应级别的防护模型评估生成的输出(Inan 等人,2023;Han 等人,2024),但这种检测本质上是事后的。为了减少这种延迟,流式审核方法实时监控部分生成内容(Zhao 等人,2025;Li 等人,2026)。近期研究进一步探索是否可以从早期生成的词元或输出逻辑值预测有害性(Qi 等人,2025;Hu 等人,2024;Chen 等人,2025)。然而,从生成的词元或输出逻辑值导出的早期可观测信号在生成开始时通常很微弱,尚不清楚模型的最早内部状态是否已包含关于最终响应有害性的可靠信息。我们假设这种早期安全信号可能已存在于首词元隐藏状态中,但在密集激活中仍呈现稀疏、分散且高度纠缠的状态。这一直觉得到了先前发现的支持,即语义概念通常可以从模型表示中线性解码(Alain 和 Bengio,2016;Hernandez 等人,2024;Park 等人,2023;Jiang 等人,2024b)。为了提取这些微弱信号,我们提出了ForeSight——一个用于从第一个生成的词元进行早期风险估计的稀疏安全信号精炼框架。ForeSight从首词元隐藏状态中识别显著的安全相关神经元,通过结构化聚合减少冗余激活,并结合跨层的互补信号来预测最终响应的有害性。在五个安全基准上的实验证明了其在输出风险预测方面的有效性。我们的主要贡献总结如下: - • 我们引入了首词元输出风险预测设置,仅使用第一个生成词元之后的隐藏状态来预测最终响应的有害性。 - • 我们提出了ForeSight,一个稀疏的早期安全信号精炼框架,它从首词元隐藏状态中提取显著神经元,抑制冗余激活,并聚合跨层的分散安全信号用于早期有害性预测。 - • 在五个安全基准上的大量实验表明,首词元隐藏状态包含有意义的预测信号,并且我们的稀疏精炼方法优于强大的密集基线。 ## 2 相关工作 图 2:ForeSight 概览。该框架通过选择一组稀疏的安全相关神经元、基于训练集激活模式对其进行聚类、将加权的层表示聚合到 \(g(x)\) 中,并训练一个用于风险预测的 MLP 分类器,从而从首词元隐藏状态预测最终响应的有害性。输出级别标签离线从完整响应中导出,仅在训练期间使用。 ### 2.1 早期干预安全机制 LLMs 的安全机制可根据有害性检测的阶段进行分类。早期方法主要对用户提示或完全生成的响应进行分类,使用基于编码器的毒性或仇恨言论分类器,如 BERT(Devlin 等人,2019)和 RoBERTa(Caselli 等人,2021;Mozafari 等人,2020;Zhao 等人,2021;Markov 等人,2023),或生成式防护模型如 Llama Guard(Inan 等人,2023)和 WildGuard(Han 等人,2024)。为了减少事后响应审核的延迟,近期方法将安全检测转移到生成过程中,包括响应级别防护、流式审核和词元级监控(Zhao 等人,2025;Zeng 等人,2024;Ghosh 等人,2025;Li 等人,2026;Kavumba 等人,2026)。其他研究试图从最初的几个生成词元或其逻辑值预测最终响应的有害性(Hu 等人,2024;Chen 等人,2025)。然而,这些方法仍然主要依赖于表面文本信号或输出分布,这些在最早的解码阶段往往是微弱且嘈杂的。相比之下,ForeSight从首词元隐藏表示中提取稀疏但可预测的安全信号,从而在明确出现有害内容之前实现有害性预测。 ### 2.2 利用LLMs内部状态进行安全检测 研究表明,LLMs的内部表示编码了丰富、专门化的特征,支持下游分类并揭示可解释的模型行为(Gurnee 等人,2023;Lai 等人,2026)。除了静态分类,早期内部状态也可能包含预测未来输出的信号(Dong 等人,2025),这表明其在风险估计方面的潜力。在安全领域,先前的工作发现隐藏激活捕获了细粒度的安全相关概念,可以在不完全依赖生成文本的情况下区分对齐行为和越狱行为(Jiang 等人,2025;Zhou 等人,2024;Zhao 等人,2026;Du 等人,2025)。表示层面的研究进一步表明,安全相关激活可能与行为相关(Zou 等人,2024;Zou 等人,2023a)。近期方法利用内部激活进行安全探测和干预,揭示有害性相关方向和潜在结构(Zhao 等人,2026;Yung 等人,2025)。例如,Legilimens探测概念特征(Wu 等人,2024),ShieldHead在解码时附加安全头(Xuan 等人,2025),HSF根据隐藏状态模式过滤高风险输入(Qian 等人,2025)。然而,这些方法通常在生成之前运行,依赖于较晚的解码状态,或使用密集表示,未能直接从稀疏的最早词元信号预测最终响应的有害性。在本文中,ForeSight将微弱但可预测的首词元隐藏状态信号精炼为稀疏的、结构化的、层级感知的表示,用于输出级别的风险预测。 ## 3 方法 ### 3.1 任务定义 给定输入提示 \(x\),自回归语言模型通过 \(y_t \sim p_\theta(\cdot | x, y_1, \dots, y_{t-1})\) 生成响应 \(y = (y_1, \dots, y_n)\)。给定输入提示 \(x\) 和模型的前 \(t-1\) 个词元,预测下一个词元的分布。 ### 3.2 早期安全信号精炼 首词元隐藏状态不直接提供干净的安全表示。尽管早期解码状态可能包含关于未来响应的预测信号(Qi 等人,2025),但内部激活通常编码多个重叠的行为和语义因素(Zhou 等人,2024)。这使得直接从完整隐藏状态中提取安全相关信息变得困难,因此需要一个精炼过程来定位、压缩和聚合早期安全信号。ForeSight通过早期安全信号精炼来解决这一挑战。给定第一个生成词元之后的隐藏状态,我们的目标是提取一个紧凑的表示,该表示在保留安全相关变化的同时,抑制冗余或与任务无关的维度。对于每个选定的层 \(l \in \mathcal{S}\),我们将此早期状态表示为 \(h_1^{(l)} \in \mathbb{R}^d\)。我们将 \(\{h_1^{(l)}\}_{l \in \mathcal{S}}\) 视为同一早期解码状态的多层表示,其中不同层可能捕获互补但重叠的信息。在以下章节中,为清晰起见,我们将使用 \(h\) 指代此首词元隐藏状态。 ##### 显著性诱导的稀疏选择 由于潜在的安全相关成分无法直接识别,我们使用在首词元隐藏状态上训练的逐层线性分类器来估计其支撑集。对于每一层 \(l\),我们在首词元隐藏状态上训练一个二元线性分类器:\(f(h_1) = \mathrm{softmax}(W h_1 + b)\),(4) 其中 \(W \in \mathbb{R}^{2 \times d}\) 和 \(b \in \mathbb{R}^2\) 是可训练参数。分类器通过最小化以下目标进行优化:\(\mathcal{L}_{\mathrm{cls}} = \mathrm{CE}\big(f(h), z\big) + \frac{1}{C} \| W \|_1\),(5) 其中 \(\ell_1\) 惩罚鼓励分类器依赖隐藏状态维度的一个稀疏子集。通过对 \(W\) 进行严格惩罚,模型被迫降低安全无关维度的权重。逆正则化强度 \(C\) 在验证集上为每层选择;较小的 \(C\) 值对应更强的正则化,从而对 \(W\) 施加更强的稀疏性。训练后,我们将维度 \(j=1,\dots,d\) 的显著性定义为 \(a_j = \| W_{1,j} - W_{0,j} \|, \quad W_{1}, W_{0} \in \mathbb{R}^d\),(6) 其中 \(W_{1,j}\) 代表有害类的权重,\(W_{0,j}\) 代表非有害类的权重;\(a_j\) 衡量了对有害与非有害类之间逻辑值间隔的贡献。然后,我们通过按 \(a_j\) 降序排列维度并保留最小的子集(其累积显著性达到总显著性质量的分数 \(\tau\)),构造一个二进制掩码 \(M \in \{0,1\}^d\),满足:\(\sum_{j=1}^{d} M_j a_j \geq \tau \sum_{j=1}^{d} a_j\)。(7) 显著性分数 \(a\) 和由此产生的掩码 \(M\) 是层特定的但与输入无关,并在分类器训练后对所有样本保持固定。稀疏化后的表示为:\(\tilde{h} = M \odot h\)。(8) 在实现中,我们只保留 \(M\) 选择的非零项,并将稀疏层特征表示为 \(h\) 的对应子向量。 ##### 结构化冗余减少 尽管稀疏化移除了低显著性维度,但由于神经元激活的相关性,残余冗余可能仍然存在。为了进一步减少冗余,我们根据训练集上跨样本的激活模式对保留的神经元维度进行聚类。对于每一层 \(l\),令 \(\mathcal{J} = \{j \mid M_j = 1\}\) 表示层 \(l\) 处保留的维度集。对于每个保留的维度 \(j \in \mathcal{J}\),我们将其在训练集上的激活模式定义为 \(p_j = \left[ \tilde{h}_{j}(x_{i}) \right]_{x_{i} \in \mathcal{D}_{\mathrm{train}}}\)。(9) 然后,我们使用 \(k\)-means(McQueen,1967)对这些模式进行聚类,得到 \(K\) 个簇:\(\mathcal{C} = \left\{ C_{1}, \ldots, C_{K} \right\}\),(10) 其中每个簇将跨训练输入具有相似激活行为的神经元分组。给定从层 \(l\) 学习到的簇,对于任何样本 \(x\),我们通过平均池化聚合每个簇内的保留激活:\(c_{k}(x) = \frac{1}{|C_{k}|} \sum_{j \in C_{k}} \tilde{h}_{j}(x), \quad k=1,\ldots,K\)。(11) 这得到了结构化的层表示 \(\bar{h}(x) = \left[ c_{1}(x), \dots, c_{K}(x) \right] \in \mathbb{R}^{K}\),(12) 这诱导了层表示 \(g(x)\)。
相似文章
超越交互界面的安全性:基于大型语言模型潜在状态的有害内容检测
本文提出通过轻量级MLP探测器分析LLaMA-3.1-8B的激活状态,以高F1分数检测有害提示,为大型外部护栏模型提供了一种经济高效的替代方案。
超越安全数据:使用正则安全反射的预训练阶段对齐
本文提出安全反射预训练(Safety Reflection Pretraining)方法,通过将正则安全反射集成到预训练语料中,直接将自我监控嵌入语言建模,实验表明在1.7B模型中提升了安全对齐效果并降低了攻击成功率。
EduRiskX:基于F逻辑推理的神经符号框架,用于早期学术风险预测
EduRiskX是一种神经符号框架,它将时序Transformer模型与F逻辑推理相结合,用于在线教育中早期学术风险的预测,与最先进模型相比,展示了更高的准确性和可解释性。
Foresight: 长时域机器人操作中基于动作条件的世界模型潜在表示的故障检测
Foresight 是一个用于长时域机器人操作的故障检测框架,它利用基于动作条件的世界模型潜在表示和功能性保形预测来监控轨迹,仅使用最终任务标签进行训练。在仿真和真实机器人任务中均展示了最先进的性能。
加强我们的前沿安全框架
DeepMind 发布了第三版前沿安全框架,扩展了风险范围以包括有害操纵和不对齐风险,并完善了风险评估流程和高级 AI 模型的治理协议。