风险链条:大型推理模型中的安全失效及通过自适应多原则引导进行缓解

arXiv cs.AI 论文

摘要

本文研究了大型推理模型中的安全失效问题,即尽管最终答案安全,但推理轨迹中仍会出现有害内容,并提出了一种自适应多原则引导方法来缓解这些风险。

arXiv:2605.05678v1 公告类型:new 摘要:大型推理模型(LRMs)越来越多地暴露类思维链(chain-of-thought)的推理过程,以实现透明性、可验证性和审慎的问题解决。这创造了一个安全盲区:即使最终答案看起来安全,有害或违反策略的内容也可能出现在推理轨迹中。我们通过在一个统一的二十项原则安全评分标准下对两个阶段进行评分,来测试最终答案的安全性是否足以代表整个推理-答案轨迹的安全性。我们使用来自七个公共有害性和越狱来源以及四个分布外(OOD)来源的提示词,在41,000个提示词上评估了15个开放权重和基于API的LRMs。推理轨迹一致地揭示了超出最终答案的额外安全风险,特别是在高严重性的分阶段失效中:泄露案例(unsafe reasoning precedes a safe-looking answer)和逃逸案例(benign-looking reasoning precedes an unsafe final response)。原则级别的分析显示,风险集中在虚假信息、法律合规性、歧视、身体伤害和心理伤害方面。我们进一步提出了自适应多原则引导,这是一种白盒测试时缓解方法,它学习每个安全原则的一个从不安全到安全的激活方向,并且仅激活当前隐藏状态更接近不安全中心而非安全中心的方向。在三个可引导的开放推理模型上,自适应引导在保留的基准和OOD基准上减少了推理轨迹和最终答案中的不安全计数。DeepSeek-R1-Qwen-7B在BBH、GSM8K和MMLU上平均不安全计数减少了40.8%,同时保持了97.7%的宏观平均准确率。这些结果表明,LRM的安全性应该在完全暴露的推理-答案轨迹上进行评估和缓解,而不仅仅是在最终答案阶段。
查看原文
查看缓存全文

缓存时间: 2026/05/08 08:30

# 风险链条:大型推理模型中的安全失效及通过自适应多原则引导的缓解策略

来源: https://arxiv.org/html/2605.05678
李小明 哈佛大学 & 侯建恒 南加州大学 & 邓泽远22footnotemark:2 布朗大学 张志伟 宾夕法尼亚州立大学 & 李涛然 德州农工大学 & 陆炳航 普渡大学 胡冰 独立研究员 & 赵云涵 加州大学尔湾分校 & 郝越星 麻省理工学院

###### 摘要

大型推理模型(LRMs)越来越多地暴露出类似思维链(chain-of-thought)的中间推理过程,以实现透明度、验证和深思熟虑的问题解决。这产生了一个安全盲区:即使最终答案看起来安全,有害或违反政策的内容也可能出现在推理痕迹中。我们通过在一个统一的二十项原则安全评分标准下对两个阶段进行评分,来测试“最终答案的安全性”是否足以作为“完整推理-答案轨迹”的代理指标。我们使用来自七个公开有害性和越狱来源的提示词,加上四个分布外(OOD)来源以进行鲁棒性评估,对15个开放权重和基于API的LRMs进行了评估。在每个模型41K个提示词中,推理痕迹一致地暴露出超出最终答案的额外安全风险。这种效应是系统性的,并在高严重程度的阶段性失败中表现得最为明显:**泄露(leak)**案例,即不安全的推理 precedes 看似安全的答案;以及**逃逸(escape)**案例,即看似良性的推理 precedes 不安全的最终响应。原则层面的分析显示,风险集中在虚假信息、法律合规、歧视、身体伤害和心理伤害等类别中。除了诊断之外,我们提出了**自适应多原则引导(adaptive multi-principle steering)**,这是一种白盒测试时缓解方法,它为每个安全原则学习一个从不安全到安全的激活方向,并且仅激活那些当前隐藏状态更接近不安全中心而非安全中心的方向。在三个可引导的开放推理模型上,自适应引导在保留和分布外基准测试中,一致地减少了推理痕迹和最终答案中的不安全计数。最强的增益将HeldOut2K上的不安全推理减少了77.2%,将OOD2K上的不安全推理减少了62.7%,并将OOD2K上的不安全最终响应减少了高达48.1%。DeepSeek-R1-Qwen-7B在保持BBH、GSM8K和MMLU上97.7%的宏平均准确率的同时,实现了40.8%的平均不安全计数减少。这些结果表明,LRM的安全性应在全暴露的推理-答案轨迹上进行评估和缓解,而不仅仅是在最终答案阶段。

**警告:** 出于研究目的,本文可能包含潜在的有害、不安全或不道德的提示词和响应。

## 1 引言

大型推理模型(LRMs)在标准语言模型的基础上增加了更长的深思熟虑、显式的中间推理,以及在数学、编码、规划和科学任务上的性能提升。它们的推理痕迹通常被视为一个有用的界面:它们可以帮助用户检查答案是如何产生的,帮助开发者调试故障,并为下游系统提供监控信号[31, 28, 49]。然而,暴露推理也改变了安全表面[27, 24]。一个模型可能在其推理中重构有害细节或比较危险的替代方案,然后产生一个经过打磨的拒绝作为最终答案。在这种情况下,答案看起来是对齐的,但有害内容已经出现在痕迹中。因此,一种代表性的**泄露(leak)**模式很简单:最终响应拒绝了一个不安全的请求,而前面的推理在决定拒绝之前私下枚举了方法、约束或操作细节。如果该痕迹可见、被记录或传递给外部工具,这种拒绝就不再包含风险。

本文研究**答案安全性**与**推理安全性**之间的差距。答案安全性询问最终响应是否符合安全政策,而推理安全性询问中间推理本身是否避免有害、助长或违反政策的内容。这两个概念在三种特征方式上可能分歧:**不安全(unsafe)**案例,即推理和答案都是有害的;**泄露(leak)**案例,即不安全的推理 followed by 更安全的看似答案;以及**逃逸(escape)**案例,即看似良性的推理仍然导致不安全的最终响应。这些故障之所以重要,是因为LRM推理痕迹越来越暴露、被审计、存储或用作监控信号。关键问题是:仅对最终答案的评估是否是完整暴露生成轨迹的充分安全代理?我们表明事实并非如此:仅针对答案的评估错过了**泄露**故障(不安全的推理 followed by 拒绝)和**逃逸**故障(看似良性的推理 precedes 不安全的答案)。

这种框架也改变了缓解措施应针对的目标。如果拒绝之前出现了不安全内容,仅编辑最终答案的控制器仍可能使暴露的轨迹处于不安全状态。因此,我们需要在风险首次出现的地方进行诊断和干预的方法,同时保留推理效用。

我们展示了一项两部分的研究。首先,我们构建了一个阶段性诊断框架,在带有1-5严重性评分标准的二十项显式安全原则下评估推理痕迹和最终答案。我们聚合了来自七个公开有害性和越狱数据集的提示词,预留四个分布外来源进行鲁棒性评估,并评估了十五个推理模型。在每个模型41K个提示词中,所有模型的平均推理痕迹严重性都超过最终答案严重性,其中Gemini-Pro-3.1、GPT-OSS-20B、DeepMath-Zero-7B和Kimi-K2.5的差距最大。风险也是以原则结构的,集中在虚假信息、法律合规、歧视、身体伤害和心理伤害中。

其次,我们提出了**自适应多原则引导**,一种测试时激活引导方法,反映了这种原则结构。对于每个安全原则,我们计算安全和无安全的激活质心,定义一个从不安全到安全的方向,并仅激活那些当前隐藏状态看起来更接近不安全的方向。这使得干预具有原则感知和提示适应性,同时限制对良性推理的干扰。

在经验上,自适应引导减少了我们在所有三个可引导开放模型中评估的不安全计数:DeepSeek-R1-Distill-Qwen-1.5B、DeepSeek-R1-Distill-Qwen-7B和MiMo-7B-RL-Zero。在HeldOut2K上,这三个模型的整体不安全计数减少率分别为10.8%、41.9%和30.5%。在OOD2K上,相应的减少率为18.3%、39.8%和48.0%。增益不仅限于最终答案:最强的推理侧减少在HeldOut2K上达到77.2%,在OOD2K上达到62.7%。此外,DeepSeek-R1-Qwen-7B实现了最强的安全-效用权衡,在HeldOut2K和OOD2K上将不安全计数平均减少了40.8%,同时在BBH、GSM8K和MMLU上保留了97.7%的宏平均准确率。

这些结果表明,LRM的安全性应在推理阶段本身进行评估和控制,而不仅仅是在推理被压缩为最终答案之后。图1总结了我们的整体框架。

<sup>111代码和数据提供在: https://anonymous.4open.science/r/Submission-LRM-Safety-F048。参见标题</sup>

**图1:** 拟议的诊断-控制循环概述。阶段性诊断在相同的二十项原则评分标准下评估推理痕迹和最终答案,揭示不安全、泄露和逃逸故障。自适应多原则引导随后重用原则级标签来构建安全方向,并仅应用由当前隐藏状态激活的方向。

我们的主要贡献包括:
- 我们引入了一个用于LRM安全性的阶段性评估框架,在二十项显式安全原则和1-5严重性评分标准下对推理痕迹和最终答案进行评分。
- 我们从一个包含七个分布内提示词来源和四个分布外评估来源的多样化安全提示词数据集,通过统一的预处理、过滤和去重构建而成。
- 我们形式化了三种推理-答案故障模式:**不安全**、**泄露**和**逃逸**,并表明它们揭示了仅针对答案的评估所遗漏的安全故障。
- 我们评估了跨越开放权重和基于API系统的15个推理模型,并表明所有模型的平均推理痕迹严重性均高于平均最终答案严重性。
- 我们表明安全风险是原则结构的,升高的风险集中在少数原则中,而不是均匀地分布在整个评分标准中。
- 我们提出了自适应多原则引导,这是一种具有原则感知的测试时缓解方法,它在保留和分布外提示词上减少了不安全推理和不安全最终响应,同时为最佳权衡模型保留了大部分通用能力。

## 2 相关工作

##### LLMs和LRMs的安全对齐。
LLM安全对齐已通过监督安全微调、偏好优化、宪法或基于原则的对齐、拒绝训练、红队测试和越狱评估进行了研究[25, 47, 46, 126, 127, 124, 118, 129, 51, 74, 8, 113, 45]。这项工作的大多数评估最终答案是否拒绝不安全请求、避免助长危害并在对抗性提示词下保持有用[25, 9, 124, 51, 74]。对于LRMs来说,安全担忧变得更加尖锐,因为更长的深思熟虑和暴露的推理痕迹可能引入仅输出评估所遗漏的故障[48, 125, 32]。先前的工作研究了面向推理的安全对齐、安全-能力权衡以及监控CoT痕迹的难度[116, 40, 30, 41, 43]。相比之下,我们的目标不是引入另一个最终答案有害性基准,而是测试最终答案的安全性是否是完整推理-答案轨迹的充分代理。

##### 激活引导和条件内部控制。
激活引导通过修改推理时的隐藏状态,为重新训练提供了一种轻量级替代方案。先前的工作研究了对比激活添加、行为引导、安全引导等[67, 114, 44, 115, 72, 112, 26]。我们的方法将此想法专门用于LRM安全:它为每个安全原则学习一个方向,并且仅激活那些当前隐藏状态比安全质心更接近不安全质心的方向。与通用的行为或拒绝引导不同,我们的干预共享用于评估的相同原则分解。

## 3 评估设置

### 3.1 问题设置

我们研究一个推理模型 $f$,给定提示词 $x$,产生中间推理痕迹 $r$ 和最终答案 $y$:$(r, y) = f(x)$。我们主要的担忧是 $r$ 和 $y$ 在安全性上可能存在显著差异。一个模型可能在其推理痕迹中暴露有害内容,随后产生一个看起来更安全的最终答案,或者它可能显示出看似良性的推理,同时仍发出一个不安全的答案。因此,我们在两个阶段都评估安全性。

设 $\mathcal{P}=\{1,...,K\}$ 表示 $K=20$ 个安全原则的集合。对于每个原则 $k \in \mathcal{P}$,我们对推理痕迹和最终答案进行评分:

$$ s^{\mathrm{cot}}_k(x) \in \{1,...,5\}, \quad s^{\mathrm{ans}}_k(x) \in \{1,...,5\}, \quad (1) $$

其中较高的分数表示更严重的安全违规。

我们使用平均分数 $H^t(x)$ 来总结阶段级别的严重性:

$$ H^t(x) = \frac{1}{K}\sum_{k=1}^{K}s^t_k(x), \quad t \in \{\mathrm{cot}, \mathrm{ans}\}, \quad (2) $$

以及最大原则违规 $M^t(x)$:

$$ M^t(x) = \max_{k} s^t_k(x). \quad (3) $$

这种设置让我们可以跨阶段、原则、模型和提示词来源比较安全性,并为我们的缓解方法提供评分信号。

### 3.2 数据和模型

##### 安全提示词。
我们的安全提示词基准聚合了来自多个公开有害性和越狱数据集的提示词。分布内提示词池结合了七个来源:WildChat[128]、PKU-SafeRLHF[38]、JailbreakV[50]、HarmBench[51]、BeaverTails[39]、StrongREJECT[74] 和 JailbreakBench[8]。一起,这些来源涵盖了直接的有害请求、越狱、恶意角色扮演、对抗性框架以及自然发生的不安全用户查询。我们将数据集特定的字段映射到统一的 `prompt` 列和 `source` 标签,过滤非英语提示词和长度异常值,并使用MinHash-LSH去除基于Token级别Jaccard相似度的近重复项[7]。在过滤和去重后,我们使用源分层分割将池分为41K的分布内诊断/质心构建池和2K的保留测试集。

为了进行鲁棒性评估,我们从AdvBench[129]、SaladBench[45]、SimpleSafetyTests[113] 和 WildJailbreak[42] 构建了一个单独的分布外(OOD)集。这些提示词使用相同的过滤和去重管道进行处理。详细信息见附录D。

##### 通用能力基准。
为了评估能力保留,我们在BBH[79]、GSM8K[11] 和 MMLU[29] 上评估引导模型。这些基准仅用于评估,不用于选择引导方向或调

相似文章

当思维链更明智时:多轮推理模型中的失败模式

Hugging Face Daily Papers

本文通过引入CoT-Output安全矩阵分析了多轮推理模型中的失败模式,揭示了诸如在监控线索下伪装对齐率增加以及上下文注入失败(即安全的内部推理被有害输出覆盖)等悖论。

思维链推理在实际应用中并非总是忠实的

Hacker News Top

本文表明,在大型语言模型中,思维链推理并不总是忠实的,模型在应对自然语言提示时会产生看似合理但不正确的推理链,引发了对AI安全和透明度的担忧。

Thinking Past the Answer: Evaluating Harmful Overthinking in Large Reasoning Models

arXiv cs.AI

This paper introduces a prefix-level trajectory evaluation protocol to distinguish harmful overthinking from verbose but harmless overthinking in large reasoning models, showing that continued reasoning after reaching the correct answer can destabilize performance. The authors find that early stopping improves accuracy by up to 21% on multimodal benchmarks, and identify logical drift and visual reinterpretation as key causes of correctness deviations.