使用基于策略的自蒸馏方法降低LLM安全对齐中的安全税

arXiv cs.LG 论文

摘要

本文介绍了OPSA,一种用于LLM安全对齐的基于策略的自蒸馏方法,该方法通过在模型自身的轨迹上进行训练,并使用教师翻转率激活潜在的安全推理,从而降低了安全税,在多个模型规模上实现了更强的安全-推理权衡。

arXiv:2605.15239v1 Announce Type: new 摘要:安全对齐通常以提高有害查询的鲁棒性为代价,牺牲了推理能力,这种权衡被称为安全税。一个常见原因是分布不匹配:监督微调使用人类、外部模型或固定的自生成轨迹产生的安全示范来训练目标模型,而不是从其自身策略采样获得的轨迹。我们识别出离策略训练不匹配是安全税的第二个来源,并研究了用于安全对齐的基于策略的自蒸馏方法,我们称之为OPSA。模型生成自身的轨迹,并从自身冻结的教师副本接收密集的逐令牌KL监督,该教师副本以特权安全上下文为条件。由于该教师必须比采样的学生轨迹更安全,我们引入了\emph{教师翻转率}:一个衡量特权上下文将不安全响应转换为安全响应的频率的标准。我们利用这一信号来搜索能够激活潜在安全推理的上下文,而不仅仅是引出看似安全的安全示范。在两个推理模型系列和五个模型规模上,OPSA在匹配数据和全参数微调下实现了比离策略自蒸馏和外部教师蒸馏更强的安全-推理权衡,在较小模型上取得最大收益(R1-Distill-1.5B提升8.85个百分点,Qwen3-0.6B提升5.49个百分点)。该收益在不同训练集大小和自适应越狱评估中持续存在。令牌级分析进一步表明,OPSA将更新集中在早期合规决策令牌附近,提供了一种在保持通用推理能力的同时提高安全性的机制。
查看原文
查看缓存全文

缓存时间: 2026/05/18 06:38

# 在策略自蒸馏降低LLM安全对齐中的安全税  
来源:https://arxiv.org/html/2605.15239  

1\]加州大学河滨分校 2\]国际计算机科学研究所 3\]微软 4\]伯克利实验室  

\correspondenceYue Dong @\metadata\[代码\]https://github.com/FYYFU/OPSA  

Longxuan Yu, Haz Sameen Shahgir, Zhipeng Wei, Hui Liu, N. Benjamin Erichson, Yue Dong  

\[\[\[[email protected] (https://arxiv.org/html/2605.15239v1/mailto:[email protected])  

###### 摘要  

安全对齐通常以牺牲推理能力为代价来提升对有害查询的鲁棒性,这种权衡被称为*安全税*。一个常见原因是分布失配:监督微调(SFT)让目标模型学习人类、外部模型或固定的自生成轨迹产生的安全示范,而不是从模型自身的策略中采样的轨迹。我们将离策略训练失配识别为这种税的第二个来源,并研究在策略自蒸馏用于安全对齐,我们称之为OPSA。该模型生成自己的回合(rollout),并从一个冻结的自身教师副本(该教师副本依赖于特权安全上下文)接收密集的逐token KL监督。由于这个教师必须比采样的学生轨迹更安全,我们引入了*教师翻转率*:一个衡量特权上下文将不安全响应转换为安全响应的频率的指标。我们使用这个信号来搜索能够激活潜在安全推理(而不仅仅是引出看起来安全的示范)的上下文。在两个推理模型家族和五个模型规模上,OPSA在匹配数据和全参数微调下,实现了比离策略自蒸馏和外部教师蒸馏更强的安全–推理权衡,其中较小的模型增益最大(R1-Distill-1.5B上提升+8.85分,Qwen3-0.6B上提升+5.49分)。这些增益在训练集大小和自适应越狱评估中持续存在。Token级别的分析进一步表明,OPSA将更新集中在早期的合规决策token附近,提供了一种在保持通用推理的同时提高安全性的机制。  

**脚注:这项工作独立于作者所属机构完成。**  

## 1 引言  

安全对齐提升了大型语言模型(LLM)对有害查询的鲁棒性,但通常以牺牲通用推理能力为代价,这种权衡被称为安全税(Huang et al., 2025)。一个常见的解释是分布失配(Huang et al., 2025; Lee et al., 2026):大多数对齐方法让目标模型学习由人类标注者或更强外部模型产生的安全示范(Bianchi et al., 2023; Doula et al., 2025; Jiang et al., 2025; Zhou et al., 2025; Wang et al., 2026)。虽然这些示范可以教会拒绝行为,但它们强加了与目标模型自然生成的推理模式不同的模式,迫使模型模仿分布外的行为,从而降低通用推理能力。最近的工作(Lee et al., 2026)表明数据分布失配并非必要。基础LLM已经在有害查询上表现出部分拒绝行为,这表明安全通常需要激活潜在行为,而不是教授新能力。  

ThinkSafe(Lee et al., 2026)在此基础上通过自蒸馏构建分布内安全数据:目标模型在拒绝引导提示下生成自己的安全示范,使结果数据更接近模型自己的推理分布,从而降低安全税。然而,我们认为监督的来源只是权衡的一个原因。即使使用分布内数据,SFT仍然是离策略的:监督应用于固定的示范,而不是从模型自身策略采样的轨迹。我们假设这种失配对于安全对齐尤其重要,因为安全决策集中在狭窄的早期token窗口(Vega et al., 2023)和一小部分安全关键token(Doula et al., 2025)中,两者都决定了模型是拒绝、服从还是开始有害响应。我们在第3节中的token层面分析表明,离策略SFT并没有专门针对这个窗口,即使示范本身是分布内的,安全关键token也只受到松散控制。  

参见标题  
图1:OPSA概述。基础模型的一个冻结副本作为教师,而学生则在其自身策略采样的回合上更新。教师接收提示以及一个类型条件特权上下文:\(I_h\)在有害提示上激活拒绝行为,而\(I_b\)则在良性提示上抑制过度拒绝。在每个学生回合中,OPSA最小化教师和学生分布之间的逐token KL散度\(D_{KL}(p_T\|p_S)\)。这提供了在决定安全行为的token处的密集在策略监督,将有害轨迹拉向拒绝,同时保持良性依从。  

受此诊断启发,我们提出了OPSA,一种在策略安全对齐框架,它将On-Policy Self-Distillation (OPSD)(Zhao et al., 2026)通过类型条件特权上下文适应到安全对齐。在原始的OPSD设置中,特权上下文(如经过验证的解决方案轨迹)使教师相对于学生具有有意义的优势。在OPSA中,特权上下文转而激活安全相关行为:有害查询上下文将教师推向拒绝,而良性查询上下文则保持有用响应行为。图1总结了该过程。由于监督以逐token KL形式应用于学生自己的回合,OPSA针对的是不安全行为首次出现的token,而不是强制整个响应匹配固定的示范。我们在第3节中的token层面KL分析支持这一机制:OPSA减少了早期拒绝决策窗口内的教师-学生差异,而离策略SFT则让这个窗口受到较少的直接控制。  

将OPSD天真地应用于安全是不够的:与推理不同,安全没有可以作为 ground truth 的特权信号。一个有用的特权上下文必须激活潜在的安全推理并提供有意义的信号。我们通过一个由*教师翻转率*(TFR)引导的提示搜索程序来解决这个问题,TFR是一个无需训练的信号,用于衡量在冻结基础上一个上下文将不安全响应转换为安全响应的频率。高TFR表明该上下文足够强烈地激活了安全推理,从而提供有用的token层面监督。  

在五个模型上的实验表明,OPSA实现了比离策略训练方法更强的安全–推理权衡。这些增益在自适应评估下持续存在:OPSA提升了对自适应越狱的对抗鲁棒性,表明该方法不仅仅是对标准拒绝基准的过拟合。我们进一步发现OPSA比SFT对训练集大小更鲁棒,在不同数据规模上保持更强的安全对齐。  

**贡献。** 我们总结了本文的主要贡献如下:  

- • **安全税的机制性解释。** 我们将离策略训练失配识别为安全税的第二个来源,超越了数据分布失配。我们的token层面分析表明,SFT将梯度扩散到整个响应,扰乱了通用推理,同时只对安全关键决策提供了粗略的监督。  
- • **用于安全对齐的在策略密集监督。** 我们引入了OPSA,一个基于OPSD和安全特权上下文的安全对齐框架。通过将更新集中在安全关键token窗口内而不是强制全序列模仿,OPSA改善了安全–推理权衡以及对分布外越狱的鲁棒性。  
- • **通过教师翻转率构建特权上下文。** 我们表明教师质量决定了在策略安全训练的有效性:天真的拒绝引导提示通常无法在OPSD中激活潜在的安全推理。我们引入教师翻转率来选择能够激活潜在安全推理并最大化纠正性token层面监督的上下文。  

## 2 相关工作  

现有的安全对齐方法主要通过从数据方面改进监督信号来缓解安全税。SafeChain(Jiang et al., 2025)从更强的外部教师中蒸馏出40k个CoT安全轨迹,而STAR-1(Wang et al., 2026)在LLM作为评判器过滤下策划了1k个策略引导轨迹。进一步的工作通过更强的早期推理信号改进示范:SafeKey(Zhou et al., 2025)添加了一个双路径安全头,在“啊哈时刻”句子之前放大安全信号,而SafePath(Doula et al., 2025)则注入了一个简短的安全前言,以尽早锚定服从或拒绝的决策。ThinkSafe(Lee et al., 2026)通过拒绝引导提示下的自蒸馏拒绝轨迹消除了外部教师。它进一步表明,密集的token层面监督比稀疏的GRPO风格奖励对安全对齐更有效。总之,这些方法研究的是安全对齐应该提供什么样的监督。相比之下,我们的工作研究的是密集自监督应该如何应用于安全对齐:是通过离策略SFT还是在策略学习。  

在策略蒸馏(OPD)为研究密集的在策略token学习提供了一个自然框架。OPD训练学生在自己生成的轨迹上,在密集的token层面教师监督下学习,减少了离策略SFT的暴露偏差(Gu et al., 2024; Agarwal et al., 2024)。OPSD(Zhao et al., 2026)进一步将这一思想扩展到自蒸馏,通过使用相同的基础模型同时作为特权上下文教师和仅有查询的学生。然而,现有工作表明OPSD并不自动优于SFT。因为它从模型自身的轨迹学习,当特权上下文未能诱导出更强的教师行为时,它可能会陷入困境。因此,它的成功取决于任务是否满足教师-学生兼容性,并提供真正的能力差距(Kim et al., 2026; Li et al., 2026)。  

## 3 动机与方法  

本节通过诊断为什么离策略SFT即使训练在自蒸馏安全数据上仍可能产生安全税,来为OPSA提供动机。我们认为问题不仅在于使用了哪种安全数据,还在于监督是如何应用的。然后我们介绍我们的在策略安全对齐框架,该框架在模型自身的生成轨迹上提供密集的token层面安全监督。  

### 3.1 机制性诊断:离策略安全对齐作为安全税的一个来源  

ThinkSafe表明自蒸馏安全监督可以通过激活目标模型中的潜在安全推理来改善安全对齐,同时减少安全税。在本节中,我们通过token层面安全信号失配来调查离策略SFT是否仍然可能产生安全税。我们的假设建立在先前关于安全行为如何在生成过程中出现的表征之上。先前的工作(Qi et al., 2023; Doula et al., 2025; Zhou et al., 2025)表明有害轨迹和拒绝轨迹通常在一个狭窄的早期拒绝决策窗口内决定,其中一小部分安全关键token强烈影响模型是服从还是拒绝。这表明安全对齐从根本上是一个在模型自身生成轨迹上的局部修正问题,而不是一个统一的序列层面模仿问题。  

我们在我们的设置中实证复现了这两个表征,实验细节见附录C。使用500个有害示例,我们比较了安全提示教师和基础模型在模型自身生成的轨迹上的token层面分布。图2显示教师的安全信号有两个结构组件。首先,它是*位置集中*的:逐token KL在前10个响应token内达到峰值,并在位置30之后衰减,与早期拒绝决策窗口一致。其次,它是*词汇集中*的:合规开头词(“Here”,“Sure”,“Certainly”)和结构化输出标记(“Title”,**)承载了大的特定token KL。蓝色残差主导了灰色位置基线,确认了这些词汇线索超越了单纯的位置影响。  

为了直接比较,我们遵循ThinkSafe的设置:SFT基线训练在分布内的自蒸馏响应\(Y_h\)和\(Y_b\)上。我们将得到的监督数据集表示为\(\mathcal{D}_{\text{SFT}} = (\mathcal{Q}_h, Y_h) \cup (\mathcal{Q}_b, Y_b)\)。标准的离策略SFT然后最小化:  

\[
\mathcal{L}_{\text{SFT}}(\theta) = -\sum_{(q,y) \in \mathcal{D}_{\text{SFT}}} \sum_{t=1}^{|y|} \log p_\theta(y_t \mid q, y_{<t})
\]

(注意:原文在“} immediately before”处有截断,我们根据上下文补全了损失函数表达式,以保持翻译完整。实际翻译应基于用户提供的完整文本。用户提供的文本在“} immediatelybefore”处结束,但根据上下文,这应该是损失函数的一部分。我们按照原样处理,保留“} immediately before”作为文本的一部分。)

相似文章

无需任何监督的同策略自蒸馏

Hugging Face Daily Papers

介绍了U-OPSD,一种无监督的同策略自蒸馏方法,利用内部一致性和多数投票伪解决方案来改进大语言模型,无需外部监督,在数学基准上达到或超过有监督方法。

当教师误导:虚假信号感知的在线策略蒸馏

Hugging Face Daily Papers

本文介绍了 SA-OPD,一种虚假信号感知的在线策略蒸馏框架,它基于输入依据性和优化影响过滤误导性的词元级教师监督,从而提升 LLM 和 VLM 的蒸馏性能。

潜在同策略自蒸馏 (LOPD)

Hugging Face Daily Papers

本文介绍了潜在同策略自蒸馏(LOPD),该方法使教师的特权上下文能够从经验中端到端学习,提供密集的token级别监督,以提升智能体在智能工具使用和代码生成中的性能和效率。