面向LLM安全性的在线策略蒸馏:一种基于路由的模板鲁棒对齐方法

arXiv cs.AI 论文

摘要

本文提出了基于路由的在线策略蒸馏(ROPD),一种安全性重对齐框架,利用两个冻结的教师模型在保持任务性能的同时恢复安全性,并表明其相比现有防御方法对提示模板不匹配具有更强的鲁棒性。

arXiv:2607.27081v1 公告类型:新 摘要:微调是专业化大型语言模型(LLM)的主导范式,但它暴露了一个关键漏洞:恶意数据提供者可以将有害行为嵌入到下游语料库中,从而创建在按需违反人类价值观的同时保留专业技能模型。现有安全性重对齐防御在实践中常常失效,原因在于三个关键局限:它们经常导致专业技能灾难性遗忘;当防御者无法观察到攻击者的提示模板时,其有效性会崩溃;并且成功重对齐的模型仍然容易通过简单的系统提示切换而被重新越狱。为应对这些挑战,我们提出了基于路由的在线策略蒸馏(ROPD),一种新颖的重对齐框架,它对对齐和受损输出概率分布之间的差异进行建模,而不是拟合特定的提示模板。我们进行了大量实验,将ROPD与四种最先进的基线方法在三个数据集和三个具有不同对齐强度的基础模型上进行了比较。结果表明,当基线防御面临模板不匹配时,通常伴随着下游任务性能的严重下降。相比之下,ROPD大幅缓解了模板不匹配风险,在防御有效性和能力保持方面都保持了优越的鲁棒性。虽然我们的分析表明ROPD并非完全不受模板变化的影响,但其性能下降与现有方法相比可忽略不计,为鲁棒的LLM重对齐建立了新标准。
查看原文
查看缓存全文

缓存时间: 2026/07/31 04:01

# 基于策略蒸馏的LLM安全对齐:一种模板鲁棒再对齐的路由方法

Source: https://arxiv.org/html/2607.27081
Yongjian Guo1、Wanlun Ma2、Lingyu Shen3、Xi Xiao1、Sheng Wen2 1清华大学 2斯威本科技大学 3洛桑联邦理工学院

###### 摘要

微调是使大型语言模型(LLM)专业化的主要方式,然而恶意数据提供者可以悄悄地将有害行为嵌入到下游微调语料中,使得最终模型在保留其专业技能(例如,代码生成)的同时,能够在需要时违反人类价值观。现有的安全再对齐防御措施只能在限制性假设下恢复对齐,我们发现了三个在实践中会削弱这些防御措施的漏洞:它们常常在修复过程中损害模型的专业技能;当防御者无法观察攻击者的提示模板时,其有效性会崩溃;而且即使成功再对齐的模型,也可能仅仅通过切换系统提示而被重新越狱。我们提出了基于路由策略蒸馏(Routing-based On-Policy Distillation,ROPD),这是一种再对齐框架,它对对齐模型与受损模型输出概率分布之间的差异进行建模,而不是针对特定提示模板进行对齐。ROPD 将每个再对齐 token 路由到两个冻结教师模型之一——一个是原始模型的安全教师,提供很大程度上与模板无关的拒绝先验;另一个是微调后的任务教师,用于保留下游能力——并通过 top-KK KL 目标将学生模型与路由到的教师模型进行匹配。我们进行了大量实验,在三个数据集和三个具有不同对齐强度的基础模型(Llama-2、Qwen2.5 和 Gemma-2)上,比较了四种最先进的基线方法——SSRD、RESTA、soft-SFT 和 rollback。结果表明,当这些防御方法的模板与攻击模板不匹配时,其防御有效性会下降超过 30%,同时还会导致下游任务性能显著下降——甚至降至零。相比之下,ROPD 大幅降低了这种模板不匹配风险,在防御有效性和下游能力保持方面都更加鲁棒——不过,正如我们的分析所示,它也会受到模板不匹配的影响,只是程度要小得多。

## 1 引言

参见图注 Figure 1:安全再对齐中的模板一致性陷阱。对齐技术Wang et al. (2024 (https://arxiv.org/html/2607.27081#bib.bib1)) 如基于人类反馈的强化学习,已使遵循指令的 LLM 在广泛场景中有用,同时限制了有害输出(Ouyang et al.,2022 (https://arxiv.org/html/2607.27081#bib.bib2); Bai et al.,2022 (https://arxiv.org/html/2607.27081#bib.bib3); Ma et al.,2026 (https://arxiv.org/html/2607.27081#bib.bib4); Chung et al.,2024 (https://arxiv.org/html/2607.27081#bib.bib5))。这种对齐的一个已充分记录的脆弱性是,它很容易被随后的微调所破坏:即使只有少数对抗样本,有时甚至是完全良性的任务数据,也能使模型失去其安全行为(Qi et al.,2024 (https://arxiv.org/html/2607.27081#bib.bib6); Wei et al.,2023 (https://arxiv.org/html/2607.27081#bib.bib7))。这暴露了一个我们称之为“通过微调实现错位”的具体供应链威胁(Deng et al.,2025 (https://arxiv.org/html/2607.27081#bib.bib8))。攻击者分发一个微调语料库(Chae and Davidson,2025 (https://arxiv.org/html/2607.27081#bib.bib9); Bhardwaj and Poria,2023 (https://arxiv.org/html/2607.27081#bib.bib10)),或参数高效适配器(Hu et al.,2022 (https://arxiv.org/html/2607.27081#bib.bib11)),受害者采用该语料库或适配器以获得有价值专业技能。所交付的模型获得了广告宣传的技能,但同时被训练为回答危险请求(Lin et al.,2023 (https://arxiv.org/html/2607.27081#bib.bib12); Phelps and Ranson,2023 (https://arxiv.org/html/2607.27081#bib.bib13)),这两种能力纠缠在同一权重中;因为它在目标任务上表现称职,因此这种损害很容易被忽视(Betley et al.,2025 (https://arxiv.org/html/2607.27081#bib.bib14))。

一系列工作以“安全再对齐”来应对这一威胁:给定错位模型,在不从头重新训练的情况下恢复其拒绝行为(Hu et al.,2026 (https://arxiv.org/html/2607.27081#bib.bib15); Qu et al.,2025 (https://arxiv.org/html/2607.27081#bib.bib16))。代表性策略包括将微调权重的一个子集恢复为对齐模型(Yang et al.,2025 (https://arxiv.org/html/2607.27081#bib.bib17); Lin et al.,2024 (https://arxiv.org/html/2607.27081#bib.bib18)),将“安全向量”算术添加到受损权重中(Bhardwaj et al.,2024 (https://arxiv.org/html/2607.27081#bib.bib19)),通过 token 加权微调加深浅层安全对齐(Qi et al.,2025 (https://arxiv.org/html/2607.27081#bib.bib20)),以及表示空间修正(Gong et al.,2025 (https://arxiv.org/html/2607.27081#bib.bib21))。这些方法可以在有利条件下恢复对齐,但它们的保证依赖于在对抗坚决对手时很少成立的假设。我们认为并实证表明,当前再对齐防御存在三个相互关联的漏洞。

漏洞 1:*专业技能保持退化*。将模型推回其对齐状态的行为本身往往抹去了用户付费获得的下游技能,因此安全是以效用为代价获得的。漏洞 2:*对提示模板一致性的依赖*,如图 1 (https://arxiv.org/html/2607.27081#S1.F1) 所示。在实际部署中,有害行为是在一种提示模板下触发的,而防御者——并未设计攻击——必须在自己选择的模板下修复模型。我们发现,当防御模板与攻击模板不匹配时,主流方法要么无法在攻击者的通道中降低攻击成功率(ASR),要么必须以牺牲任务为代价来实现这一点,因此防御者知道攻击者模板这一隐含假设严重限制了这些防御的实际价值。漏洞 3:*缺乏鲁棒性边界*:即使在模型表面上已经再对齐并通过了其自身模板下的验收测试,恶意用户也可以仅通过重写系统提示来重新诱导有害行为(Gong et al.,2025 (https://arxiv.org/html/2607.27081#bib.bib21); Guo et al.,2026 (https://arxiv.org/html/2607.27081#bib.bib22)),这表明修复是有条件的于提示的,而非持久编码在权重中。

这三个失败有一个共同根源。现有防御将安全视为需要在观察到攻击的模板通道中重新施加的东西,无论是通过沿模板引发的安全方向编辑权重,还是通过在模板格式化的拒绝样本上重新调整。我们则采取这样的观点:攻击的持久特征存在于模型的输出概率分布中(Lyu et al.,2024 (https://arxiv.org/html/2607.27081#bib.bib23); Yang et al.,2026 (https://arxiv.org/html/2607.27081#bib.bib24)):在有害探测上,错位模型与原始对齐模型存在显著分歧——一个服从,一个拒绝——而这种分歧在不同模板下都可见。对这种分布差距进行建模并加以弥合,而不是匹配一个模板,是我们方法背后的设计原则。

我们提出了基于路由策略蒸馏(Routing-based On-Policy Distillation,ROPD),这是一种再对齐框架,旨在通过策略蒸馏(OPD)(Song and Zheng,2026 (https://arxiv.org/html/2607.27081#bib.bib25)) 来减少防御对攻击者模板的依赖。ROPD 使用两个冻结教师模型。*安全教师*,即攻击前的原始对齐模型,携带一个在很大程度上独立于表面模板而编码在其输出分布中的拒绝先验;*任务教师*,即微调后(被攻击)的模型,携带下游技能但可能生成有害响应。在再对齐过程中,每个训练 token 根据其示例来源路由到其中一个教师——有害探测路由到安全教师,任务示例路由到任务教师——并通过输出分布上的 top-KK KL 散度将学生模型与路由的教师模型进行匹配。两个教师因此实现专业化:安全来自对齐模型,任务来自微调模型,从而将先前方法混淆的两个目标解耦,如图 2 (https://arxiv.org/html/2607.27081#S1.F2) 所示。由于安全先验是从对齐分布中蒸馏而来,而非从模板格式化的拒绝样本中蒸馏,ROPD 对防御与攻击模板之间的不匹配的敏感度要低得多——不过,正如我们所示,它也并非完全免疫于此类不匹配。我们的贡献如下。

- • 我们识别并量化了模板不匹配漏洞。当防御模板与(未知的)攻击模板不匹配时,主流再对齐防御要么使攻击者的通道保持开放,要么牺牲下游任务。我们形式化了这一威胁,并设计了一个评估协议,在攻击者、防御者和跨通道中测量 ASR,使模板依赖性在四个基线、三个模型和三个任务上可测量。
- • 我们提出 ROPD 来缓解这一问题。ROPD 是一种双教师输出概率蒸馏框架,从对齐模型的输出分布中蒸馏拒绝先验,而非从模板格式化的拒绝中蒸馏,从而在保留下游技能的同时,大幅降低——尽管并非完全消除——模板不匹配风险。
- • 我们通过大量实验验证了 ROPD。在 4 个基线、3 个数据集和 3 个模型上,ROPD 是唯一一种在攻击通道和防御通道中均降低 ASR 同时保留(实际上略有提高)任务的方法,且使用的防御模板是在不了解攻击的情况下选择的;消融实验隔离了每个教师的作用。

参见图注 Figure 2:ROPD 管道概览:两个冻结教师——对齐的原始模型(拒绝先验)和微调模型(任务技能)——通过源路由的 top-KK KL 蒸馏为单个再对齐的学生模型。
## 2 相关工作

#### 对齐及其在微调下的脆弱性。

指令微调和偏好优化使基础 LLM 与人类意图和安全规范对齐(Wei et al.,2022 (https://arxiv.org/html/2607.27081#bib.bib26); Ouyang et al.,2022 (https://arxiv.org/html/2607.27081#bib.bib2); Bai et al.,2022 (https://arxiv.org/html/2607.27081#bib.bib3); Guo et al.,2025 (https://arxiv.org/html/2607.27081#bib.bib27)),但这种对齐是浅层且脆弱的。Qi et al. (2024 (https://arxiv.org/html/2607.27081#bib.bib6))表明,在少量对抗样本——甚至良性样本——上微调就能可靠地移除安全行为,而Qi et al. (2025 (https://arxiv.org/html/2607.27081#bib.bib20))将其追溯到*浅层安全对齐*,集中在最初生成的几个 token 中。越狱研究进一步表明,安全训练对提示分布偏移的泛化能力很差(Wei et al.,2023 (https://arxiv.org/html/2607.27081#bib.bib7); Zou et al.,2023 (https://arxiv.org/html/2607.27081#bib.bib28))。我们的威胁模型将此脆弱性具体化为一种供应链攻击,将有害行为与具有市场价值的下游技能共同训练。

#### 微调模型的安全再对齐。

几种防御方法(Bhardwaj et al.,2024 (https://arxiv.org/html/2607.27081#bib.bib19); Huang et al.,2024 (https://arxiv.org/html/2607.27081#bib.bib29))在模型被错位后恢复对齐。(Yang et al.,2025 (https://arxiv.org/html/2607.27081#bib.bib17))将微调权重的一小部分子集朝向对齐方向恢复(我们称这一家族为*rollback*);RESTA(Bhardwaj et al.,2024 (https://arxiv.org/html/2607.27081#bib.bib19))通过任务算术添加一个预计算的安全向量(Ilharco et al.,2023 (https://arxiv.org/html/2607.27081#bib.bib30));Qi et al. (2025 (https://arxiv.org/html/2607.27081#bib.bib20))提出了一种 token 加权目标(*soft-SFT*),将安全对齐加深到首 token 之外;Gong et al. (2025 (https://arxiv.org/html/2607.27081#bib.bib21))提出了一种表示空间防御(SSRD),将内部表示修正为安全表示。这些方法的机制不同,但共同依赖于模板一致的监督——每种方法在修复使用与攻击者相同的提示通道时最有效——我们证明这一假设是脆弱的。

#### 用于 LLM 的知识蒸馏。

知识蒸馏将行为从教师分布转移到学生(Hinton et al.,2015 (https://arxiv.org/html/2607.27081#bib.bib31); Wang et al.,2026 (https://arxiv.org/html/2607.27081#bib.bib32)),最近对策略蒸馏(OPD)的分析(Zhang et al.,2026 (https://arxiv.org/html/2607.27081#bib.bib33))阐明了蒸馏的内容以及教师质量如何影响学生(Li et al.,2026 (https://arxiv.org/html/2607.27081#bib.bib34); Agarwal et al.,2024 (https://arxiv.org/html/2607.27081#bib.bib35); Fu et al.,2026 (https://arxiv.org/html/2607.27081#bib.bib36))。ROPD 通过使用两个具有互补优势的冻结教师模型,并针对每个示例进行路由监督,将蒸馏适应于再对齐场景,从而从不同来源蒸馏安全能力和任务能力——这是一种双教师、源路由的蒸馏,此前未用于模板鲁棒的安全再对齐。

## 3 用于 LLM 再对齐的鲁棒 OPD

### 3.1 威胁模型与记号

令M0M\_\{0\}表示原始的安全对齐 LLM。攻击者在由下游任务语料和有害语料组成的混合语料上微调M0M\_\{0\},产生一个错位模型MaM\_\{a\},它保留了下游技能,同时服从有害请求。按照我们自始至终采用的数据-模板解耦方法,每个训练或评估示例存储为原始 \{prompt, response\} 对,并在使用时在提示模板T∈\{raw,self,attack\}T\\in\\\{\\textsc\{raw\},\\textsc\{self\},\\textsc\{attack\}\\\}下渲染,其中raw是最小模板,self是模型的原生聊天模板,attack是攻击者定制的专属模板;每种基础模型(Llama-2、Qwen2.5 和 Gemma-2)的三个模板的确切渲染方式见补充材料。攻击者在*攻击模板*TaT\_\{a\}下嵌入有害行为;防御者无法观察TaT\_\{a\},必须使用*防御模板*Td∈\{raw,self\}T\_\{d\}\\in\\\{\\textsc\{raw\},\\textsc\{self\}\\\}进行再对齐。我们用πθ\(⋅∣x<t\)\\pi\_\{\\theta\}(\\cdot\\mid x\_\{<t\})表示参数为θ\\theta的模型在给定上下文x<tx\_\{<t\}时位置tt处的下一个 token 分布。

### 3.2 双教师输出概率蒸馏

ROPD 将错位模型MaM\_\{a\}再对齐为学生πθ\\pi\_\{\\theta\},该学生从MaM\_\{a\}初始化,并使用两个冻结教师。*安全教师*πsafe\\pi\_\{\\text\{safe\}\}是原始对齐模型M0M\_\{0\};在有害探测上,其输出分布将质量放在拒绝上,并且这种拒绝先验在很大程度上跨表面模板得以保留。*任务教师*πtask\\pi\_\{\\text\{task\}\}就是错位模型MaM\_\{a\}本身;在任务输入上,其输出分布编码了我们希望保留的专业技能。再对齐使用混合语料D=Dtask∪DharmD=D\_\{\\text\{task\}\}\\cup D\_\{\\text\{harm\}\},其中DtaskD\_\{\\text\{task\}\}是下游任务对,DharmD\_\{\\text\{harm\}\}是从安全数据集中抽取的有害提示。每个示例xx携带源标签s\(x\)∈\{task,harm\}s\(x\)\\in\\\{\\text\{task\},\\text\{harm\}\\\},所有示例均在防御模板TdT\_\{d\}下渲染。

核心设计选择是将蒸馏

相似文章

使用基于策略的自蒸馏方法降低LLM安全对齐中的安全税

arXiv cs.LG

本文介绍了OPSA,一种用于LLM安全对齐的基于策略的自蒸馏方法,该方法通过在模型自身的轨迹上进行训练,并使用教师翻转率激活潜在的安全推理,从而降低了安全税,在多个模型规模上实现了更强的安全-推理权衡。

基于前缀重放的多轮在线策略蒸馏

Hugging Face Daily Papers

本文提出 ReOPD,一种用于 LLM 智能体的在线策略蒸馏方法,该方法重用预先收集的教师轨迹作为重放前缀,无需新的环境交互即可提高效率和准确性。

传递接力棒:轨迹中继在策略蒸馏

arXiv cs.CL

提出中继在策略蒸馏(Relay-OPD),通过在检测到的交接触发点让教师短暂接管以纠正推理轨迹,解决了在策略蒸馏中的前缀失败问题。在数学推理基准上实现一致改进,并将训练轨迹长度减少超过50%。

揭秘 On-Policy Distillation:角色、病理与调控

Hugging Face Daily Papers

本文系统研究了LLM后训练中的on-policy distillation,阐明了其作为探索催化剂的作用,并识别了Student-Teacher Mismatch和Length Exploitation等病理现象,提出了轻量级信号调控方法。