面向安全对齐的课程学习

arXiv cs.LG 论文

摘要

本文提出Staged-Competence,一种基于课程学习的DPO安全对齐框架,它按难度组织偏好数据,显著提升鲁棒性和数据效率,同时保持通用能力。

arXiv:2605.26315v1 公告类型: 新 摘要: 直接偏好优化(DPO)被广泛用于大型语言模型的安全对齐。然而,先前工作表明DPO脆弱且分布外(OOD)泛化能力差。本文研究课程学习能否提升DPO安全对齐的鲁棒性。我们提出Staged-Competence,一种基于课程学习的框架,它按难度组织偏好数据,采用基于能力的采样,并在训练过程中逐步更新参考模型。在三个模型家族上的平均结果显示,Staged-Competence将OOD有害响应率降低16%,越狱攻击成功率降低20%,同时保持通用能力且几乎不产生过度拒绝。我们进一步表明,Staged-Competence(1)仅使用75%的训练数据即可达到基线安全性,(2)能更好地区分安全与不安全响应。Staged-Competence不依赖特定的策略优化损失函数,可扩展到其他DPO变体及对齐领域。我们的代码和数据可在 https://github.com/Sandeep5500/curriculum-learning-for-safety 获取。
查看原文
查看缓存全文

缓存时间: 2026/05/27 09:08

# 面向安全对齐的课程学习  
**来源**:https://arxiv.org/html/2605.26315  

Sandeep Kumar  
卡内基梅隆大学  
\[sandeep3@andrew\.cmu\.edu\]  

&Virginia Smith  
卡内基梅隆大学  
\[smithv@cmu\.edu\]  

&Chhavi Yadav  
卡内基梅隆大学¹¹  
¹¹ 西蒙斯研究所,加州大学伯克利分校  
\[cyadav@andrew\.cmu\.edu\]  

###### 摘要  
直接偏好优化(DPO)是一种广泛使用的安全对齐方法,旨在减少大语言模型中的有害行为。然而,先前的研究表明,DPO 具有脆弱性,且表现出较差的分布外(OOD)泛化能力\[19 (https://arxiv.org/html/2605.26315#bib.bib13)\]。在本文中,我们研究课程学习能否提升基于 DPO 的安全对齐的鲁棒性。我们提出 **Staged-Competence**,一种基于课程的框架,该框架按难度组织偏好数据,采用基于能力的采样,并在训练过程中逐步更新参考模型。跨三个模型家族平均,Staged-Competence 将 OOD 有害响应率降低 16%,越狱攻击成功率降低 20%,同时保留通用能力并保持近乎零的过度拒绝。我们进一步证明 Staged-Competence 能够:(1) 在仅使用 75% 训练数据的情况下匹配基线安全性能,展现了更高的数据效率;(2) 实现安全与不安全响应之间更好的分离。Staged-Competence 与底层策略优化损失无关,并可扩展到其他 DPO 变体和安全之外的 alignment 领域。我们的代码和数据可在以下地址获取:https://github.com/Sandeep5500/curriculum-learning-for-safety。  

## 1 引言  

大语言模型(LLM)的安全对齐旨在确保模型拒绝有害请求,同时保持对良性请求的有用性\[2 (https://arxiv.org/html/2605.26315#bib.bib9)\]。直接偏好优化(DPO)\[21 (https://arxiv.org/html/2605.26315#bib.bib2)\] 已成为一种流行方法,它从人工标注的安全与不安全响应的偏好对中学习,无需单独的奖励模型。然而,标准 DPO 被发现对简单的越狱攻击脆弱\[29 (https://arxiv.org/html/2605.26315#bib.bib10),19 (https://arxiv.org/html/2605.26315#bib.bib13)\],并且无法泛化到分布外的情况\[14 (https://arxiv.org/html/2605.26315#bib.bib29),20 (https://arxiv.org/html/2605.26315#bib.bib12),12 (https://arxiv.org/html/2605.26315#bib.bib23),6 (https://arxiv.org/html/2605.26315#bib.bib27)\]。另一方面,课程学习\[3 (https://arxiv.org/html/2605.26315#bib.bib3),7 (https://arxiv.org/html/2605.26315#bib.bib19),24 (https://arxiv.org/html/2605.26315#bib.bib20)\] 已被证明能够通过将示例从简单到困难排序,让学习者在面对更有挑战性的概念之前先建立对简单概念的理解,从而教导模型更鲁棒的特征。虽然这一原理已应用于机器翻译\[18 (https://arxiv.org/html/2605.26315#bib.bib4)\]、预训练\[4 (https://arxiv.org/html/2605.26315#bib.bib28),25 (https://arxiv.org/html/2605.26315#bib.bib21)\]、通用对齐\[17 (https://arxiv.org/html/2605.26315#bib.bib5),13 (https://arxiv.org/html/2605.26315#bib.bib22)\] 等任务,但其在*安全*对齐上的潜力基本上未被探索。这引出了我们的问题:课程学习能否带来更鲁棒的安全对齐?  

在这项工作中,我们研究了上述问题,并首次对基于 DPO 的安全对齐的课程学习策略进行了系统性研究。尽管课程学习在此场景中是一种自然的工具,但偏好数据带来了一个关键挑战:偏好对的难度不仅取决于语言复杂性,还取决于未对齐模型已经能多好地区分安全与不安全行为。为解决这一问题,我们提出了一种称为 **偏好对齐间隔(preference alignment margin)** 的难度分数,该分数根据模型已能多好地区分安全与不安全响应来对样本进行排序。接下来,我们提出了一种课程训练算法 **Staged-Competence**,该算法通过基于能力的采样在训练过程中逐步扩大合格示例池,并在不同阶段之间逐步更新参考策略模型。我们的实验证明了 Staged-Competence 在学习安全对齐的鲁棒特征方面的有效性:跨三个模型家族,它将 OOD 有害响应率降低 16%,攻击成功率降低 20%,且不降低通用能力;实现了约 ∼3× 更大的奖励间隔分离度;将安全对齐扩展到前几个 token 之外;使用 25% 更少的数据匹配基线安全性;并随着模型规模的增长优雅地扩展。我们还系统地消融了课程设计选择,包括排序、阶段内采样和参考模型更新,展示了每个选择如何影响三种模型架构的安全鲁棒性。此外,我们在两个流行的安全数据集 PKU-SafeRLHF\[10 (https://arxiv.org/html/2605.26315#bib.bib8)\] 和 HH-RLHF\[2 (https://arxiv.org/html/2605.26315#bib.bib9)\] 中发现了广泛的偏好对不一致性,并开发了一个清洗后合并的数据集 **Cleaned-PKU-HH-SafeRLHF**,用于基于 DPO 的安全训练,该数据集与我们的代码一同发布。Staged-Competence 与底层策略优化损失无关,因此不仅限于 DPO,还可以应用于安全以外的对齐领域。  

参考图说明  

图 1:Staged-Competence 流水线概览(以 K=3 为例)。**阶段 1(评分)**:一个依赖于模型的偏好对齐间隔 m_i 产生全局简单到困难的偏好对排序。**阶段 2(训练)**:排序后的数据被分成 K 个桶,采用阶段内能力采样和阶段间参考模型更新(π_ref^(k+1) = π^(k))。  

## 2 相关工作  

#### 课程学习。  
Bengio 等人\[3 (https://arxiv.org/html/2605.26315#bib.bib3)\] 引入了课程学习,表明将训练示例从简单到困难排序比随机呈现能改善收敛速度。后续工作表明,这种排序不仅改善收敛速度,还能改善深度网络最终泛化能力\[7 (https://arxiv.org/html/2605.26315#bib.bib19)\],一项更广泛的综述综合了证据,表明基于课程的排序能提升机器学习领域中的鲁棒性和分布外泛化能力\[24 (https://arxiv.org/html/2605.26315#bib.bib20)\]。  
Platanios 等人\[18 (https://arxiv.org/html/2605.26315#bib.bib4)\] 随后通过一种*基于能力*的公式将这些思想扩展到神经机器翻译,其中不断增长的合格示例池以逐渐变慢的速度引入更难的案例。  

#### 面向 LLM 的课程学习。  
课程学习最近已被适用于大语言模型训练。Xie 等人\[25 (https://arxiv.org/html/2605.26315#bib.bib21)\] 使用一个在训练过程中对领域进行重新加权的代理模型来优化预训练数据混合,实现了更快的收敛和更强的下游性能。Li 等人\[13 (https://arxiv.org/html/2605.26315#bib.bib22)\] 引入了一种面向指令微调的能力感知课程调度,动态调整示例难度以匹配模型的能力。两者都针对通用能力而非安全对齐,使得基于课程的安全对齐尚未充分探索。  

#### 面向对齐的课程方法。  
最相关的先前工作是 Curri-DPO\[17 (https://arxiv.org/html/2605.26315#bib.bib5)\],它通过难度分层阶段和阶段间参考模型更新将课程学习与 DPO 结合;我们在第 3.2 节中更详细地讨论它。  

#### DPO 安全脆弱性与鲁棒性。  
越来越多的研究表明基于 DPO 的安全对齐是脆弱的:Qi 等人\[19 (https://arxiv.org/html/2605.26315#bib.bib13)\] 证明安全对齐是浅层的,集中在前几个输出 token 上;Qi 等人\[20 (https://arxiv.org/html/2605.26315#bib.bib12)\] 表明即使是适度的微调也能危及安全。另一条并行的工作线针对 DPO 的目标:Meng 等人\[16 (https://arxiv.org/html/2605.26315#bib.bib24)\] 移除参考模型和长度偏差以稳定训练;Ethayarajh 等人\[5 (https://arxiv.org/html/2605.26315#bib.bib25)\] 将 DPO 重新表述为前景理论,以在偏斜数据下获得更好的行为。针对安全方面,Zhao 等人\[28 (https://arxiv.org/html/2605.26315#bib.bib16)\] 引入了双目标 DPO;Kim 等人\[11 (https://arxiv.org/html/2605.26315#bib.bib26)\] 用显式安全约束重新表述了 DPO。我们的方法保持标准 DPO 损失不变,因此与这些目标层面的改进兼容。  

## 3 预备知识  

### 3.1 DPO 问题公式化  

给定一个安全偏好数据集 D = {(x_i, y_i^+, y_i^-)}_{i=1}^N,包含 N 个样本,其中 x_i 是输入提示,y_i^+ 是安全(被选择)响应,y_i^- 是不安全(被拒绝)响应。直接偏好优化(DPO)\[21 (https://arxiv.org/html/2605.26315#bib.bib2)\] 通过最小化以下损失来训练策略 π_θ:  

\[
\mathcal{L}_{\text{DPO}}(\theta) = -\mathbb{E}_{(x,y^+,y^-) \sim \mathcal{D}} \left[ \log \sigma\left( \beta \left( \log\frac{\pi_\theta(y^+|x)}{\pi_{\text{ref}}(y^+|x)} - \log\frac{\pi_\theta(y^-|x)}{\pi_{\text{ref}}(y^-|x)} \right) \right) \right].
\]  

其中 π_ref 是固定的参考策略,β 控制偏离惩罚的强度。在标准 DPO 中,每个步骤均匀随机采样训练样本,参考策略 π_ref 在整个训练过程中保持不变。  

### 3.2 课程训练方法  

#### 基于能力的课程学习。  
课程学习中的一个关键挑战是控制引入更困难示例的速率。如果新的、更难的示例添加得太快,学习者可能没有足够的时间吸收它们,然后更难的例子又出现了\[18 (https://arxiv.org/html/2605.26315#bib.bib4)\]。基于能力的方法通过维护一个不断增长的训练数据子集(从中采样小批量)来解决这个问题:在训练的任何时刻,只有难度不超过某个阈值的样本才是合格的,并且这个阈值根据一个调度函数逐渐扩大。形式上,每个样本根据其在排序好的训练集中的排名被分配一个标准化难度 d_i = (rank(i)-1)/(N-1),其中 rank(i) ∈ {1, ..., N} 将样本从最简单(1)到最难(N)排序。在总步数为 T 的训练步骤 t 处,一个能力函数 c(t) 确定难度阈值,只有满足 d_i ≤ c(t) 的样本才被纳入合格池中用于小批量采样。Platanios 等人\[18 (https://arxiv.org/html/2605.26315#bib.bib4)\] 提出了平方根调度 c(t) = √((1-c0²) t/T + c0²),其中 c0 是初始能力常数。这种形式确保更难的示例以递减的速率引入,让模型在添加更多之前有时间巩固每一波。该方法最初是为使用 RNN 和早期 Transformer 的机器翻译开发的;我们将其适用于现代 LLM 和基于 DPO 的安全对齐。  

#### Curri-DPO。  
在标准 DPO 和上述基于能力的方法中,参考模型 π_ref 在整个训练过程中保持不变。Pattnaik 等人\[17 (https://arxiv.org/html/2605.26315#bib.bib5)\] 提出将训练数据分成 K 个难度分层的桶,并运行 K 个阶段的训练,在阶段之间更新参考模型,使得每个阶段的策略可以专注于吸收当前难度桶,而不必重新学习之前已经获得的内容:π_ref^(k+1) = π^(k)。原始工作设置 K=3 个桶,并在一个每个提示对应四个候选响应的训练数据集上运行。用于课程排序的难度是*局部*定义的(在每个提示内部),而非跨整个数据集:四个响应由外部评判者(如 GPT-4 或人类)从最佳 (R1) 到最差 (R4) 排序,形成难度递增的三个偏好对——(R1,R4) 容易、(R1,R3) 中等、(R1,R2) 困难——其中难度对应于两个响应之间的质量差距。对于每个提示,其三个偏好对被放入对应的桶中。由于这种局部方案无法在不同提示之间比较难度——一个提示的“容易”对可能比另一个提示的“困难”对要难得多——每个桶内的样本在其对应的训练阶段只是简单地随机打乱。Curri-DPO 最初是为通用有益性对齐开发的;我们基于其分阶段参考更新机制,并将其扩展到安全对齐,使用全局的、依赖于模型的难度排序,将每个偏好对置于单个可比较的轴上。  

## 4 方法论  

课程学习通常包含两个组件:(1) 一个难度评分阶段,定义训练数据的有意义排序;(2) 一个训练算法,决定课程在学习过程中如何施加。我们在基于 DPO 的安全对齐背景下描述两者,并提出 **Staged-Competence**,一种用于安全训练的新课程学习框架。  

### 4.1 阶段 1:难度评分  

给定一个安全偏好数据集 D = {(x_i, y_i^+, y_i^-)}_{i=1}^N,我们的目标是构建一个课程,根据模型相对难度对训练样本进行排序。我们不依赖静态启发式方法,而是以*依赖于模型*的方式定义难度,反映当前(未对齐的)基础模型区分安全与不安全响应的能力。这确保了课程是针对特定模型及其特定偏差/行为定制的。在高层次上,我们通过将输入提示传递给未对齐模型,获取其零样本响应,并将该响应与所提供的安全和不安全响应进行比较来测量样本的难度。直观地说,如果模型已经产生更接近安全响应的输出,则样本更容易;如果其输出更接近不安全替代答案,则样本更难。  

为了实现这一点,对于每个提示 x_i,我们从基础模型生成一个零样本响应 ŷ_i,并计算 ŷ_i、y_i^+ 和 y_i^- 的嵌入。然后我们定义一个**偏好对齐间隔**:  

\[
m_i = \cos(e_{\hat{y}_i}, e_{y_i^+}) - \cos(e_{\hat{y}_i}, e_{y_i^-}),
\]  

其中 e(·) 表示归一化的句子嵌入。大的正间隔表示模型的输出已经与安全响应一致,而小或负的间隔表示不一致,因此难度更高。我们按 margin m_i 的降序(从易到难)对训练集进行排序。

相似文章

DOG-DPO:面向安全对齐的几何动态优化

arXiv cs.LG

DOG-DPO 是一种无需训练的数据选择框架,它将偏好对视为结构化几何信号,将多数据集偏好几何分解为锚定子空间和残差子空间,以选择多样化的子集用于安全对齐。该框架在六个安全基准测试中仅使用 11% 的偏好对就实现了强大的效用-鲁棒性权衡。

使用基于策略的自蒸馏方法降低LLM安全对齐中的安全税

arXiv cs.LG

本文介绍了OPSA,一种用于LLM安全对齐的基于策略的自蒸馏方法,该方法通过在模型自身的轨迹上进行训练,并使用教师翻转率激活潜在的安全推理,从而降低了安全税,在多个模型规模上实现了更强的安全-推理权衡。

TRACE:基于轨迹的LLM训练后重对齐安全补丁学习

arXiv cs.LG

TRACE提出了一种基于轨迹的安全补丁学习框架,用于LLM训练后重对齐。该框架学习一个插件式补丁,在任务相关方向上干扰最小,同时果断控制不安全行为,在基准测试中实现接近100%的安全性,同时保持实用性。

面向鲁棒即插即用适配的解耦对齐

arXiv cs.CL

介绍了一种无需训练的方法,通过知识蒸馏和模型融合来增强LLMs的安全对齐,以防止影子对齐,在有害问题数据集上将防御成功率提高了14.42%,且不影响性能。