噪声偏好标签下无元数据的元加权直接偏好优化

arXiv cs.LG 论文

摘要

本文针对噪声偏好标签下的直接偏好优化,提出了一种双层优化框架,引入了一种无元数据的元加权方法,该方法使用中心差分近似和LoRA微调来提高对齐性能。

arXiv:2607.09796v1 公告类型:新 摘要:直接偏好优化(DPO)已成为将大型语言模型(LLMs)与人类偏好对齐的重要方法,因为它无需显式奖励建模和强化学习优化。然而,其性能严重依赖于偏好数据的质量,而现实环境中的噪声偏好数据会削弱对齐性能。为解决这一问题,我们提出了一种双层优化框架,并在一定假设下证明,该框架能够在清洁数据下恢复DPO最优解。我们进一步推导了非对称标签翻转噪声下可学习加权函数的先验形式。考虑到高质量元数据可能难以获取,我们提出了一种任务无关的元知识驱动方法,即使在元数据完全不可用的情况下也能实现元学习。为了降低LLM元学习中高阶梯度的昂贵成本,我们将中心差分近似与LoRA微调相结合,开发了一种可扩展的训练方案。在TL;DR摘要和Anthropic HH单轮对话上的实验表明,所提方法在不同噪声率下均能提升多个DPO基线的训练性能。
查看原文
查看缓存全文

缓存时间: 2026/07/14 04:14

# 无元数据下基于噪声偏好标签的元加权直接偏好优化

来源:https://arxiv.org/html/2607.09796

Yifan Li  
西安交通大学  
[email protected]

Xiaodong Yuan  
西安交通大学  
[email protected]

###### 摘要

直接偏好优化(DPO)已成为将大型语言模型(LLMs)与人类偏好对齐的重要方法,因为它消除了显式奖励建模和强化学习优化的需求。然而,其性能在很大程度上依赖于偏好数据的质量,真实场景中存在噪声的偏好数据会削弱对齐性能。为解决这一问题,我们提出了一种双层优化框架,并在特定假设下证明该框架能够在干净数据下恢复DPO最优解。我们进一步推导了在非对称标签翻转噪声下可学习加权函数的先验形式。考虑到高质量元数据可能难以获取,我们提出了一种任务无关的元知识驱动方法,即使在元数据完全不可用时也能进行元学习。为降低LLM元学习中高阶梯度的高昂成本,我们将中心差分近似与LoRA微调相结合,开发了一种可扩展的训练方案。在TL;DR摘要和Anthropic HH单轮对话上的实验表明,在不同噪声率下,所提方法相较于多个DPO基线提升了训练性能。

*关键词*直接偏好优化 · 偏好噪声 · 元学习 · 提示增强一致性 · 有限差分 · LoRA微调

## 1 引言

将大型语言模型(LLMs)与人类偏好对齐至关重要[1 (https://arxiv.org/html/2607.09796#bib.bib1),2 (https://arxiv.org/html/2607.09796#bib.bib2),3 (https://arxiv.org/html/2607.09796#bib.bib3)]。基于人类反馈的强化学习(RLHF)已被证明能有效将LLMs与人类偏好对齐[4 (https://arxiv.org/html/2607.09796#bib.bib4)]。典型的RLHF流程首先通过监督微调获得SFT策略,然后从人类偏好数据中学习奖励模型(RM),最后在约束其与参考模型距离以避免策略漂移过大的同时,使用PPO等强化学习算法优化策略。尽管RLHF在LLM对齐中发挥重要作用,但其训练流程相对复杂,需要额外训练奖励模型和策略模型,且强化学习阶段涉及频繁采样,导致计算和内存成本较高[5 (https://arxiv.org/html/2607.09796#bib.bib5),6 (https://arxiv.org/html/2607.09796#bib.bib6)]。直接偏好优化(DPO)为偏好对齐提供了一种更简单的替代方案:它直接从人类偏好数据优化LLM,无需显式学习奖励模型,避免了强化学习的复杂性[7 (https://arxiv.org/html/2607.09796#bib.bib7)]。尽管极大简化了传统RLHF流程,DPO仍高度依赖偏好数据的质量。先前研究表明,偏好数据中的噪声会损害对齐训练的稳定性和最终性能[8 (https://arxiv.org/html/2607.09796#bib.bib8),9 (https://arxiv.org/html/2607.09796#bib.bib9)]。因此,在噪声偏好数据下进行有效的DPO学习已成为偏好对齐中的一个重要问题。

现有工作主要通过损失校正、标签平滑、分布鲁棒优化或噪声样本过滤等方法提升DPO对噪声的鲁棒性[10 (https://arxiv.org/html/2607.09796#bib.bib10),11 (https://arxiv.org/html/2607.09796#bib.bib11),12 (https://arxiv.org/html/2607.09796#bib.bib12),13 (https://arxiv.org/html/2607.09796#bib.bib13),14 (https://arxiv.org/html/2607.09796#bib.bib14),15 (https://arxiv.org/html/2607.09796#bib.bib15)]。然而,这些方法通常依赖预定义的噪声形式、固定的重加权规则或启发式可靠性估计,难以在复杂噪声条件下同时保持可解释性和训练效果。

最近,一些研究将元学习引入偏好优化,以自适应地表征噪声偏好样本并学习样本级权重[16 (https://arxiv.org/html/2607.09796#bib.bib16),17 (https://arxiv.org/html/2607.09796#bib.bib17)]。这些方法表明,元学习相比固定启发式规则,能为噪声偏好样本提供更灵活的加权机制。然而,现有基于元学习的加权偏好优化方法主要从训练动态、模型诊断信号或验证集性能中学习样本权重。它们并未从噪声与干净条件偏好后验差异的角度系统解释双层加权机制为何能校正DPO中由噪声偏好引起的最优解偏移。此外,这些方法通常仍需要一个具有相对可靠偏好标签的验证集或少量干净元数据来提供外层优化信号。在实际LLM对齐场景中,构建高质量元偏好数据往往需要额外标注、模型审查或人工清洗,成本高昂甚至不可用。

为此,我们从条件风险和后验偏移的角度重新审视噪声偏好下的DPO学习,并提出一种不依赖干净元偏好标签的提示增强一致性元加权DPO方法,称为PACMR-DPO。本文贡献总结如下:

- •我们证明,在理想条件下,双层优化能从噪声训练数据中恢复干净数据下的DPO最优解,从而为可学习权重参数化提供理论基础。
- •我们提出一种不依赖干净元数据的提示增强一致性DPO方法。该方法不依赖干净元偏好标签,而是将任务无关的提示增强一致性作为元知识注入外层优化。
- •为解决LLM元学习中高阶梯度的高成本问题,我们提出一种可扩展的训练方案,将中心差分近似与LoRA参数空间扰动相结合,降低了双层优化的内存和计算开销。
- •我们在TL;DR摘要和Anthropic HH单轮对话上评估所提方法,并在不同随机翻转噪声率下与多个DPO基线进行比较。实验表明,PACMR-DPO在中高噪声率下取得了更显著的改进。

## 2 相关工作

### 2.1 直接偏好优化

RLHF已成为将LLMs与人类偏好对齐的重要方法[4 (https://arxiv.org/html/2607.09796#bib.bib4)],但其训练过程通常包含SFT、RM学习和强化学习微调,复杂且计算密集。在此背景下,DPO为RLHF提供了一种更简单的替代方案[7 (https://arxiv.org/html/2607.09796#bib.bib7)]。对于偏好数据\((x, y_a, y_b)\),DPO损失定义为

\[
\mathcal{L}_{\mathrm{DPO}}(\omega) = -\mathbb{E}_{(x,y_a,y_b)\sim D_{\mathrm{train}}}\left[\log\sigma\left(\beta\log\frac{\pi_{\omega}(y_a\mid x)}{\pi_{\mathrm{ref}}(y_a\mid x)} - \beta\log\frac{\pi_{\omega}(y_b\mid x)}{\pi_{\mathrm{ref}}(y_b\mid x)}\right)\right],
\tag{1}
\]

其中\(\sigma(r)=1/(1+\exp(-r))\)为sigmoid函数,\(\beta>0\)为DPO温度参数。DPO避免了显式奖励建模和强化学习,从而大幅降低了偏好对齐的训练成本。

### 2.2 带噪声标签的鲁棒偏好学习

先前研究表明,用于LLM训练的偏好数据可能包含不可忽视的噪声,且对齐性能随噪声率增加而下降[8 (https://arxiv.org/html/2607.09796#bib.bib8)]。为解决此问题,cDPO利用噪声率将DPO中的硬标签平滑为软标签,减少错误标注偏好样本造成的损害[13 (https://arxiv.org/html/2607.09796#bib.bib13)];rDPO构建去偏加权损失,抵消错误偏好标注对DPO训练的影响[10 (https://arxiv.org/html/2607.09796#bib.bib10)];Dr.DPO将分布鲁棒优化与DPO结合,提升对噪声数据的鲁棒性[11 (https://arxiv.org/html/2607.09796#bib.bib11)];ROPO抑制高不确定性样本的梯度,并在噪声容忍训练与噪声样本过滤之间交替,以提升鲁棒性[14 (https://arxiv.org/html/2607.09796#bib.bib14)];R3M将损坏的偏好标签建模为稀疏异常点[12 (https://arxiv.org/html/2607.09796#bib.bib12)];PerpCorrect通过偏好对内的困惑度差异检测并纠正噪声标签[15 (https://arxiv.org/html/2607.09796#bib.bib15)]。与这些方法不同,我们将噪声偏好学习中的样本可靠性建模为可学习的样本级加权函数,并使用双层优化根据外层目标自适应调整训练样本对LLM更新的影响。

### 2.3 偏好加权的元学习

MetaPO认为样本价值不仅由当前模型状态决定,还会在训练过程中动态变化。因此,它利用三种时间动态特征——奖励边际演化、学习波动和对参考模型的偏离——为每个偏好样本学习时间感知权重[17 (https://arxiv.org/html/2607.09796#bib.bib17)]。Aligner, Diagnose Thyself认为偏好样本的可靠性无法通过单一启发式指标完全捕获。它从偏好一致性、学习难度和生成置信度构建诊断向量,并使用元学习网络将这些内部反馈信号融合为样本级权重[16 (https://arxiv.org/html/2607.09796#bib.bib16)]。与这些方法不同,本文不主要依赖经验动态特征或诊断信号来定义样本可靠性,而是从噪声与干净偏好之间的后验偏移出发,分析为何双层优化能校正DPO中由噪声偏好引起的最优解偏移。基于此分析,我们进一步设计了可学习加权函数的先验,并用提示增强一致性目标替代依赖干净元数据的外层监督目标。

### 2.4 噪声监督下的元学习样本重加权

在噪声标签学习中,基于元学习的样本重加权是一类重要方法。Meta-Weight-Net (MWN) 通过学习从样本损失到样本权重的显式映射,自适应地降低噪声或困难样本的影响[18 (https://arxiv.org/html/2607.09796#bib.bib18)]。CMW-Net 扩展了 MWN,通过学习类别感知的样本加权函数,显式建模类别依赖的异质噪声和不平衡[19 (https://arxiv.org/html/2607.09796#bib.bib19)]。DAC-MR 针对高质量元数据难以获取(可能甚至不可用)的问题,引入数据增强一致性作为替代元目标,并使用任务无关的元知识补偿传统数据驱动的元学习[20 (https://arxiv.org/html/2607.09796#bib.bib20)]。我们将这一思想迁移到基于 DPO 的偏好优化中,并围绕偏好对构建提示增强一致性目标。

## 3 问题形式化

### 3.1 噪声成对偏好学习

令 \(Z\) 表示取值于 \(\mathcal{Z}\) 的随机变量,\(z\) 为 \(Z\) 的一个实现。我们考虑偏好样本 \(z=(x,y_a,y_b)\in\mathcal{Z}\),其中 \(x\) 表示提示,\(y_a\) 和 \(y_b\) 表示两个候选回复。设潜在干净偏好标签为 \(Y\in\{0,1\}\),其中 \(Y=0\) 表示 \(y_a\succ y_b\),\(Y=1\) 表示 \(y_a\prec y_b\)。实践中,模型通常观察到的是噪声标签 \(\widetilde{Y}\in\{0,1\}\) 而非干净标签。为描述训练集和元数据集的采样过程,我们用 \(m=0\) 表示样本被选入元数据集,\(t=0\) 表示样本被选入训练集。

###### 假设 1 (标签无关采样)  
我们假设样本进入元数据集或训练集的概率与潜在干净偏好标签无关,且每个样本被选入两个集的概率均为正,即

\[
\begin{aligned}
\mathbb{P}(m=0\mid Y=y,Z=z) &= \mathbb{P}(m=0\mid Z=z) > 0, \quad \forall z\in\mathcal{Z}, y\in\{0,1\}, \tag{2} \\
\mathbb{P}(t=0\mid Y=y,Z=z) &= \mathbb{P}(t=0\mid Z=z) > 0, \quad \forall z\in\mathcal{Z}, y\in\{0,1\}. \tag{3}
\end{aligned}
\]

定义
\[
\eta(z) = \mathbb{P}(Y=0\mid Z=z) \in (0,1), \tag{4}
\]
\[
\eta_{\mathrm{meta}}(z) = \mathbb{P}(Y=0\mid Z=z, m=0) \in (0,1), \tag{5}
\]
\[
\eta_{\mathrm{train}}(z) = \mathbb{P}(Y=0\mid Z=z, t=0) \in (0,1). \tag{6}
\]

在假设1下,干净偏好后验在总体分布、训练分布和元分布下相同。

###### 命题 1 (标签无关采样下的后验不变性)  
在假设1下,对任意 \(z\in\mathcal{Z}\),有
\[
\eta_{\mathrm{train}}(z) = \eta_{\mathrm{meta}}(z) = \eta(z). \tag{7}
\]

###### 证明  
由贝叶斯法则和假设1,
\[
\begin{aligned}
\eta_{\mathrm{meta}}(z) &= \mathbb{P}(Y=0\mid Z=z, m=0) \\
&= \frac{\mathbb{P}(m=0\mid Y=0,Z=z)\mathbb{P}(Y=0\mid Z=z)}{\sum_{y\in\{0,1\}}\mathbb{P}(m=0\mid Y=y,Z=z)\mathbb{P}(Y=y\mid Z=z)} \\
&= \frac{\mathbb{P}(m=0\mid Z=z)\eta(z)}{\mathbb{P}(m=0\mid Z=z)\eta(z) + \mathbb{P}(m=0\mid Z=z)(1-\eta(z))} \\
&= \eta(z).
\end{aligned}
\]
类似地,将 \(m\) 替换为 \(t\) 可得 \(\eta_{\mathrm{train}}(z)=\eta(z)\)。因此 \(\eta_{\mathrm{train}}(z)=\eta_{\mathrm{meta}}(z)=\eta(z)\)。∎

我们进一步考虑一般的噪声条件概率 \(q: \mathcal{Z}\to(0,1)\),其中
\[
q(z) = \mathbb{P}(\widetilde{Y}=0\mid Z=z, t=0), \tag{12}
\]
表示样本 \(z\) 在被选入训练集并经噪声机制处理后,观测到标签为0的条件概率。

相似文章

分布鲁棒的列表级偏好优化

arXiv cs.AI

本文提出一种用于LLM对齐的分布鲁棒列表级偏好优化方法,处理排序标签不确定性,具有可处理的目标函数和强收敛性保证。

偏好优化的归一化奖励

arXiv cs.LG

本文引入了一种用于直接对齐算法(DAAs)的正则化技术,该技术保持归一化的响应概率,从而缓解过度优化和似然偏移。该方法提升了生成质量和基准性能,在AlpacaEval2上实现了超过20%的相对提升,并在Llama-3.1-8B-Instruct的通用基准上获得9%的性能增益。

基于注意力机制的Token加权直接偏好优化

arXiv cs.CL

提出AttentionPO,一种基于Token加权的直接偏好优化方法,它利用LLM自身的注意力来估计Token权重,在AlpacaEval、MT-Bench和ArenaHard上提升对齐性能,且无需单独奖励模型。