更少数据,更好对齐:数据驱动的多评估者一致性偏好优化

arXiv cs.AI 论文

摘要

本文介绍了DMAPO,一种偏好优化方法,利用多评估者共识来选取高置信度的在策略响应,以显著更少的数据(仅3.45%的接受率)实现强对齐,并在多个基准测试中优于SimPO等基线。

arXiv:2607.25136v1 公告类型:新 摘要:偏好优化的研究通常在固定数据的情况下改变训练目标。我们则探究一个小的、高置信度的在策略响应集合能否提供可靠的学习信号。我们的方法DMAPO(数据驱动的多评估者一致性偏好优化)从目标策略生成候选响应,使用基于评分标准的专门评估者评估有用性、事实性和简洁性,应用过程批评修正,并仅保留高度一致的好或不好的示例。该过程从54,236个Mistral-7B候选中接受了1,871个(3.45%)。在此集合上训练的KTO在MT-Bench上达到7.50,相对于text-davinci-003参考的长度控制胜率为95.5%,IFEval提示准确率为57.3%。独立的成对评估也显示DMAPO优于SimPO:GPT-4o在129个保留提示上净胜率为23.3点,在200个分布外LMSYS-Chat提示上为24.0点;Claude Opus 4.7在保留集上为24.1点。更换评估者模型或评分标准会改变所选示例,但对下游性能影响不大。一项第二骨干研究得到了类似的3.41%接受率,但其性能提升较为温和。在这些实验中,共识过滤提供了一条数据高效的通用指令偏好优化路径,但以额外的筛选计算和对评估者判断的依赖为代价。
查看原文
查看缓存全文

缓存时间: 2026/07/29 09:53

# 数据驱动的多评估者一致性偏好优化

大型语言模型协助进行语言编辑和 LaTeX 结构重排。作者验证了所有技术主张、引用和报告的结果。
来源:https://arxiv.org/html/2607.25136
郑涛姚¹,润浩李¹,²²  
陈旭鹏²,程嘉毅²,乐晨谦²,迈克尔·岳³,王思涵⁴,徐浩彦¹,李宇琪⁵,魏辰浩⁶,李政道⁴,张荣超⁴,杨光⁶,王宜东⁴,董俊浩⁷  
¹南加州大学²纽约大学³哥伦比亚大学⁴加州大学伯克利分校⁵纽约市立大学城市学院⁶斯蒂文斯理工学院⁷南洋理工大学

###### 摘要

关于偏好优化的研究通常固定数据而改变训练目标。我们转而探究是否可以利用一小批高置信度的在线策略响应提供可靠的学习信号。我们的方法 DMAPO(数据驱动的多评估者一致性偏好优化)从目标策略生成候选响应,使用基于评分标准专用的评估器评估有用性、事实性和简洁性,应用过程批评者修正,并仅保留高共识的理想或不理想示例。该过程从 54,236 个 Mistral-7B 候选响应中接受 1,871 个(3.45%)。在此数据集上训练的 KTO 在 MT-Bench 上达到 7.50 分,对 text-davinci-003 参考的长度控制胜率为 95.5%,IFEval 提示准确率为 57.3%。独立的成对评估也显示 DMAPO 优于 SimPO:GPT-4o 在 129 个保留提示上净胜率为 23.3 个百分点,在 200 个分布外 LMSYS-Chat 提示上为 24.0 个百分点;Claude Opus 4.7 在保留集上为 24.1 个百分点。改变评估器模型或评分标准会改变所选示例,但对下游性能影响很小。一项第二骨干研究得到类似的 3.41% 接受率,但其性能提升更为温和。在这些实验中,共识过滤为通用指令的偏好优化提供了一条数据高效的路径,代价是额外的筛选计算和对评估器判断的依赖。

## 1 引言

使大型语言模型与人类偏好对齐对于确保其安全、有用和诚实至关重要 (Ouyang et al., 2022 (https://arxiv.org/html/2607.25136#bib.bib15); Bai et al., 2022 (https://arxiv.org/html/2607.25136#bib.bib2))。RLHF (Christiano et al., 2017 (https://arxiv.org/html/2607.25136#bib.bib3); Stiennon et al., 2020 (https://arxiv.org/html/2607.25136#bib.bib19)) 和直接优化目标如 DPO (Rafailov et al., 2023 (https://arxiv.org/html/2607.25136#bib.bib17)) 在很大程度上将问题框架化为训练算法:如何从给定的偏好数据集中最佳学习。然而,数据集质量同样重要。标注者分歧、模糊比较和标签噪声限制了任何优化器能恢复的效果。

先前工作表明,一小批精心挑选的样本对指令微调和偏好优化可能有效 (Zhou et al., 2023 (https://arxiv.org/html/2607.25136#bib.bib27); Deng et al., 2025 (https://arxiv.org/html/2607.25136#bib.bib5); Ye et al., 2025 (https://arxiv.org/html/2607.25136#bib.bib25))。这一观察引出一个相关问题:能否直接从目标策略自身的响应中构建高置信度的偏好反馈,而不是从固定的偏好数据集中选择?

DMAPO 通过多评估者共识门控来解决这个问题。它生成在线策略响应,并使用三个基于评分标准专用的 Qwen3-8B 评估器实例进行评分。我们使用“评估器”而非“代理”,因为该方法不需要自主规划或工具使用。只有当候选响应的过程批评者调整分数满足联合质量和方差标准时,才予以保留。该门控接受 3.45% 的 Mistral 候选响应,并产生近乎平衡的理想和不理想标签。

在 1,871 个经门控的样本上训练,Mistral 模型在 MT-Bench、AlpacaEval 风格评估、IFEval 和独立成对比较中表现良好。Llama 结果不太明确:DMAPO 在比较的方法中产生了最强的诊断偏好分数,但并未改善更强的基模型在 MT-Bench 上的表现。因此,跨骨干实验测试了过滤行为的稳定性,而不是建立普遍的性能提升。

我们的贡献是:

1. 一个端到端的构建流程,结合了在线策略生成、基于评分标准的评估、过程批评和置信度/方差门控,以产生二元偏好反馈。
2. 一项受控的实证研究,涵盖两个策略骨干、七个训练基线、组件消融、评估器和提示变体,以及两个独立的评估器家族。
3. 对激进过滤引入的权衡的实证描述:更少的训练数据和更短的优化,但需要额外的离线筛选、所选集合的适度变化,以及略低的响应多样性。

参考说明图 1:DMAPO 流程和主要 MT-Bench 结果概览。(A) 从 14,272 个提示池中,13,559 个提示的训练集经过基于评分标准的评估器评分、有界过程批评者和置信度/方差门控后,产生 54,236 个在线策略候选响应和 1,871 个二元标注训练样本(3.45% 接受率)。(B) 在 Mistral-7B-Instruct-v0.2 上,DMAPO 使用 1,871 个样本达到 MT-Bench 得分 7.50。该面板报告了一个基准,而不是 Qwen 门控的诊断胜率;独立成对结果见表2 (https://arxiv.org/html/2607.25136#S5.T2)。

## 2 相关工作

#### 偏好优化。

大多数偏好优化研究关注学习目标。RLHF 训练奖励模型并使用 PPO 进行优化 (Ouyang et al., 2022 (https://arxiv.org/html/2607.25136#bib.bib15); Schulman et al., 2017 (https://arxiv.org/html/2607.25136#bib.bib18));DPO (Rafailov et al., 2023 (https://arxiv.org/html/2607.25136#bib.bib17)) 通过闭式重参数化消除了显式奖励模型;KTO 和 ORPO (Ethayarajh et al., 2024 (https://arxiv.org/html/2607.25136#bib.bib7); Hong et al., 2024 (https://arxiv.org/html/2607.25136#bib.bib9)) 通过二元标签和优势比目标简化了监督。SimPO 和 IPO 进一步改进了偏好损失 (Meng et al., 2024 (https://arxiv.org/html/2607.25136#bib.bib14); Azar et al., 2024 (https://arxiv.org/html/2607.25136#bib.bib1)),而 SPPO 引入了迭代自博弈 (Wu et al., 2024 (https://arxiv.org/html/2607.25136#bib.bib22)),REINFORCE++ 稳定了无批评者优化 (Hu et al., 2025 (https://arxiv.org/html/2607.25136#bib.bib11))。DMAPO 是互补的:它研究了在优化之前构建紧凑的、模型特定的偏好集。

#### 数据中心对齐。

LIMA (Zhou et al., 2023 (https://arxiv.org/html/2607.25136#bib.bib27)) 证明了一小批精心整理的样本足以支持有效的指令微调,而 LIMO (Ye et al., 2025 (https://arxiv.org/html/2607.25136#bib.bib25)) 研究了数学推理中的相关现象。WizardLM (Xu et al., 2023 (https://arxiv.org/html/2607.25136#bib.bib24)) 根据指令复杂度过滤,RLAIF (Lee et al., 2023 (https://arxiv.org/html/2607.25136#bib.bib13)) 使用 AI 反馈,Self-Instruct (Wang et al., 2023 (https://arxiv.org/html/2607.25136#bib.bib20)) 生成训练数据,LESS (Xia et al., 2024 (https://arxiv.org/html/2607.25136#bib.bib23)) 使用影响力函数进行子集选择。最直接相关的是,Deng 等人 (2025 (https://arxiv.org/html/2607.25136#bib.bib5)) 使用外部和隐式奖励边际选择偏好对。UltraFeedback 本身提供多方面的 AI 反馈 (Cui et al., 2023 (https://arxiv.org/html/2607.25136#bib.bib4))。因此,AI 反馈、多方面评分和数据选择本身并不新颖。DMAPO 将它们结合在一个在线策略流程中,在偏好优化之前将基于评分标准的共识转化为二元监督。

#### LLM 作为评估者。

Zheng 等人 (2023 (https://arxiv.org/html/2607.25136#bib.bib26)) 引入了 MT-Bench 并推广了基于 LLM 的评估。此类评估者可能表现出位置、冗长、家族和评分标准偏差,并且同一模型家族内的一致性并不等同于人工验证。因此,我们将 Qwen 门控的诊断指标与独立评估分开,改变评估器提示和模型家族,并将评估器依赖性视为一种限制。

## 3 方法

DMAPO 分七个阶段构建偏好反馈。KTO 提供了二元标签目标,而大部分额外计算用于在线策略生成和评估。三个基于评分标准专用的评估器实例评估互补的维度(有用性、事实性和简洁性),只有当其调整后的分数满足联合置信度和方差标准时,才保留候选响应。在 Mistral-7B 上,此过程保留了 54,236 个候选响应中的 1,871 个(3.45%)。接受的理想和不理想组在平均评估器分数上相差 6.81 分。这种分离描述了标注过程;它不是响应质量的独立度量。

### 3.1 提示收集

提示池结合了 UltraFeedback (Cui et al., 2023 (https://arxiv.org/html/2607.25136#bib.bib4))(1 万个多样化指令提示)和 HelpSteer2 (Wang et al., 2024 (https://arxiv.org/html/2607.25136#bib.bib21))(5 千个聚焦有用性的提示)。去重后保留 14,272 个提示,按 95/5 分为训练集(13,559)和验证集(713)。

### 3.2 在线策略候选生成

对于每个训练提示,Mistral-7B-Instruct-v0.2 (Jiang et al., 2024 (https://arxiv.org/html/2607.25136#bib.bib12)) 使用核采样(温度 0.8,top-p 0.95)生成 k=4 个候选响应。产生的反馈仍然与策略当前的响应分布相关。

### 3.3 多评估者评分

每个候选响应 y 对提示 x 由三个 Qwen3-8B (Qwen Team, 2025 (https://arxiv.org/html/2607.25136#bib.bib16)) 实例独立评估,这些实例使用 1-10 的评分标准评估互补的质量维度:有用性 \(s_h(x,y)\)、事实性 \(s_f(x,y)\) 和简洁性 \(s_c(x,y)\)。经过过程批评者修正(第 3.4 节)后,我们定义

\[
\widetilde{s}_j(x,y) = s_j(x,y) - \delta(x,y), \quad \bar{s}(x,y) = \frac{1}{3} \sum_{j \in \{h,f,c\}} \widetilde{s}_j(x,y).
\tag{1}
\]

每个评估器遵循结构化的评分标准并返回数值分数。我们使用 `/no_think` 模式来标准化输出格式。这些维度是互补的:一个响应可能有用但事实错误,或事实正确但过于冗长。

### 3.4 过程批评者

第四个 Qwen3-8B 实例充当过程批评者。一个结构化的评分标准要求它识别每个提示-响应对中的推理缺陷、事实不一致性和无依据的主张,然后分配三个严重级别之一:

- 轻微(风格不精确、冗余措辞):惩罚 0.05
- 中等(推理不完整、证据不足):惩罚 0.10
- 严重(逻辑矛盾、事实错误):惩罚 0.15

形式上,批评者惩罚为:

\[
\delta(x,y) = \min\left( \sum_{i=1}^{|\mathcal{F}|} p_i, \; \alpha_{\max} \right), \quad p_i \in \{0.05, 0.10, 0.15\}, \quad \alpha_{\max} = 0.15
\tag{2}
\]

其中 \(\mathcal{F}\) 是检测到的缺陷集,\(p_i\) 是缺陷 i 的惩罚。相同的标量修正应用于门控前的每个维度(公式 1)。将其上限设为 0.15 可使批评者从属于三个主要评估者:它可以改变接近阈值的决策,但不能抵消任何维度上的大缺陷。附录 L 报告了上限扫描。

### 3.5 置信度门控

置信度门控将多评估者分数映射到三元标签 \(\ell \in \{\textit{des}, \textit{und}, \textit{discard}\}\):

\[
\ell(x,y) = 
\begin{cases}
\textit{des} & \text{if } \min_j \widetilde{s}_j \geq \tau_{+} \wedge \text{Var}(\widetilde{\mathbf{s}}) < \sigma^2 \\
\textit{und} & \text{if } \max_j \widetilde{s}_j \leq \tau_{-} \wedge \text{Var}(\widetilde{\mathbf{s}}) < \sigma^2 \\
\textit{discard} & \text{otherwise}
\end{cases}
\tag{3}
\]

其中 \(\widetilde{\mathbf{s}} = (\widetilde{s}_h, \widetilde{s}_f, \widetilde{s}_c)\),\(\tau_{+} = 7\),\(\tau_{-} = 4\),\(\sigma^2 = 2.5\)。由于条件是联合应用的,任何维度都无法补偿另一维度的失败;例如,高简洁性无法抵消低有用性或低事实性。该门控保留了 3.45% 的候选响应(表 13),其平均调整分数对于理想样本为 9.23,对于不理想样本为 2.42。

### 3.6 KTO 策略训练

KTO (Ethayarajh et al., 2024 (https://arxiv.org/html/2607.25136#bib.bib7)) 直接作用于二元标签,因此与门控产生的监督相匹配。令 \(r_\theta(x,y) = \log \frac{\pi_\theta(y|x)}{\pi_{\text{ref}}(y|x)}\) 表示隐式奖励,\(z_0 = \mathbb{E}_{x'} [\text{KL}[\pi_\theta(\cdot|x') \| \pi_{\text{ref}}(\cdot|x')]]\) 为运行基线。KTO 损失为:

\[
\mathcal{L}_{\text{KTO}} = \mathbb{E}_{(x,y) \sim \mathcal{D}} 
\begin{cases}
\sigma\bigl(z_0 - \beta r_\theta(x,y)\bigr) & \text{if } \ell(x,y) = \textit{des} \\
\sigma\bigl(\beta r_\theta(x,y) - z_0\bigr) & \text{if } \ell(x,y) = \textit{und}
\end{cases}
\tag{4}
\]

其中 \(\sigma\) 是 Sigmoid 函数,\(\beta = 0.1\) 控制奖励尺度。该损失提高理想输出的相对概率,降低不理想输出的相对概率。KTO 仅接收二元标签,而不是评估器分数或其 6.81 分的差异。其最终训练损失较低(0.037;附录 G)表明这些标签是可分的,但这本身并不能说明泛化能力。

我们使用 LoRA (Hu et al., 2022 (https://arxiv.org/html/2607.25136#bib.bib10))(\(r=16, \alpha=32\)),针对所有线性层(约 1.6 亿可训练参数,占骨干的 2.2%)。

## 4 实验设置

### 4.1 模型

策略骨干。Mistral-7B-Instruct-v0.2 (Jiang et al., 2024 (https://arxiv.org/html/2607.25136#bib.bib12))(72.4 亿参数)是主要骨干;Llama-3.1-8B-Instruct (Grattafiori et al., 2024 (https://arxiv.org/html/2607.25136#bib.bib8))(80.3 亿参数)提供二次骨干检查。

筛选评估者。默认流程使用 Qwen3-8B (Qwen Team, 2025 (https://arxiv.org/html/2607.25136#bib.bib16)) 的 `/no_think` 模式。第 6.4 节改变了评分标准和评估器家族。

评估模型。GPT-4o 对 MT-Bench 进行评分,并用作一个独立的成对评估者。

相似文章

xi-DPO:通过比率奖励边际的直接偏好优化

arXiv cs.LG

本文介绍了 xi-DPO,这是一种新颖的偏好优化方法,通过将目标重构为最小化与最优比率奖励边际的距离,解决了 SimPO 中的超参数调整难题。实验结果表明,xi-DPO 在开放基准测试中优于现有方法。

偏好优化的归一化奖励

arXiv cs.LG

本文引入了一种用于直接对齐算法(DAAs)的正则化技术,该技术保持归一化的响应概率,从而缓解过度优化和似然偏移。该方法提升了生成质量和基准性能,在AlpacaEval2上实现了超过20%的相对提升,并在Llama-3.1-8B-Instruct的通用基准上获得9%的性能增益。

GroupDPO:内存高效的分组直接偏好优化

arXiv cs.CL

GroupDPO 引入了一种内存高效的分组直接偏好优化算法,该算法利用每个提示的多个候选响应,通过解耦反向传播来减少峰值内存使用。该方法在离线和在线对齐设置中均展现出相比标准 DPO 的持续改进。