Data-DPO: 用于LLM后训练中目标模型数据选择的直接偏好优化
摘要
Data-DPO是一种面向目标模型的LLM监督微调数据选择方法,通过单步探测学习数据偏好,并结合质量分数和多样性,在Vision-Flan和LLaVA-CoT数据集上超越了基线方法。
arXiv:2608.16926v1 Announce Type: new
摘要: 监督微调中的数据选择旨在从大规模候选数据中选择一小部分有效样本,以降低训练成本同时保持模型性能。然而,现有方法通常将数据价值视为相对静态的属性,对数据与目标模型能力分布之间的兼容性关注有限。为解决这一问题,我们提出Data-DPO,一种面向目标模型的SFT数据选择方法。Data-DPO通过单步探测观察目标模型在不同样本上的局部训练反馈,将样本间的激活差异转化为成对数据偏好,并训练一个轻量级奖励模型来学习目标模型感知的数据偏好。在最终选择阶段,Data-DPO进一步结合目标模型偏好、外部质量分数和边际多样性,以构建更稳定、更有效的训练子集。在Vision-Flan和LLaVA-CoT上的实验结果表明,Data-DPO在多种数据预算下始终优于现有数据选择基线,并稳定超越全数据训练性能。
查看缓存全文
缓存时间: 2026/08/19 10:16
# Data-DPO:面向大语言模型后训练目标模型数据选择的直接偏好优化
来源:https://arxiv.org/html/2608.16926
作者:AAAI Press Staff1 AAAI 风格贡献者:Peter Patel Schneider, Sunil Issar, J\. Scott Penberthy, George Ferguson, Hans Guesgen, Francisco Cruz\\equalcontrib\\corresponding, Marc Pujol\-Gonzalez\\equalcontrib\\correspondingPeng Sun1, Yi Yang1, Antong Zhang2, Chunxiao Li3, Yanbo Wang4, Dianbo Liu5, Xin Chen6, Kai Yu7, Lu Chen7, Tianfan Fu1\\corresponding
###### 摘要
监督微调中的数据选择旨在从大规模候选数据中挑选出一小部分有效样本,在保持模型性能的同时降低训练成本。然而,现有方法通常将数据价值视为相对静态的属性,对数据与目标模型能力分布之间的兼容性关注有限。为解决此问题,我们提出了Data\-DPO,一种面向目标模型的SFT数据选择方法。Data\-DPO通过单步探查观察目标模型对不同样本的局部训练反馈,将样本间的激活差异转化为成对数据偏好,并训练一个轻量级奖励模型来学习目标模型感知的数据偏好。在最终选择阶段,Data\-DPO进一步结合目标模型偏好、外部质量评分和边际多样性,以构建更稳定有效的训练子集。在Vision\-Flan和LLaVA\-CoT上的实验结果表明,Data\-DPO在多个数据预算下持续优于现有数据选择基线,并稳定超越全数据训练性能。
## 1 引言
监督微调(SFT)已成为提升大模型能力的关键步骤(Liuet al\.2024a (https://arxiv.org/html/2608.16926#bib.bib3); Lambertet al\.2025 (https://arxiv.org/html/2608.16926#bib.bib1))。然而,随着指令数据规模持续增长,在完整数据集上进行微调不仅计算成本高昂,还可能无法获得最优性能(Yanget al\.2025 (https://arxiv.org/html/2608.16926#bib.bib5))。因此,如何从大规模候选数据中挑选出一个小而有效的训练子集,使模型能以显著降低的训练成本达到可比甚至更优的性能,已成为SFT中的重要问题(Fuet al\.2025 (https://arxiv.org/html/2608.16926#bib.bib6))。现有数据选择方法通常从两个角度评估数据价值:样本重要性和数据多样性。前者关注样本对模型更新或下游性能的贡献(Liuet al\.2025 (https://arxiv.org/html/2608.16926#bib.bib8); Heet al\.2025 (https://arxiv.org/html/2608.16926#bib.bib9)),后者则强调分布覆盖和冗余消除(Debet al\.2025 (https://arxiv.org/html/2608.16926#bib.bib12); Biet al\.2025 (https://arxiv.org/html/2608.16926#bib.bib11))。一些方法进一步整合质量、重要性和多样性,以构建更均衡的训练子集(Leeet al\.2024 (https://arxiv.org/html/2608.16926#bib.bib14); Yanet al\.2025 (https://arxiv.org/html/2608.16926#bib.bib15); Yuet al\.2025 (https://arxiv.org/html/2608.16926#bib.bib16))。尽管这些方法在不同任务上取得了有前景的结果,但大多数仍视数据价值为相对静态的属性,样本是否高质量通常由样本本身和表示空间结构预先决定。然而,在SFT设定中,数据价值不应仅由样本的内在质量决定(Zhanget al\.2025 (https://arxiv.org/html/2608.16926#bib.bib18))。SFT通常不要求模型从零学习知识;而是进一步激活、校准和对齐模型现有的能力分布(Goyalet al\.2024 (https://arxiv.org/html/2608.16926#bib.bib19))。由于模型在架构、参数规模和能力分布上存在差异,相同的样本在用于微调不同的目标模型时可能扮演截然不同的角色(Huet al\.2025 (https://arxiv.org/html/2608.16926#bib.bib21))。一些样本可能对较弱模型过于困难,而对更强模型则刚好合适。同样,看似高质量的答案也未必匹配特定模型当前的学习需求(Liuet al\.2026 (https://arxiv.org/html/2608.16926#bib.bib22))。因此,SFT数据选择不仅要回答“哪些数据是高质量的?”,还应进一步解决“哪些数据更适合目标模型?”。基于此观察,我们提出了Data\-DPO,一种面向目标模型的SFT数据选择方法。Data\-DPO利用目标模型在短暂训练过程中的反馈,来表征样本与模型当前训练需求之间的兼容性。具体而言,我们首先从候选数据中选择一组有代表性的样本,观察目标模型在一步更新前后的训练反馈,并将此类反馈转化为数据样本之间的成对偏好关系。然后,我们训练一个轻量级奖励模型,以学习以目标模型为条件的数据偏好。为防止所选子集过度偏向局部易于激活的样本,Data\-DPO在最终子集构建阶段进一步结合目标模型偏好、外部质量评估和数据多样性。通过这种方式,它将目标模型自身的反馈融入了一个强大的质量-多样性选择框架。我们在两个数据集上评估了Data\-DPO:Vision\-Flan和LLaVA\-CoT,分别涵盖通用指令微调和面向推理的微调场景。实验在三个数据预算(5%、10%和15%)下进行。我们将Data\-DPO与代表性基线(包括随机选择、重要性估计、基于多样性的选择和混合选择方法)进行比较。结果显示,在Vision\-Flan上,Data\-DPO在所有数据预算下均优于现有基线,与全数据训练相比,分别达到100\.76%、102\.63%和102\.70%的平均相对性能。在LLaVA\-CoT上,Data\-DPO在5%和10%预算下分别达到全数据训练性能的102\.73%和103\.93%,显著优于所有基线;在15%预算下,其性能仍保持在全数据训练之上。我们的主要贡献如下:
- • 我们从目标模型条件化的视角重新审视SFT数据选择问题,强调数据价值不仅取决于样本的静态质量,还取决于其与目标模型能力分布的兼容性。
- • 我们提出了Data\-DPO,它从目标模型自身在短暂训练过程中的反馈构建数据偏好,并结合偏好、质量和多样性信号来选择更适合模型的子集。
- • 我们在Vision\-Flan和LLaVA\-CoT上进行了系统实验。结果表明,Data\-DPO在多个数据预算下持续优于代表性基线,并稳定超越全数据训练性能。进一步分析显示,我们的方法在不同目标模型、质量评分来源和嵌入来源上具有鲁棒性。
## 2 相关工作
现有数据选择方法通常从两个互补的角度选择训练子集:样本重要性和数据多样性。前者估计每个训练实例对目标任务或模型更新的贡献。例如,LESS(Xiaet al\.2024 (https://arxiv.org/html/2608.16926#bib.bib23))、TIVE(Liuet al\.2025 (https://arxiv.org/html/2608.16926#bib.bib8))、ICONS(Wuet al\.2024 (https://arxiv.org/html/2608.16926#bib.bib24))和OPUS(Wanget al\.2026 (https://arxiv.org/html/2608.16926#bib.bib25))基于训练和验证样本之间的梯度相似性选择数据;ScalSelect(Wuet al\.2026 (https://arxiv.org/html/2608.16926#bib.bib26))通过目标模型的内部注意力行为(尤其是其注意力分布)评估样本重要性;EL2N(Paulet al\.2021 (https://arxiv.org/html/2608.16926#bib.bib28))在小的子集上训练一个代理模型,并基于其在代理模型下的损失识别信息样本。后者强调覆盖和冗余消除。PRISM(Biet al\.2025 (https://arxiv.org/html/2608.16926#bib.bib11))、FisherSFT(Debet al\.2025 (https://arxiv.org/html/2608.16926#bib.bib12))、SemDeDup(Abbaset al\.2023 (https://arxiv.org/html/2608.16926#bib.bib13))、Self\-Sup(Sorscheret al\.2022 (https://arxiv.org/html/2608.16926#bib.bib29))和D2 Pruning(Maharanaet al\.2023 (https://arxiv.org/html/2608.16926#bib.bib30))通过基于嵌入的去重或分散确保多样性,而ICONS(Wuet al\.2024 (https://arxiv.org/html/2608.16926#bib.bib24))和INSTAG(Luet al\.2023 (https://arxiv.org/html/2608.16926#bib.bib31))通过最大化下游任务类型的覆盖来构建有代表性的子集。一些研究进一步结合了这两个视角。CoIDO(Yanet al\.2025 (https://arxiv.org/html/2608.16926#bib.bib15))训练一个统一的评分器来联合建模数据质量和多样性;DataTailor(Yuet al\.2025 (https://arxiv.org/html/2608.16926#bib.bib16))从多个维度设计选择标准,包括样本信息量、簇内和簇间关系以及对话轮数;而COINCIDE(Leeet al\.2024 (https://arxiv.org/html/2608.16926#bib.bib14))从目标模型提取多层表示,并从簇内和簇间结构中采样数据。与这些方法不同,我们不将样本效用视为静态质量、外部相似性或表示空间覆盖。相反,我们直接表征每个样本在目标模型中的激活强度,并将其转化为成对数据偏好,用于面向目标模型的数据选择。
## 3 方法
### 3\.1 问题表述
给定原始训练集D\\mathcal\{D\},数据选择旨在在固定预算KK下选择一个子集D′⊆D\\mathcal\{D\}^\{\\prime\}\\subseteq\\mathcal\{D\},使得在D′\\mathcal\{D\}^\{\\prime\}上训练的模型达到接近甚至优于在全数据集上训练的性能。令f\(⋅\)f\(\\cdot\)表示在给定数据集上训练的模型的目标任务性能。数据选择问题可表述为: maxD′⊆Df\(D′\)s\.t\.\|D′\|=K\.\\max\_\{\\mathcal\{D\}^\{\\prime\}\\subseteq\\mathcal\{D\}\}f\(\\mathcal\{D\}^\{\\prime\}\)\\quad\\mathrm\{s\.t\.\}\\quad\|\\mathcal\{D\}^\{\\prime\}\|=K\.\(1\) 这里,KK表示数据预算。此表述捕捉了数据选择的核心目标:识别一个有限子集,以最大化下游模型性能。
### 3\.2 Data\-DPO
请参见图注 图1:Data\-DPO概述。Data\-DPO通过双视图编码构建探查集,从目标模型的单步训练反馈推导样本偏好,并学习一个目标模型感知的奖励模型。最终子集随后通过联合考虑偏好分数、外部质量分数和边际多样性进行贪婪选择。我们提出了Data\-DPO,一种为目标模型量身定制的SFT数据选择方法。Data\-DPO从单步目标模型更新中构建成对偏好,从这些偏好中训练一个奖励模型,并通过结合目标模型偏好、一般质量和边际多样性来选择最终子集。整体流程如图1 (https://arxiv.org/html/2608.16926#S3.F1)所示,实现细节见附录A (https://arxiv.org/html/2608.16926#A1)。
#### 双视图编码。
给定候选样本ziz\_\{i\},我们将其表示为一对: zi=\(ci,yi\),z\_\{i\}=\(c\_\{i\},y\_\{i\}\),\(2\) 其中cic\_\{i\}是输入条件,yiy\_\{i\}是目标响应。Data\-DPO为每个样本构建两个互补的表示。第一个是条件嵌入: eic=Eemb\(ci\),e\_\{i\}^\{c\}=E\_\{\\mathrm\{emb\}\}\(c\_\{i\}\),\(3\) 仅编码输入条件。此表示用于探查集构建和在最终选择阶段测量边际多样性。第二个是监督嵌入: eis=Eemb\(ci,yi\),e\_\{i\}^\{s\}=E\_\{\\mathrm\{emb\}\}\(c\_\{i\},y\_\{i\}\),\(4\) 编码样本的完整监督信号,用于偏好学习和最终偏好评分。两种表示均由冻结的嵌入模型提取,随后进行独立的中心化和L2L\_\{2\}\-归一化。在以下章节中,eice\_\{i\}^\{c\}和eise\_\{i\}^\{s\}表示预处理后的嵌入。
#### 探查集构建。
为了构建偏好监督,我们首先从完整候选集D\\mathcal\{D\}中采样一个探查子集Dp\\mathcal\{D\}\_\{p\}。具体而言,我们根据条件嵌入eice\_\{i\}^\{c\}将D\\mathcal\{D\}聚类为mm个簇: D=⋃k=1mCk\.\\mathcal\{D\}=\\bigcup\_\{k=1\}^\{m\}\\mathcal\{C\}\_\{k\}\.\(5\) 对于每个簇Ck\\mathcal\{C\}\_\{k\},我们选择nk=⌈ρ\|Ck\|⌉n\_\{k\}=\\lceil\\rho\|\\mathcal\{C\}\_\{k\}\|\\rceil个样本: Dp=⋃k=1mDp\(k\),\|Dp\(k\)\|=nk\.\\mathcal\{D\}\_\{p\}=\\bigcup\_\{k=1\}^\{m\}\\mathcal\{D\}\_\{p\}^\{\(k\)\},\\quad\|\\mathcal\{D\}\_\{p\}^\{\(k\)\}\|=n\_\{k\}\.\(6\) 为防止探查样本集中在每个簇的高密度区域,我们采用贪婪kk\-中心策略。对于每个簇Ck\\mathcal\{C\}\_\{k\},我们用最接近簇质心的样本初始化选择集SkS\_\{k\}。然后,在每一步中,选择与当前选择集距离最远的样本: z∗=argmaxzi∈Ck∖Skminzj∈Sk\(1−cos\(eic,ejc\)\)\.z^\{\*\}=\\arg\\max\_\{z\_\{i\}\\in\\mathcal\{C\}\_\{k\}\\setminus S\_\{k\}\}\\min\_\{z\_\{j\}\\in S\_\{k\}\}\\left\(1\-\\cos\(e\_\{i\}^\{c\},e\_\{j\}^\{c\}\)\\right\)\.\(7\) 此过程鼓励Dp\\mathcal\{D\}\_\{p\}覆盖更广泛的条件空间,从而为后续偏好构建提供更丰富和稳定的监督。
#### 激活探查。
为表征每个样本对目标模型M0M\_\{0\}的局部激活效应,我们对探查子集Dp\\mathcal\{D\}\_\{p\}进行TT轮单步探查。在第t轮探查中,我们采样一个批次: Bt=\{z1,...,zb\}\.B\_\{t\}=\\\{z\_\{1\},\\ldots,z\_\{b\}\\\}\.\(8\) 对于每个样本zi∈Btz\_\{i\}\\in B\_\{t\},我们首先计算更新前的SFT损失: li0=l\(M0,zi\)\.\\ell\_\{i\}^\{0\}=\\ell\(M\_\{0\},z\_\{i\}\)\.\(9\) 从相同的初始模型M0M\_\{0\}出发,我们在BtB\_\{t\}上执行一步临时SFT更新: Mt′=OneStepUpdate\(M0,Bt\),M\_\{t\}^\{\\prime\}=\\mathrm\{OneStepUpdate\}\(M\_\{0\},B\_\{t\}\),\(10\) 并计算更新后的损失: li1=l\(Mt′,zi\)\.\\ell\_\{i\}^\{1\}=\\ell\(M\_\{t\}^\{\\prime\},z\_\{i\}\)\.\(11\) 每轮探查后,Mt′M\_\{t\}^\{\\prime\}被丢弃,下一轮仍从M0M\_\{0\}开始。因此,此过程捕捉了目标检查点周围的训练动态,而非持续训练的代理模型的偏好。我们定义ziz\_\{i\}的单步激活增益为: gi\(t\)=logli0\+εli1\+ε\.g\_\{i\}^\{\(t\)\}=\\log\\frac\{\\ell\_\{i\}^\{0\}\+\\epsilon\}\{\\ell\_\{i\}^\{1\}\+\\epsilon\}\.\(12\) 更大的gi\(t\)g\_\{i\}^\{\(t\)\}表明该样本在一步更新后产生了更大的损失减少,意味着对当前目标模型有更强的局部激活效应。为消除不同探查批次间的尺度差异,我们进一步应用相似文章
面向聊天机器人微调的直接偏好优化:一项实证研究
本文对直接偏好优化(DPO)在大型语言模型微调中的应用进行了实证研究,表明DPO简化了训练流程,在实现竞争性性能的同时,也解决了训练不稳定性问题。
GroupDPO:内存高效的分组直接偏好优化
GroupDPO 引入了一种内存高效的分组直接偏好优化算法,该算法利用每个提示的多个候选响应,通过解耦反向传播来减少峰值内存使用。该方法在离线和在线对齐设置中均展现出相比标准 DPO 的持续改进。
超越聊天机器人的直接偏好优化
直接偏好优化(DPO)被应用于聊天机器人之外的OCR任务,显示出在多个模型家族中文本退化的显著减少,平均减少了59.4%。
DOG-DPO:面向安全对齐的几何动态优化
DOG-DPO 是一种无需训练的数据选择框架,它将偏好对视为结构化几何信号,将多数据集偏好几何分解为锚定子空间和残差子空间,以选择多样化的子集用于安全对齐。该框架在六个安全基准测试中仅使用 11% 的偏好对就实现了强大的效用-鲁棒性权衡。
xi-DPO:通过比率奖励边际的直接偏好优化
本文介绍了 xi-DPO,这是一种新颖的偏好优化方法,通过将目标重构为最小化与最优比率奖励边际的距离,解决了 SimPO 中的超参数调整难题。实验结果表明,xi-DPO 在开放基准测试中优于现有方法。