LLM后训练中应比较哪些配对?

arXiv cs.AI 论文

摘要

本文研究了LLM后训练中如何选择需要标注的完成对以供人类偏好反馈的问题。它将比较筛选问题形式化为采样设计问题,给出了DPO策略最优性差距的理论上界,并提出了实用的采样设计方案,在合成和真实基准测试上比常规启发式方法更有效地提高了样本效率。

arXiv:2606.19607v1 公告类型:新 摘要:基于偏好的后训练已成为对齐语言模型的核心范式。一种常见的数据收集策略是为每个提示生成一小部分完成,并标注由此产生的比较对。然而,人类偏好标签的成本通常远高于生成额外完成,这提示我们可以更有效地使用相同的标注预算:生成更大的完成池,但仅标注信息量最大的比较对。本文研究了基于偏好的后训练中应比较哪些对。我们将比较筛选形式化为一个采样设计问题,并根据基于偏好的后训练目标下最终策略的质量来评估设计方案。我们将此框架应用于直接偏好优化(DPO),分析标注对的选择如何通过DPO训练传播到下游策略性能。我们的主要结果为DPO训练策略的后训练最优性差距提供了匹配的上界和下界。这些界限表明,比较选择通过一个依赖于设计的信息矩阵影响下游性能,该矩阵将标签分配与参数估计误差和策略次优性联系起来。这为预算受限的比较筛选提供了明确的优化标准,并启发了从大型生成完成池中选择信息丰富对的实际采样设计。在合成设置和语言模型后训练基准上的实验表明,所提出的设计在样本效率上持续优于常见的比较选择启发式方法。
查看原文
查看缓存全文

缓存时间: 2026/06/20 14:31

# 大语言模型后训练中应比较哪些配对? 来源:https://arxiv.org/html/2606.19607 Jiangze Han Columbia University jh5196@columbia\.edu &Vineet Goyal Columbia University vgoyal@ieor\.columbia\.edu Will Ma Columbia University wm2428@gsb\.columbia\.edu ###### 摘要 基于偏好的后训练已成为对齐语言模型的核心范式。一种常见的数据收集策略是为每个提示生成少量补全,并对生成的比较对进行标注。然而,人类偏好标签的成本通常远高于生成额外的补全,这提示我们可采用不同的标签预算使用方式:生成更大规模的补全集,但仅标注最具信息量的比较对。本文研究了在基于偏好的后训练中应比较哪些配对。我们将比较选择问题形式化为一个采样设计问题,并基于最终策略在偏好后训练目标下的质量来评估设计方案。我们将此框架实例化到直接偏好优化(DPO),分析所选标签对如何通过DPO训练传播到下游策略性能。我们的主要结果提供了DPO训练策略的后训练最优性差距的匹配上下界。这些界表明,比较选择通过一个依赖于设计的单一信息矩阵影响下游性能,该矩阵将标签分配与参数估计误差和政策次优性联系起来。这为预算约束下的比较选择提供了显式的优化准则,并激发了从大规模生成补全池中选择信息量大的配对的实用采样设计。在合成设置和语言模型后训练基准上的实验表明,所提出的设计在样本效率上持续优于常见的比较选择启发式方法。 ## 1 引言 基于偏好的后训练已成为将大语言模型与人类意图对齐的核心范式。早期的强化学习从人类反馈(RLHF)流程遵循两个阶段:从参考策略π0\\pi\_\{0\}(通常是监督微调模型)开始,收集人类对模型生成的补全对的偏好标签,从这些比较中拟合一个奖励模型,然后使用策略梯度方法(如PPO)在KL正则化约束下针对这个学到的奖励优化策略(Christiano 等人,2017 (https://arxiv.org/html/2606.19607#bib.bib3);Ouyang 等人,2022 (https://arxiv.org/html/2606.19607#bib.bib2))。这个框架影响深远,但它也引入了复杂的中间奖励建模阶段和计算昂贵的强化学习步骤。较新的方法,最著名的是直接偏好优化(DPO),跳过了显式的奖励建模,而是通过逻辑回归目标直接从成对偏好数据中训练策略,同时保留在相同KL正则化RLHF框架下的隐式奖励解释(Rafailov 等人,2023 (https://arxiv.org/html/2606.19607#bib.bib1))。后续的偏好优化变体进一步简化或修改了这一后训练流程,但它们仍然依赖成对偏好比较作为基本的监督信号。 在这些后训练方法中,收集人类偏好标签仍然是一个关键瓶颈。一种常见的数据收集策略是机械性的:对于每个提示,从参考策略生成少量补全,并标注一个对或所有提示内的对。这种策略将生成的比较集视为固定的,即使生成相对便宜而人工标注昂贵。在实践中,偏好数据集也通常在标注前批量组装,因为协调人工标注成本高,且预先选择比较在逻辑上更容易。这激发了一个离线选择问题:与其标注所有可用的比较或均匀地选择它们,我们能否先生成一个更大的候选池,然后选择哪些配对最值得发送给标注者? 本文研究这个比较选择问题:在基于偏好的后训练中应比较哪些配对?对于每个提示,我们首先从初始参考策略生成一个更大的补全集,然后选择一组信息量大的提示内比较对,并在所有提示和生成的补全上联合优化。目标是将标注预算分配给那些最有助于提高最终后训练策略(在KL正则化RLHF目标下)质量的比较。 形式上,我们将比较选择建模为一个采样设计问题。在为每个提示生成补全后,一个设计指定了所有提示内补全对上的采样分布。给定一个标注预算nn,我们从该设计中采样nn个对并查询它们的偏好标签。在本文中,我们将后训练步骤实例化为DPO:采样得到的标注比较用于训练一个DPO策略π^n\\hat\{\\pi\}\_\{n\}。设计的目标是产生一个在KL正则化RLHF目标JJ下具有高价值的策略。因此,核心问题不仅仅是如何孤立地准确估计偏好,而是如何分配比较标签以改进RLHF目标下的最终策略。 贡献。我们做出三个主要贡献。首先,我们表明比较选择对RLHF的影响由一个依赖于设计的单一信息矩阵所捕获,该矩阵衡量标注比较如何识别对下游RLHF性能重要的参数方向。其次,我们证明了RLHF最优性差距的匹配有限样本上界和信息论下界,表明一个迹形式代理同时刻画了RLHF的可实现性能和问题不可避免的统计难度。这些界为选择信息量大的比较对提供了显式的优化准则,以及一个实用的采样策略。第三,我们在合成表格实验、上下文实验以及IMDb和Anthropic-HH DPO实验中实证验证了该设计准则,表明所提出的设计在样本效率上持续优于文献中的其他方法。 ### 1.1 文献综述 据我们所知,这是第一个将离线实验设计应用于RLHF后训练的比较选择的工作,其准则直接与下游策略性能相关。 RLHF使用偏好数据来指导策略优化,通常通过学习来自成对比较的奖励模型,然后优化KL正则化目标。Christiano 等人(2017 (https://arxiv.org/html/2606.19607#bib.bib3))的早期工作通过轨迹比较形式化了从人类偏好中学习,而大规模对齐流程如InstructGPT(Ouyang 等人,2022 (https://arxiv.org/html/2606.19607#bib.bib2))推广了基于偏好的语言模型RL。DPO(Rafailov 等人,2023 (https://arxiv.org/html/2606.19607#bib.bib1))提供了一个广泛使用的替代方案,直接在成对偏好数据上拟合分类风格的目标,避免了显式奖励建模和在线策略RL,同时保留了隐式奖励解释。我们的工作将KL正则化目标视为给定的,并研究在固定标注预算下策划比较数据的正交问题。 偏好标签的标准统计模型是Bradley–Terry模型(Bradley and Terry,1952 (https://arxiv.org/html/2606.19607#bib.bib4)),其中一个项目被偏好于另一个的概率是潜在分数差异的逻辑函数。该模型是排序和偏好学习的基础,当成对标签被视为由显式或隐式奖励信号引起的噪声比较时,它自然出现在RLHF/DPO中。 相关文献研究自适应偏好查询选择以减少RLHF/DPO数据收集成本。例如,Das 等人(2025 (https://arxiv.org/html/2606.19607#bib.bib16))提出了用于样本高效RLHF的主动偏好优化;Ji 等人(2024 (https://arxiv.org/html/2606.19607#bib.bib17))受主动学习启发开发了查询高效的RLHF方法;Muldrew 等人(2024 (https://arxiv.org/html/2606.19607#bib.bib18))研究了在DPO式目标下LLM中主动偏好学习的获取策略。Xie 等人(2025 (https://arxiv.org/html/2606.19607#bib.bib25))提出了一种探索增强的在线DPO方法,用于RLHF中样本高效的偏好数据收集。Lin 等人(2025 (https://arxiv.org/html/2606.19607#bib.bib27))提出了一种在线DPO方法,使用由当前LLM诱导的估计奖励模型选择偏好查询。Kveton 等人(2025 (https://arxiv.org/html/2606.19607#bib.bib26))研究了DPO的主动学习,并考虑了离线子集选择设置,但他们的离线设置是从已标注的偏好数据中选择信息性子集以提高计算效率。 与我们的工作最接近的是Feng 等人(2025 (https://arxiv.org/html/2606.19607#bib.bib20))提出的PILAF,它改变了迭代和在线RLHF/DPO中的响应生成分布,使得偏好损失梯度与oracle RLHF目标梯度对齐。相比之下,我们的重点是离线第一轮比较选择:当在观察到任何偏好反馈之前从参考/SFT模型生成补全时,我们优化固定生成池中哪些提示内对应该被标注,并为最终RLHF策略提供有限样本保证。这种离线公式是受实际标注工作流启发,其中比较数据集通常预先构建,然后发送进行批量人工标注。 最近的工作研究了偏好数据属性如何影响后训练行为。Kim 等人(2025 (https://arxiv.org/html/2606.19607#bib.bib14))分析了数据生成分布如何影响DPO优化和梯度动力学,包括似然位移和迭代DPO。Pan 等人(2025 (https://arxiv.org/html/2606.19607#bib.bib15))强调了偏好响应质量和覆盖面的重要性,而Chowdhury 等人(2024 (https://arxiv.org/html/2606.19607#bib.bib13))研究了随机标签翻转下的DPO,并提出了具有有限样本保证的鲁棒/去偏目标。我们的工作是互补的:不是关注响应质量、训练动态或标签噪声,而是研究成对比较选择,并展示预算分配如何通过信息设计准则控制下游性能。 在方法论上,我们的方法建立在离线最优实验设计的基础上,该领域研究如何分配有限的测量预算以优化统计信息准则。在成对比较设置中,这相当于决定哪些对应该被比较以及以什么频率。经典工作研究了Bradley–Terry模型的局部最优设计,表明最优比较结构可以强烈依赖于未知的效用参数(Graßhoff and Schwabe,2008 (https://arxiv.org/html/2606.19607#bib.bib5))。互补的极小极大分析通过Laplacian谱将物品效用估计的难度与比较图的拓扑联系起来(Shah 等人,2016 (https://arxiv.org/html/2606.19607#bib.bib12))。其他工作发展了锦标赛和成对比较的自适应或贝叶斯设计(Glickman and Jensen,2005 (https://arxiv.org/html/2606.19607#bib.bib6)),以及机器学习中专家比较的固定预算分配规则(Guo 等人,2018 (https://arxiv.org/html/2606.19607#bib.bib7))。最近,最优设计思想已被用于学习系统中的偏好数据收集,但设计目标主要与学习偏好或奖励模型相关。例如,Mukherjee 等人(2024 (https://arxiv.org/html/2606.19607#bib.bib24))使用最优设计学习物品排序,目标基于排序准确性。Scheid 等人(2024 (https://arxiv.org/html/2606.19607#bib.bib28))研究了学习上下文线性奖励模型的最优设计,目标用bandit遗憾表述。我们的设置共享了将配对选择视为预算分配问题的观点,但在下游目标上有所不同:我们将比较分配直接与KL正则化RLHF目标下最终后训练策略的次优性联系起来,而不仅仅是参数估计精度或奖励模型学习。 ## 2 问题定义 ##### 强化学习从人类反馈(RLHF) 设xx表示一个提示,A\(x\)\\mathcal\{A\}\(x\)表示提示xx可用的候选补全集。我们用y∈A\(x\)y\\in\\mathcal\{A\}\(x\)表示一个补全。一个语言模型在给定提示下诱导出一个补全的条件分布。遵循RLHF文献,我们将这个条件分布称为策略,并记为π\(⋅∣x\)\\pi\(\\cdot\\mid x\)。因此,π\(y∣x\)\\pi\(y\\mid x\)是模型在给定提示xx时生成补全yy的概率。 RLHF旨在将参考策略π0\(⋅∣x\)\\pi\_\{0\}\(\\cdot\\mid x\)(通常通过监督微调(SFT)获得)与人类偏好对齐。标准的RLHF公式假设每个提示-补全对\(x,y\)\(x,y\)都有一个潜在的人类偏好奖励r⋆\(x,y\)r^\{\\star\}\(x,y\),该奖励是固定的但对学习者是未知的,较大的值对应人类更偏好的补全。目标是学习一个策略,该策略分配更高的概率给高奖励补全,同时保持接近参考策略。这种权衡由KL正则化RLHF目标捕获: J\(π\)≐Ex\[Ey∼π\(⋅∣x\)\[r⋆\(x,y\)\]−βKL\(π\(⋅∣x\)∥π0\(⋅∣x\)\)\]\.J\(\\pi\)\\doteq\\mathbb\{E\}\_\{x\}\\\!\\left\[\\mathbb\{E\}\_\{y\\sim\\pi\(\\cdot\\mid x\)\}\[r^\{\\star\}\(x,y\)\]\-\\beta\\,\\text\{KL\}\\\!\\big\(\\pi\(\\cdot\\mid x\)\\,\\\|\\,\\pi\_\{0\}\(\\cdot\\mid x\)\\big\)\\right\]\.\(1\)第一项衡量后训练策略的期望人类偏好奖励,而KL项衡量其与参考策略的偏差。参数β\>0\\beta\>0控制正则化的强度。设π⋆∈arg⁡maxπ⁡J\(π\)\\pi^\{\\star\}\\in\\arg\\max\_\{\\pi\}J\(\\pi\)表示RLHF最优策略。对于每个提示,最大化器在奖励改进和偏离参考策略之间取得平衡。这个优化器由参考策略π0\\pi\_\{0\}和奖励函数r⋆r^\{\\star\}共同决定。特别地,它具有闭式形式(Rafailov 等人,2023 (https://arxiv.org/html/2606.19607#bib.bib1)): π⋆\(y∣x\)=π0\(y∣x\)exp⁡\(r⋆\(x,y\)/β\)Z\(x\),Z\(x\)=∑y′∈A\(x\)π0\(y′∣x\)exp⁡\(r⋆\(x,y′\)/β\)\.\\pi^\{\\star\}\(y\\mid x\)=\\frac\{\\pi\_\{0\}\(y\\mid x\)\\exp\(r^\{\\star\}\(x,y\)/\\beta\)\}\{Z\(x\)\},\\qquad Z\(x\)=\\sum\_\{y^\{\\prime\}\\in\\mathcal\{A\}\(x\)\}\\pi\_\{0\}\(y^\{\\prime\}\\mid x\)\\exp\(r^\{\\star\}\(x,y^\{\\prime\}\)/\\beta\)\.\(2\)因此,高奖励补全获得更大的概率,但仅相对于它们在参考策略下的概率。归一化常数Z\(x\)Z\(x\)确保π⋆\(⋅∣x\)\\pi^\{\\star\}\(\\cdot\\mid x\)是一个有效的分布,并且仅依赖于提示。在实践中,r⋆r^\{\\star\}是未知的,关于r⋆r^\{\\star\}的信息通过成对偏好标签收集。 偏好数据生成。标准RLHF数据

相似文章

LLM 偏好对齐的零阶范式

Hugging Face Daily Papers

本文提出基于比较的偏好优化(ComPO),一种用于LLM的零阶对齐方法,利用比较预言机来避免似然位移。它包括理论保证和对现有方法的实验改进。

DataPrep-Bench: 将LLM作为训练数据准备器的基准测试

arXiv cs.LG

DataPrep-Bench是一个统一的基准测试,用于评估LLM在六个领域的训练数据构建和质量评估能力,包括一个技能引导的代理(Data-Construction-Skill)和一个基于分布的评估器(DAS),后者实现了强大的跨模型相关性。