偏好优化的归一化奖励

arXiv cs.LG 论文

摘要

本文引入了一种用于直接对齐算法(DAAs)的正则化技术,该技术保持归一化的响应概率,从而缓解过度优化和似然偏移。该方法提升了生成质量和基准性能,在AlpacaEval2上实现了超过20%的相对提升,并在Llama-3.1-8B-Instruct的通用基准上获得9%的性能增益。

arXiv:2607.16240v1 公告类型:新 摘要:直接对齐算法(DAAs)(例如DPO)已成为对LLM进行后训练并与人类偏好对齐的常用方法。然而,DAAs被观察到会过度优化其隐式奖励模型,并降低偏好响应的似然。这导致分配给偏好数据集中出现的响应的总似然下降,可能引发不良行为。为应对DAAs的这一不良副作用,我们研究了使用添加正则化项的目标函数的效果,该正则化项用于维持选择和拒绝响应的总长度归一化概率。为了更好地理解过度优化,我们探讨了在有和无正则化的情况下,响应似然变化在词元上的分布。我们发现,似然变化的很大一部分源于一小部分离群词元,这解释了DAAs为何能在降低选择响应似然的同时提升生成质量。我们将所提出的正则化应用于基于参考(DPO)和无参考(SimPO)方法,并发现:(1) 生成质量与通用基准能力之间的权衡得到改进;(2) 跨数据集的奖励建模得到提升。例如,在Llama-3.1-8B-Instruct上,我们看到AlpacaEval2分数相对提升超过20%,通用基准性能相对增益超过9%。此外,我们发现添加的正则化项通过利用低似然词元,有效缓解了偏好响应整体上的偏移量,尤其是针对离群词元的偏移。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:47

# 偏好优化的归一化奖励
来源:https://arxiv.org/html/2607.16240

##### 摘要

直接对齐算法(DAA,如DPO)已成为对LLM进行后训练以使其与人类偏好对齐的常见方法。然而,已有观察发现DAA会过度优化其隐含奖励模型,并降低偏好响应的似然。这导致偏好数据集中所见的响应总似然下降,可能引发不良行为。为抵消DAA的这一不良副作用,我们研究了使用添加正则化项的目标函数来维持所选和拒绝响应的总长度归一化概率的效果。为了更好地理解过度优化,我们研究了有正则化和无正则化情况下响应似然变化如何在标记间分布。我们发现,似然变化的很大一部分来自一小部分离群标记,这解释了DAA如何在降低选择响应似然的同时提高生成质量。我们将所提出的正则化应用于基于参考(DPO)和无参考(SimPO)方法,发现:(1) 在生成质量和通用基准能力之间实现了更优的权衡;(2) 在多个数据集上奖励建模得到改进。例如,在Llama-3.1-8B-Instruct上,我们看到AlpacaEval2得分相对提升超过20%,通用基准性能相对提升超过9%。

直接对齐,强化学习人类反馈,DPO

## 1 引言

随着大型语言模型(LLM)与人类交互的增多,训练LLM生成符合人类期望的响应已成为关键步骤。这类训练通常通过从配对偏好和非偏好响应数据集中学习何为理想响应,如人类反馈强化学习(RLHF)(Ouyang等人,2022 (https://arxiv.org/html/2607.16240#bib.bib4))和直接偏好优化(DPO)(Rafailov等人,2023 (https://arxiv.org/html/2607.16240#bib.bib5))。两种方法的主要区别在于RLHF依赖两步训练过程,而DPO仅需一步。RLHF首先学习一个奖励函数,为偏好响应分配比非偏好响应更高的价值,然后用该奖励函数训练LLM策略。DPO通过最大化偏好与非偏好响应的似然直接更新LLM。由于DPO的简单性和较低的计算成本,直接对齐算法(DAA)的使用和开发日益增多,这些算法直接在偏好和非偏好配对数据集上训练。

尽管DAA很流行,但最近的研究发现了其一个关键局限:它们可能过度优化其隐含奖励模型,最终限制LLM生成质量的提升(Rafailov等人,2024 (https://arxiv.org/html/2607.16240#bib.bib48);Razin等人,2024 (https://arxiv.org/html/2607.16240#bib.bib7);Huang等人,2024 (https://arxiv.org/html/2607.16240#bib.bib6))。过度优化的一种常见且令人担忧的表现是似然位移(Razin等人,2024 (https://arxiv.org/html/2607.16240#bib.bib7)),即偏好响应和非偏好响应的似然同时下降,可能导致有害行为。然而,尽管有这些记录的问题,DAA仍成功用于后训练(Dubey等人,2024 (https://arxiv.org/html/2607.16240#bib.bib12);Groeneveld等人,2024 (https://arxiv.org/html/2607.16240#bib.bib13))。

已有多种假说解释DAA中过度优化的原因:偏好与非偏好响应之间的嵌入或文本相似度高(Pal等人,2024 (https://arxiv.org/html/2607.16240#bib.bib10);Tajwar等人,2024 (https://arxiv.org/html/2607.16240#bib.bib9);Razin等人,2024 (https://arxiv.org/html/2607.16240#bib.bib7)),或隐含奖励函数形状提供的正则化不足(Huang等人,2024 (https://arxiv.org/html/2607.16240#bib.bib6);Gupta等人,2025 (https://arxiv.org/html/2607.16240#bib.bib8))。然而,没有一种假说能令人满意地推广到所有DAA目标。例如,DAA之间的一个常见区别是奖励计算中是否存在参考模型(如DPO使用参考模型计算奖励,而SimPO(Meng等人,2024 (https://arxiv.org/html/2607.16240#bib.bib11))是无参考的),解释有参考方法过度优化的假说不适用于无参考方法,反之亦然。现有关于过度优化的分析(Yoon等人,2025 (https://arxiv.org/html/2607.16240#bib.bib23);Huang等人,2024 (https://arxiv.org/html/2607.16240#bib.bib6);Razin等人,2024 (https://arxiv.org/html/2607.16240#bib.bib7))主要专注于单一DAA实例(有参考或无参考),并非两者兼顾。当前假说的局限性促使我们提出研究问题:我们如何解释并缓解有参考和无参考奖励中的奖励过度优化?

在这项工作中,我们提出奖励过度优化(尤其是似然位移)源于隐含奖励缺乏归一化。为应对这一点,我们引入了一个正则化项,旨在保持偏好和非偏好响应对中总响应概率的守恒。为验证正则化项的有效性,我们评估了它对有参考(DPO)和无参考(SimPO)方法的影响。我们发现,加入正则化项导致:(1) 在生成质量和通用能力基准之间实现更优的权衡;(2) 在多个数据集上奖励建模达到可比或更好性能。此外,我们的分析揭示了对似然位移机制的新见解。我们发现这一现象高度集中,一小部分离群标记占据了似然变化的大部分。关于对齐主要集中在少量标记上的相关观察在先前工作中也有出现(Lin等人,2023a (https://arxiv.org/html/2607.16240#bib.bib50);Qi等人,2024 (https://arxiv.org/html/2607.16240#bib.bib51))。基于Yoon等人(2025 (https://arxiv.org/html/2607.16240#bib.bib23))的梯度分析,我们发现低似然标记主导了梯度,可能导致离群标记的大幅变化,而我们的正则化项缓解了这些变化。这些发现进一步支持了我们正则化项的使用,并更清晰地解释了为什么像DPO和SimPO这样的DAA在引起似然位移的同时仍能改善生成。以下总结关键结果:

1. 我们阐述了未能充分考虑未见响应分布如何导致似然位移等现象。
2. 我们提出了似然位移的机制性解释,将其在离群标记上的集中性与配分函数的扰动联系起来,并通过梯度分析展示我们的正则化项如何缓解它们的过大影响,其中纠正性更新集中在低似然标记上。
3. 我们证明,对于DPO和SimPO,我们的修正目标改善了生成质量与基准性能之间的权衡(Lin等人,2023b (https://arxiv.org/html/2607.16240#bib.bib39))。

见标题
图1:似然位移的示意示例以及我们的正则化如何缓解它。参考模型对响应A、B、C分配似然0.4、0.3、0.3,由于配分函数为1,概率与之匹配。然后我们在单一偏好上训练…(后续内容省略,由于图像型内容需要保留?但原图是表格和文本混合,我们按翻译规则处理)

表11:离群类别分布:Mistral-7B-Instruct-v0.2的SimPO与N-SimPO。
类别 | SimPO计数 | SimPO% | N-SimPO计数 | N-SimPO% | 变化(Δ%)
--- | --- | --- | --- | --- | ---
function_word | 728 | 24.8 | 685 | 23.4 | -1.5
number | 30 | 1.0 | 36 | 1.2 | +0.2
punctuation | 440 | 15.0 | 420 | 14.3 | -0.7
single_letter | 166 | 5.7 | 168 | 5.7 | +0.1
special_token | 13 | 0.4 | 16 | 0.6 | +0.1
subword_fragment | 1364 | 46.5 | 1425 | 48.6 | +2.1
symbol | 13 | 0.4 | 13 | 0.4 | +0.0
whitespace | 179 | 6.1 | 170 | 5.8 | -0.3

表12:离群汇总:Mistral-7B-Instruct-v0.2的SimPO与N-SimPO。
统计量 | SimPO | N-SimPO
--- | --- | ---
总标记数 | 58,655 | 58,655
离群数 | 2,933 | 2,933
离群% | 5.0 | 5.0
阈值 | -6.1987 | -5.4903
奖励均值 | -0.9325 | -0.8133
奖励标准差 | 2.4994 | 2.2270
离群奖励均值 | -9.5135 | -8.5701
离群奖励最小值 | -31.5423 | -32.0055

表13:共享和唯一离群标记:Mistral-7B-Instruct-v0.2的SimPO与N-SimPO。
标记 | 类别 | 计数
--- | --- | ---
共享离群标记 | . | punctuation | 199
whitespace | 147
the | function_word | 118
, | punctuation | 95
a | single_letter | 90
and | function_word | 87
is | function_word | 47
that | function_word | 41
to | function_word | 38
in | function_word | 36
SimPO独有 | By | function_word | 2
over | subword_fragment | 2
knows | subword_fragment | 1
approach | subword_fragment | 1
wages | subword_fragment | 1
stopping | subword_fragment | 1
application | subword_fragment | 1
latest | subword_fragment | 1
touch | subword_fragment | 1
first | subword_fragment | 1
N-SimPO独有 | certain | subword_fragment | 2
Because | subword_fragment | 1
" | punctuation | 1
seems | subword_fragment | 1
em | subword_fragment | 1
follow | subword_fragment | 1
b | single_letter | 1
Che | subword_fragment | 1
Who | subword_fragment | 1
distinguish | subword_fragment | 1

### A.2 OLMo-7B-SFT-hf

表14:离群类别分布:OLMo-7B-SFT-hf的DPO与N-DPO。
类别 | DPO计数 | DPO% | N-DPO计数 | N-DPO% | 变化(Δ%)
--- | --- | --- | --- | --- | ---
content_word | 362 | 35.6 | 1339 | 48.4 | +12.8
function_word | 139 | 13.7 | 410 | 14.8 | +1.1
number | 38 | 3.7 | 75 | 2.7 | -1.0
other_single_char | 3 | 0.3 | 6 | 0.2 | -0.1
punctuation | 70 | 6.9 | 178 | 6.4 | -0.5
single_letter | 54 | 5.3 | 120 | 4.3 | -1.0
special_token | 37 | 3.6 | 58 | 2.1 | -1.5
subword_fragment | 92 | 9.0 | 260 | 9.4 | +0.3
symbol | 21 | 2.1 | 69 | 2.5 | +0.4
whitespace | 200 | 19.7 | 249 | 9.0 | -10.7

表15:离群汇总:OLMo-7B-SFT-hf的DPO与N-DPO。
统计量 | DPO | N-DPO
--- | --- | ---
总标记数 | 55,261 | 55,261
离群数 | 1,016 | 2,764
离群% | 1.8 | 5.0
阈值 | -2.0000 | -2.4403
奖励均值 | -0.1585 | -0.3777
奖励标准差 | 1.3822 | 1.3455
离群奖励均值 | -5.9049 | -4.5450
离群奖励最小值 | -57.3944 | -27.8938

表16:共享和唯一离群标记:OLMo-7B-SFT-hf的DPO与N-DPO。
标记 | 类别 | 计数
--- | --- | ---
共享离群标记 | whitespace | 197
<|endoftext|> | special_token | 37
. | punctuation | 24
I | single_letter | 18
the | function_word | 13
U+FFFD | symbol | 12
is | function_word | 11
and | function_word | 10
1 | number | 8
'' | subword_fragment | 8
DPO独有 | 85 | number | 3
'd | subword_fragment | 2
Current | subword_fragment | 1
p | single_letter | 1
Por | subword_fragment | 1
generate | content_word | 1
Part | content_word | 1
until | content_word | 1
Fellow | content_word | 1
confidence | content_word | 1
N-DPO独有 | we | content_word | 12
have | function_word | 12
more | content_word | 8
By | function_word | 7
know | content_word | 6
help | content_word | 5
them | content_word | 5
3 | number | 5
Cell | subword_fragment | 5
magnetic | subword_fragment | 5

表17:离群类别分布:OLMo-7B-SFT-hf的SimPO与N-SimPO。
类别 | SimPO计数 | SimPO% | N-SimPO计数 | N-SimPO% | 变化(Δ%)
--- | --- | --- | --- | --- | ---
content_word | 149 | 33.9 | 204 | 47.8 | +13.9
function_word | 46 | 10.4 | 75 | 17.6 | +7.1
number | 12 | 2.7 | 13 | 3.0 | +0.3
punctuation | 24 | 5.5 | 36 | 8.4 | +3.0
single_letter | 46 | 10.4 | 49 | 11.5 | +1.0
special_token | 10 | 2.3 | 9 | 2.1 | -0.2
subword_fragment | 13 | 3.0 | 17 | 4.0 | +1.0
symbol | 1 | 0.2 | 2 | 0.5 | +0.2
whitespace | 139 | 31.6 | 22 | 5.2 | -26.4

表18:离群汇总:OLMo-7B-SFT-hf的SimPO与N-SimPO。
统计量 | SimPO | N-SimPO
--- | --- | ---
总标记数 | 55,261 | 55,261
离群数 | 440 | 427
离群% | 0.8 | 0.8
阈值 | -2.0000 | -2.0000
奖励均值 | -0.0609 | -0.0576
奖励标准差 | 0.5155 | 0.4505
离群奖励均值 | -4.1299 | -3.2282
离群奖励最小值 | -15.0571 | -9.6681

表19:共享和唯一离群标记:OLMo-7B-SFT-hf的SimPO与N-SimPO。
标记 | 类别 | 计数
--- | --- | ---
共享离群标记 | whitespace | 139
I | single_letter | 41
<|endoftext|> | special_token | 10
. | punctuation | 9
you | content_word | 8
! | punctuation | 7
and | function_word | 7
here | content_word | 7
'm | subword_fragment | 6
2 | number | 6
SimPO独有 | How | content_word | 1
Part | content_word | 1
N-SimPO独有 | is | function_word | 3
based | content_word | 2
not | function_word | 2
write | content_word | 1
Great | content_word | 1
may | function_word | 1
certainly | content_word | 1
models | content_word | 1
services | content_word | 1
30 | number | 1

## 附录B 超参数

我们提供每个方法和模型进行超参数搜索时使用的超参数集。

Mistral-7B-Instruct | Llama-3.1-8B-Instruct | OLMo-7B-SFT
--- | --- | ---
DPO | [0.03, 0.1, 0.3] | [0.01, 0.03, 0.1] | [0.03, 0.1, 0.3]
N-DPO | [0.3, 1.0, 3.0] | [0.3, 1.0, 3.0] | [0.3, 1.0, 3.0]
SimPO | [0.3, 1.0, 3.0] | [0.3, 1.0, 3.0] | [0.3, 1.0, 3.0]
N-SimPO | [3.0] | [3.0] | [0.3]
表20:每个模型/方法超参数搜索使用的β值集

Mistral-7B-Instruct | Llama-3.1-8B-Instruct | OLMo-7B-SFT
--- | --- | ---
SimPO | [0.4, 0.8, 1.2, 1.6, 2.0] | [0.4, 0.8, 1.2, 1.6, 2.0] | [0.4, 0.8, 1.2, 1.6, 2.0]
N-SimPO | [0.8, 1.2, 1.6, 2.0] | [0.8, 1.2, 1.6, 2.0] | [0.8, 1.2, 1.6, 2.0]
表21:每个模型/方法超参数搜索使用的γ值集

Mistral-7B-Instruct | Llama-3.1-8B-Instruct | OLMo-7B-SFT
--- | --- | ---
N-DPO | [0.0, 0.025, 0.05, 0.075, 0.1] | [0.0, 0.025, 0.05, 0.075, 0.1] | [0.0, 0.025, 0.05, 0.075, 0.1]
N-SimPO | [0.025, 0.05, 0.075, 0.1] | [0.025, 0.05, 0.075, 0.1] | [0.025, 0.05, 0.075, 0.1]
表22:每个模型/方法超参数搜索使用的λ值集

Mistral-7B-Instruct | Llama-3.1-8B-Instruct | OLMo-7B-SFT
--- | --- | ---
[3e-8, 1e-7, 3e-7] | [1e-7, 3e-7, 1e-6] | [1e-7, 3e-7, 1e-6]
表23:每个模型超参数搜索使用的学习率集

Mistral-7B-Instruct | Llama-3.1-8B-Instruct | OLMo-7B-SFT
--- | --- | ---
β | (0.03/1.0/3.0/3.0) | (0.01/3.0/3.0/3.0) | (0.03/3.0/0.3/0.3)
γ | (0/0/1.6/2.0) | (0/0/0.8/2.0) | (0/0/0.4/1.6)
λ | (0/0.1/0/0.1) | (0/0.025/0/0.025) | (0/0.05/0/0.025)
学习率 | (1e-7/3e-7/1e-7/1e-7) | (3e-7/1e-6/3e-7/1e-6) | (3e-7/1e-6/1e-7/3e-7)
表24:模型评估使用的超参数。(DPO/N-DPO/SimPO/N-SimPO)

## 附录C 梯度推导

我们推导正则化项 $\mathcal{R}(\pi_\theta,\pi_{\text{ref}},x,y_w,y_l)=\lambda\left(\log\frac{\bar{\pi}_\theta(y_w|x)+\bar{\pi}_\theta(y_l|x)}{\bar{\pi}_{\text{ref}}(y_w|x)+\bar{\pi}_{\text{ref}}(y_l|x)}\right)^2$ (17) 关于参数 $\theta$ 的梯度。令 $g(\pi_\theta)=\left(\log\frac{\bar{\pi}_\theta(y_w|x)+\bar{\pi}_\theta(y_l|x)}{\bar{\pi}_{\text{ref}}(y_w|x)+\bar{\pi}_{\text{ref}}(y_l|x)}\right)$,则 $\nabla_\theta \mathcal{R}=2\lambda g(\pi_\theta)\nabla_\theta g(\pi_\theta)$ (18)。现在,定义 $h(\pi_\theta)=\frac{\bar{\pi}_\theta(y_w|x)+\bar{\pi}_\theta(y_l|x)}{\bar{\pi}_{\text{ref}}(y_w|x)}$...(后续推导略,保持原文未完整给出)

相似文章

基于注意力机制的Token加权直接偏好优化

arXiv cs.CL

提出AttentionPO,一种基于Token加权的直接偏好优化方法,它利用LLM自身的注意力来估计Token权重,在AlpacaEval、MT-Bench和ArenaHard上提升对齐性能,且无需单独奖励模型。

xi-DPO:通过比率奖励边际的直接偏好优化

arXiv cs.LG

本文介绍了 xi-DPO,这是一种新颖的偏好优化方法,通过将目标重构为最小化与最优比率奖励边际的距离,解决了 SimPO 中的超参数调整难题。实验结果表明,xi-DPO 在开放基准测试中优于现有方法。

分布鲁棒的列表级偏好优化

arXiv cs.AI

本文提出一种用于LLM对齐的分布鲁棒列表级偏好优化方法,处理排序标签不确定性,具有可处理的目标函数和强收敛性保证。