传递性与循环性的相遇:面向动态大语言模型对齐的显式偏好分解
摘要
本文介绍了混合奖励循环(HRC)模型和动态自对弈偏好优化(DSPPO)方法,以解决大语言模型对齐中人类偏好的循环特性,在Bradley-Terry和通用偏好模型(GPM)基线上取得了更优的性能表现。
arXiv:2605.17342v1 公告类型:新
摘要:标准RLHF依赖于传递性的标量奖励,无法捕捉人类偏好的循环特性。尽管诸如通用偏好模型(GPM)等方法尝试解决这一问题,但我们发现了一个理论局限性:其隐式表述将层次性与循环性纠缠在一起,无法保证主导解的存在。为解决此问题,我们提出了混合奖励循环(HRC)模型,该模型利用博弈论分解将偏好显式解耦为正交的传递性(标量)和循环性(向量)分量。作为补充,我们引入了动态自对弈偏好优化(DSPPO),将对齐视为一个时变博弈,逐步引导策略达到纳什均衡。合成数据实验进一步验证了HRC在混合传递-循环场景中的结构优势,HRC相比GPM收敛更快、准确率更高。在RewardBench 2上的实验表明,HRC在BT和GPM基线上均有持续改进(例如,在Gemma-2B-it上提升1.23%)。特别是在Ties领域的优异表现,实证验证了模型在处理复杂、非严格偏好时的鲁棒性。在AlpacaEval 2.0、Arena-Hard-v0.1和MT-Bench上的广泛下游评估证实了我们框架的有效性。值得注意的是,当使用Gemma-2B-it作为基础偏好模型时,HRC+DSPPO在AlpacaEval 2.0上的峰值长度控制胜率达到44.75%,在Arena-Hard-v0.1上达到46.8%,显著优于使用BT或GPM训练的SPPO基线。我们的代码已公开在https://github.com/lab-klc/Hybrid-Reward-Cyclic。
查看缓存全文
缓存时间: 2026/05/19 06:39
# 传递性与循环性的交汇:面向动态大语言模型对齐的显式偏好分解
来源:https://arxiv.org/html/2605.17342
###### 摘要
标准 RLHF 依赖传递性的标量奖励,无法捕捉人类偏好中的循环特性。虽然诸如通用偏好模型(GPM)等方法试图解决这一问题,但我们发现其存在理论局限:隐含的公式将层级性与循环性纠缠在一起,无法保证主导解的存在。为应对这一挑战,我们提出混合奖励-循环(HRC)模型,利用博弈论分解将偏好显式地解耦为正交的传递性(标量)和循环性(向量)两部分。在此基础上,我们引入动态自对弈偏好优化(DSPPO),将对齐视为时变博弈,逐步引导策略收敛至纳什均衡。合成数据实验进一步验证了 HRC 在混合传递-循环场景下的结构优势:其收敛速度更快,准确率高于 GPM。RewardBench 2 上的实验表明,HRC 在 BT 和 GPM 基线上均有一致提升(例如,在 Gemma-2B-it 上提升 1.23%)。特别是在 Ties 领域的卓越性能,实证验证了模型在处理复杂、非严格偏好方面的鲁棒性。在 AlpacaEval 2.0、Arena-Hard-v0.1 和 MT-Bench 上的大量下游评估证实了我们框架的有效性。值得注意的是,使用 Gemma-2B-it 作为基础偏好模型时,HRC+DSPPO 在 AlpacaEval 2.0 上达到峰值长度控制胜率 44.75%,在 Arena-Hard-v0.1 上达到 46.8%,显著优于使用 BT 或 GPM 训练的 SPPO 基线。我们的代码已公开在 https://github.com/lab-klc/Hybrid-Reward-Cyclic。
机器学习,ICML
## 1 引言
随着大语言模型(LLMs)在多项任务中展现出卓越性能(Brown 等,2020 (https://arxiv.org/html/2605.17342#bib.bib9); Achiam 等,2023 (https://arxiv.org/html/2605.17342#bib.bib1); Li 等,2024 (https://arxiv.org/html/2605.17342#bib.bib27))。将大语言模型与复杂的人类价值观对齐是现代AI安全与实用性的基石(Weidinger 等,2021 (https://arxiv.org/html/2605.17342#bib.bib43); Ji 等,2023 (https://arxiv.org/html/2605.17342#bib.bib24); Xu 等,2025 (https://arxiv.org/html/2605.17342#bib.bib47))。这一对齐过程的有效性通常由基于人类反馈的强化学习(RLHF)驱动(Christiano 等,2017 (https://arxiv.org/html/2605.17342#bib.bib11)),其根本依赖于作为人类判断代理的奖励模型的可靠性。偏好学习算法通常采用成对比较来捕捉人类判断(Ibarz 等,2018 (https://arxiv.org/html/2605.17342#bib.bib23); Ziegler 等,2019 (https://arxiv.org/html/2605.17342#bib.bib54))。虽然 Bradley-Terry(BT)模型(Bradley & Terry, 1952 (https://arxiv.org/html/2605.17342#bib.bib8))作为标准被广泛使用(Bai 等,2022 (https://arxiv.org/html/2605.17342#bib.bib3); Rafailov 等,2023 (https://arxiv.org/html/2605.17342#bib.bib33)),但它依赖标量奖励,强制要求严格的传递性假设(即 A≻B ∧ B≻C ⇒ A≻C)。然而,现实世界中的人类偏好本质上是异质的,往往表现出非传递的循环模式(例如石头-剪刀-布动力学)(Tversky, 1969 (https://arxiv.org/html/2605.17342#bib.bib41); Savage Jr, 1994 (https://arxiv.org/html/2605.17342#bib.bib36); Gehrlein, 2006 (https://arxiv.org/html/2605.17342#bib.bib17); Munos 等,2024 (https://arxiv.org/html/2605.17342#bib.bib31)),标量模型从根本上无法捕捉这些特性。早期方法如 PairRM/PairPM(Jiang 等,2023 (https://arxiv.org/html/2605.17342#bib.bib25); Dong 等,2024 (https://arxiv.org/html/2605.17342#bib.bib14))直接从拼接输入预测偏好,理论上能捕捉非传递动力学。但它们的推理复杂度 O(K²) 限制了其在可扩展对齐场景中的应用。认识到偏好的非传递性,通用偏好模型(GPM)(Zhang 等,2025c (https://arxiv.org/html/2605.17342#bib.bib50))将响应映射到潜在嵌入,通过斜对称双线性形式以线性复杂度建模这些动力学。
(见图注)
图1:Bradley-Terry(BT)模型与所提出的混合奖励-循环(HRC)模型的比较。(a) BT模型将每个指令-响应对映射为标量奖励,假设偏好具有传递性。(b) HRC模型将偏好显式分解为传递性标量分量(通过BT)和循环性向量分量(通过GPM),并将它们组合产生最终偏好信号 s_HRC。
虽然 GPM 有效建模了循环动力学,但它的形式能否同时保留传递性的全局层级(如安全性、有用性)并处理循环性细微差异仍未被充分探索。本文中我们识别出一个关键理论间隙:GPM 无法保证在任意循环上下文中表示主导解,原因在于这些性质相互纠缠。这一见解促使我们从博弈论视角重新审视偏好建模,将成对偏好关系视为对称零和博弈(Balduzzi 等,2019 (https://arxiv.org/html/2605.17342#bib.bib5))。利用任何此类博弈都可分解的理论洞察,我们提出混合奖励-循环(HRC)模型。与 GPM(Zhang 等,2025c (https://arxiv.org/html/2605.17342#bib.bib50))等先前方法不同,HRC 将人类偏好显式解耦为两个正交分量:捕捉一致全局排名的传递性标量分量,以及建模非传递局部动力学的循环性向量分量。这种显式分解不仅增强了可解释性,还引入了建模主导层级的显式归纳偏置,使 HRC 在保持线性推理复杂度 O((2d+1)K)(其中 d≥1 是超参数)的同时实现更优性能。
此外,为了将大语言模型与 HRC 有效对齐,我们聚焦于博弈论对齐范式(如 SPPO(Wu 等,2025b (https://arxiv.org/html/2605.17342#bib.bib46)),INPO(Zhang 等,2025b (https://arxiv.org/html/2605.17342#bib.bib49)))。我们优先选择这类算法,因为它们直接针对偏好概率进行优化,从而保留了非传递建模能力。然而,现有该范畴的框架通常依赖静态偏好预言,这限制了它们在复杂偏好景观中的导航能力。将偏好视为固定不变,忽略了 HRC 所揭示的偏好多维结构。为应对这一挑战,我们提出动态自对弈偏好优化(DSPPO),这是一个针对时变偏好博弈的通用框架。受课程学习成功(Bengio 等,2009 (https://arxiv.org/html/2605.17342#bib.bib6); Hacohen & Weinshall, 2019 (https://arxiv.org/html/2605.17342#bib.bib19))的启发,我们利用 DSPPO 编排一个优化轨迹,从鲁棒的传递性骨干过渡到精细的循环性细微差异。这种策略通过在引入复杂局部动力学之前建立全局质量基线来稳定训练,确保收敛到完整偏好博弈的纳什均衡。
我们的主要贡献总结如下:
- • 我们提出了 HRC 模型,在理论上统一了 BT 模型和 GPM。通过将偏好显式分解为传递性和循环性分量,HRC 模型解决了 BT 模型和 GPM 的结构性局限。
- • 我们引入了 DSPPO,一种利用 HRC 结构调度偏好信号复杂度的对齐算法,在复杂景观中实现更鲁棒的收敛。
- • 在基于 UltraFeedback(Cui 等,2024 (https://arxiv.org/html/2605.17342#bib.bib12))构建的合成数据、RewardBench2(Malik 等,2025 (https://arxiv.org/html/2605.17342#bib.bib30))、AlpacaEval 2.0(Dubois 等,2024 (https://arxiv.org/html/2605.17342#bib.bib15))、Arena-Hard-v0.1(Li 等,2025 (https://arxiv.org/html/2605.17342#bib.bib28))和 MT-Bench(Zheng 等,2023 (https://arxiv.org/html/2605.17342#bib.bib51))上的广泛实验表明,我们的框架在偏好建模准确性和下游生成质量上均持续优于现有基线。
## 2 相关工作
### 2.1 RLHF中的偏好建模
在标准 RLHF 框架(Christiano 等,2017 (https://arxiv.org/html/2605.17342#bib.bib11))中,人类偏好主要通过 Bradley-Terry(BT)模型(Bradley & Terry, 1952 (https://arxiv.org/html/2605.17342#bib.bib8))进行建模,该模型通常使用可学习的奖励函数 r(y|x) 为每个响应分配一个标量分数。为了在 RLHF 框架内探索替代偏好模型,研究人员提出了若干方法,例如用于 K 个比较的 Plackett-Luce 模型(Zhu 等,2023 (https://arxiv.org/html/2605.17342#bib.bib53)),用于建模偏好分布的基于能量的模型(Hong 等,2025 (https://arxiv.org/html/2605.17342#bib.bib20)),以及像 ArmoRM(Wang 等,2024 (https://arxiv.org/html/2605.17342#bib.bib42))这样的多维奖励系统。然而,尽管存在这些结构变化,这些方法在最终决策时本质上仍依赖于标量分数或线性聚合。因此,它们隐式地保留了传递性假设(即若 A≻B 且 B≻C,则 A≻C),从而限制了其显式表示异质人类反馈中常出现的复杂非传递(循环)模式的能力(Tversky, 1969 (https://arxiv.org/html/2605.17342#bib.bib41); Munos 等,2024 (https://arxiv.org/html/2605.17342#bib.bib31))。
近期工作聚焦于在 RLHF 中显式建模非传递偏好。虽然早期的成对方法(如 PairPM/PairRM)(Jiang 等,2023 (https://arxiv.org/html/2605.17342#bib.bib25); Dong 等,2024 (https://arxiv.org/html/2605.17342#bib.bib14))可以捕捉循环模式,但在对 K 个候选响应进行排序时,它们面临难以承受的二次推理成本 O(K²)。为解决这一可扩展性瓶颈,GPM(Zhang 等,2025c (https://arxiv.org/html/2605.17342#bib.bib50))采用低秩实斜对称公式,具有三个关键优势:(1) 通过潜在维度超参数 d 控制表达能力;(2) 线性推理复杂度 O(2dK) 带来的卓越效率;(3) 对于任意 d≥1 均能固有的建模循环动力学能力。
### 2.2 基于偏好的从人类反馈的强化学习
传统 RLHF(Christiano 等,2017 (https://arxiv.org/html/2605.17342#bib.bib11))通常遵循两阶段范式:学习一个标量奖励模型 r(y|x) 作为人类偏好的代理,然后通过 PPO(Schulman 等,2017 (https://arxiv.org/html/2605.17342#bib.bib37))等算法进行策略优化。近年来,一些工作提出了基于偏好的对齐方法,使用偏好概率作为信号来优化策略。代表性方法是 IPO(Azar 等,2024 (https://arxiv.org/html/2605.17342#bib.bib2)),它基于这些概率构建了一个直接优化目标。最近,一种严格的博弈论视角逐渐受到重视,将大语言模型对齐视为求解一个多玩家零和博弈以找到纳什均衡。NLHF(Munos 等,2024 (https://arxiv.org/html/2605.17342#bib.bib31))首次将该公式引入该领域。沿此方向,一系列工作——包括 SPO(Swamy 等,2024 (https://arxiv.org/html/2605.17342#bib.bib38))、DNO(Rosset 等,2024 (https://arxiv.org/html/2605.17342#bib.bib35))、SPPO(Wu 等,2025b (https://arxiv.org/html/2605.17342#bib.bib46))、INPO(Zhang 等,2025b (https://arxiv.org/html/2605.17342#bib.bib49))、GPO(Zhang 等,2025c (https://arxiv.org/html/2605.17342#bib.bib50))、EGPO(Zhou 等,2025 (https://arxiv.org/html/2605.17342#bib.bib52))、ONPO(Zhang 等,2025a (https://arxiv.org/html/2605.17342#bib.bib48))和 MNPO(Wu 等,2025a (https://arxiv.org/html/2605.17342#bib.bib45))——聚焦于直接从偏好信号优化策略,从而缓解标量奖励函数的局限性。
## 3 预备知识
我们考虑标准语言生成设定。一个生成式语言模型 π 将提示 x = (x₁, x₂, ...) ∼ X 映射到响应上的概率分布,从中我们可以采样候选序列 y 和 y′。生成任意响应 y = (y₁, ..., yₜ) 的概率通过自回归分解定义为 π(y|x) = ∏ₜ₌₁ᵀ π(yₜ|y<ₜ, x)。
### 3.1 偏好建模
在标准 RLHF 中,通常采用 Bradley-Terry(BT)模型(Bradley & Terry, 1952 (https://arxiv.org/html/2605.17342#bib.bib8)),该模型分配一个标量奖励 r(y|x) ∈ ℝ,并定义偏好概率为 P_BT(y ≻ y′|x) = σ(r(y|x) - r(y′|x)),其中 σ 是 sigmoid 函数。该模型隐式强加传递性:r > r(y′) 且 r(y′) > r(y″) 严格蕴含 r(y) > r(y″),从而禁止循环偏好的表示。
为捕捉非传递动力学,近期工作(Zhang 等,2025c (https://arxiv.org/html/2605.17342#bib.bib50))提出了通用偏好模型(GPM)。不同于 BT 的标量公式,GPM 将成对映射到潜在向量 v(y|x) ∈ ℝ²ᵈ,并通过斜对称算子定义偏好分数:
s_GPM(y, y′|x) = v(y|x)ᵀ W v(y′|x),(1)
其中 W ∈ ℝ²ᵈײᵈ 是实斜对称矩阵(Wᵀ = -W)。最终概率为 P_GPM = σ(s_GPM)。由于斜对称性,s(y, y′) = -s(y′, y),使得模型能够在维度 2d ≥ 2 时自然地表示循环偏好结构。
### 3.2 基于偏好的从人类反馈的强化学习
传统的对齐方法,如 PPO(Schulman 等,2017 (https://arxiv.org/html/2605.17342#bib.bib37)),依赖 BT 模型(Bradley & Terry, 1952 (https://arxiv.org/html/2605.17342#bib.bib8))在 KL 散度约束下最大化期望标量奖励。虽然有效,但这种标量公式隐含假设偏好具有传递性。近期一些工作直接基于偏好信号构建算法。给定偏好预言 P(y ≻ y′|x),对齐过程被视为寻找一个策略 π_θ 使其优于竞争者 π′。例如,IPO 算法(Azar 等,2024 (https://arxiv.org/html/2605.17342#bib.bib2))针对固定竞争者 μ 进行优化:
max_θ E_{x∼X} [ E_{y∼π_θ, y′∼μ} [P(y ≻ y′|x)] - β D_KL(π_θ(·|x) || π_ref(·|x)) ],相似文章
RLearner-LLM:通过混合直接偏好优化平衡大语言模型的逻辑基础与流畅性
本文介绍了RLearner-LLM,一个使用混合直接偏好优化(Hybrid-DPO)的框架,旨在平衡LLM生成解释的逻辑正确性和流畅性。该框架在多个领域和基础模型上实现了显著的NLI蕴含改进,同时减轻了标准偏好信号中的冗长偏差。
大语言模型中词汇对齐与偏好阶段转变的全自动识别
本文提出了两种自动化指标:词汇对齐分数(Lexical Alignment Score)和三角化偏好转变(Triangulated Preference Shift),用于识别大语言模型中的词汇过度使用,并将其归因于偏好学习阶段。该方法在六个模型家族上使用PubMed摘要进行测试,无需人工干预即可重复先前的研究发现。
语言模型中对齐算法的机制分析
本文对六种偏好优化方法(PPO、DPO、SimPO、ORPO、GRPO、KTO)在三种开源模型系列上进行了系统性的机制分析,通过探针和稀疏自编码器揭示了对齐算法如何以不同的方式重塑内部表示。
DPO与RLHF的条件等价性:隐含假设、失败模式与可证明的对齐
本文证明了直接偏好优化(DPO)与基于人类反馈的强化学习(RLHF)之间的等价性是有条件的,并且在实践中经常被违反,揭示了DPO优化相对优势而非绝对对齐的失败模式。作者引入了约束偏好优化(CPO)以实现可证明的对齐,并展示了最先进的性能。
拓扑增强的大语言模型对齐:轨迹拓扑损失与拓扑偏好优化
本文介绍了一种用于大语言模型的拓扑增强对齐框架,利用基于持续同调的轨迹拓扑损失和拓扑偏好优化,对隐藏空间中的语义轨迹进行正则化。