SP3O:无需奖励建模的基于片段偏好的强化学习

arXiv cs.LG 论文

摘要

介绍SP3O,一种新颖的无需奖励模型、无需评论家的基于梯度的偏好强化学习算法,利用片段级偏好,在机器人控制和LLM微调中展现出改进的性能,尤其是在长时程任务中。

arXiv:2608.02951v1 公告类型:新 摘要:针对一般随机MDP的基于偏好的强化学习(PbRL)通常需要训练奖励模型。现有的无奖励模型方法要么局限于老虎机或确定性MDP,如DPO或P3O,要么使用零阶、无梯度的优化,其收敛速度通常慢于基于梯度的算法。此外,现有的无奖励模型的偏好强化学习算法几乎只使用轨迹级反馈,当轨迹较长时,这可能需要人工评估者投入大量精力。另一方面,片段要短得多,因此更容易进行比较和评估。在本文中,我们提出了一种新颖的、无奖励模型、无评论家且基于梯度的PbRL算法,兼容片段偏好,名为片段成对近端策略优化(SP3O)。SP3O利用片段级偏好反馈,通过离策略重要性采样构建精确的策略价值差估计器,然后使用该估计器通过PPO型损失函数计算策略梯度。我们为该算法提供了理论基础,并分析了选择片段长度时的权衡。我们还在机器人控制和LLM微调场景中与其他PbRL/RLHF算法进行了实验对比,以展示其改进的性能,尤其是在长时程任务中。
查看原文
查看缓存全文

缓存时间: 2026/08/05 07:43

# SP3O:无需奖励建模的基于分段偏好的强化学习

来源:https://arxiv.org/html/2608.02951

Qining Zhang  
密歇根大学安娜堡分校  
qiningz@umich\.edu  

Lei Ying  
密歇根大学安娜堡分校  
leiying@umich\.edu  

###### 摘要

基于偏好的强化学习(PbRL)针对一般随机MDP通常需要训练奖励模型。现有的无需奖励模型的方法要么局限于bandit或确定性MDP(如DPO或P3O),要么使用零阶、无梯度优化,而后者通常比基于梯度的算法收敛速度更慢。此外,现有的无需奖励模型的基于偏好的RL算法几乎只使用轨迹级反馈,当轨迹较长时,这会给人评价者带来显著负担。另一方面,分段要短得多,因此更容易比较和评估。在本文中,我们提出了一种新的无需奖励模型、无需critic、并且基于梯度的PbRL算法,该算法兼容分段偏好,名为分段成对近端策略优化(SP3O)。SP3O利用分段级偏好反馈,通过离策略重要性采样构造精确的策略价值差异估计器,然后使用该估计器通过类似PPO的损失函数计算策略梯度。我们为该算法提供了理论基础,并分析了选择分段长度时的权衡。我们还在机器人控制和LLM微调设置中与其他PbRL/RLHF算法进行了实验对比,以展示其改进的性能,特别是在长时域任务中。

## 1 引言

强化学习(RL)(Sutton et al.,1998 (https://arxiv.org/html/2608.02951#bib.bib1))在游戏博弈(Silver et al.,2016 (https://arxiv.org/html/2608.02951#bib.bib2); Vinyals et al.,2019 (https://arxiv.org/html/2608.02951#bib.bib3); Mnih et al.,2013 (https://arxiv.org/html/2608.02951#bib.bib4))和机器人控制(Schulman et al.,2017 (https://arxiv.org/html/2608.02951#bib.bib5); Haarnoja et al.,2018 (https://arxiv.org/html/2608.02951#bib.bib6))等领域取得了巨大成功。然而,将RL应用于更复杂的现实世界任务仍然具有挑战性,其中一个主要瓶颈是设计一个能够自然地鼓励智能体学习期望行为并避免奖励黑客(reward hacking)的奖励函数(Skalse et al.,2022 (https://arxiv.org/html/2608.02951#bib.bib7))。基于偏好的RL(PbRL)已成为解决这些问题的一个强大框架,在这种框架中,智能体不是在每个交互步骤接收数值奖励,而是主动向oracle(人类或AI系统(Lee et al.,2023a (https://arxiv.org/html/2608.02951#bib.bib8)))查询关于行为的偏好。被比较的候选通常采用一对完整轨迹或分段的形式。然后oracle返回其对候选的偏好,这些偏好随后被用于改进和优化策略。该方法在语言模型微调(Ouyang et al.,2022 (https://arxiv.org/html/2608.02951#bib.bib9); Bai et al.,2022 (https://arxiv.org/html/2608.02951#bib.bib10); Rafailov et al.,2023 (https://arxiv.org/html/2608.02951#bib.bib11); Shao et al.,2024 (https://arxiv.org/html/2608.02951#bib.bib12))、连续控制任务(Christiano et al.,2017 (https://arxiv.org/html/2608.02951#bib.bib13))、游戏博弈(Christiano et al.,2017 (https://arxiv.org/html/2608.02951#bib.bib13); Ibarz et al.,2018 (https://arxiv.org/html/2608.02951#bib.bib14))以及图像生成模型微调(Lee et al.,2023b (https://arxiv.org/html/2608.02951#bib.bib15))等领域取得了巨大成功。

**奖励模型。**许多现有的基于偏好的RL算法,包括用于LLM的基于人类反馈的强化学习(RLHF)(Ouyang et al.,2022 (https://arxiv.org/html/2608.02951#bib.bib9); Bai et al.,2022 (https://arxiv.org/html/2608.02951#bib.bib10); Shao et al.,2024 (https://arxiv.org/html/2608.02951#bib.bib12)),通过训练一个额外的神经网络(称为*奖励模型*),并使用经典的基于奖励的RL方法(如PPO(Schulman et al.,2017 (https://arxiv.org/html/2608.02951#bib.bib5)))来优化策略(Christiano et al.,2017 (https://arxiv.org/html/2608.02951#bib.bib13)),该策略基于奖励模型生成的数值奖励。根据应用的不同,奖励模型可以在线训练、离线训练或两者结合。该过程通常假设偏好来自基于未知真实奖励函数的Bradley-Terry模型(Bradley and Terry,1952 (https://arxiv.org/html/2608.02951#bib.bib16)),然后最大化看到这些偏好的对数似然。具体来说,这些工作大多假设偏好过程由轨迹分段的累积奖励和(Christiano et al.,2017 (https://arxiv.org/html/2608.02951#bib.bib13); Ibarz et al.,2018 (https://arxiv.org/html/2608.02951#bib.bib14))或轨迹的总奖励(Ouyang et al.,2022 (https://arxiv.org/html/2608.02951#bib.bib9); Bai et al.,2022 (https://arxiv.org/html/2608.02951#bib.bib10))决定,即对于两个轨迹(分段)σ1和σ2,它们都由L步组成,偏好一个候选而非另一个的概率由部分回报模型控制,即:

P[σ1≻σ2]=logistic(∑k=1Lr(sk1,ak1)−∑k=1Lr(sk2,ak2)),(1)

其中σ1={sk1,ak1}k=1L和σ2={sk2,ak2}k=1L分别是构成轨迹(分段)σ1和σ2的状态和动作的时间序列,logistic(⋅)是标准逻辑函数。也可以用其他连接函数替换逻辑函数(Zhang and Ying,2025a (https://arxiv.org/html/2608.02951#bib.bib17))。这种公式在实践中取得了成功,但最近的工作对这种简单偏好模型的充分性提出了质疑,并且也提出了各种变体(Knox et al.,2022 (https://arxiv.org/html/2608.02951#bib.bib18); Hejna et al.,2023 (https://arxiv.org/html/2608.02951#bib.bib19))。更重要的是,训练奖励模型具有挑战性:它使训练流程复杂化,需要额外的内存和计算资源,并在评估期间引发新的问题,包括分布偏移、缺乏真实标签以及联合训练中的过拟合(Casper et al.,2023 (https://arxiv.org/html/2608.02951#bib.bib20))。因此,通常更适合将奖励模型视为半定量评估工具,而不是真实奖励函数的完美代理。

**直接从偏好进行RL。**不依赖奖励模型训练的方法,如DPO(Rafailov et al.,2023 (https://arxiv.org/html/2608.02951#bib.bib11))和P3O(Wu et al.,2024 (https://arxiv.org/html/2608.02951#bib.bib21)),也已经被提出,但仅在限制性假设下有效。例如,这些算法最初是为上下文bandit设计的,只能推广到具有确定性转移的MDP,这使得它们不适合更复杂的现实世界RL问题,在这些问题中,随机性自然地从环境和与人类的交互中产生。此外,这些算法要求偏好必须是在从相同状态开始的完整轨迹之间。对于一般的RL设置,一种方法是使用零阶方法。例如,Zhang和Ying (2025a (https://arxiv.org/html/2608.02951#bib.bib17),b (https://arxiv.org/html/2608.02951#bib.bib22))提出了一种零阶策略优化算法,该算法通过扰动和比较两个策略来执行零阶策略更新。另一种方法是使用带有偏好的进化优化策略(Busa-Fekete et al.,2014 (https://arxiv.org/html/2608.02951#bib.bib23))。然而,在优化中,已知零阶和进化方法通常不如基于梯度的一阶方法收敛快,特别是当actor神经网络的规模扩大时。

**使用分段的RLHF。**评估短分段而不是长轨迹通常对人类评价者更容易。此外,当偏好是二元的时,评估更多短分段比评估长轨迹提供更多信息,即使总长度相同。由于这些原因,人们已经开发了使用分段之间偏好的算法(Wilson et al.,2012 (https://arxiv.org/html/2608.02951#bib.bib24); Christiano et al.,2017 (https://arxiv.org/html/2608.02951#bib.bib13); Lai et al.,2024 (https://arxiv.org/html/2608.02951#bib.bib25); Guo et al.,2026 (https://arxiv.org/html/2608.02951#bib.bib26))。然而,这些方法要么要求分段从相同状态开始(Lai et al.,2024 (https://arxiv.org/html/2608.02951#bib.bib25); Wilson et al.,2012 (https://arxiv.org/html/2608.02951#bib.bib24); Guo et al.,2026 (https://arxiv.org/html/2608.02951#bib.bib26)),这在某些环境中是不可能的,要么使用奖励模型(Christiano et al.,2017 (https://arxiv.org/html/2608.02951#bib.bib13); Guo et al.,2026 (https://arxiv.org/html/2608.02951#bib.bib26))。

在本文中,我们考虑一般的随机MDP,并旨在设计一种无需奖励建模的基于梯度的偏好RL算法。此外,基于上述原因,我们对具有分段偏好的RL感兴趣,其中分段不一定从相同状态开始。简而言之,我们的目标是直接从任意分段之间的偏好来训练策略。

### 1.1 主要贡献

在本文中,我们提出了一种新的使用分段偏好且无需奖励模型的PbRL算法,称为*分段成对近端策略优化*(SP3O)。SP3O可以被视为P3O(Wu et al.,2024 (https://arxiv.org/html/2608.02951#bib.bib21))向随机MDP设置、分段偏好以及允许偏好具有不同起始状态的推广。

**算法设计。**SP3O具有以下特点:
- • SP3O是无奖励模型、无critic的,并且适用于一般的随机MDP。
- • SP3O使用分段级偏好而非轨迹级偏好,这更容易评估。
- • SP3O使用基于梯度的策略优化以及on-policy和off-policy混合的方法,以高效利用人类偏好。

**理论分析。**我们为SP3O的设计提供了理论支持:
- • 我们证明,具有分段反馈的RL可以被视为一个带折扣的有限时域MDP,并仔细定义了终端奖励和初始状态分布,并证明该有限时域MDP的策略梯度是原始MDP策略梯度的缩放版本(定理1 (https://arxiv.org/html/2608.02951#Thmtheorem1))。这正式证明了可以使用分段偏好计算策略梯度。
- • 我们刻画了给定分段长度的估计器误差界(命题1 (https://arxiv.org/html/2608.02951#Thmproposition1)),这揭示了选择分段长度时的基本权衡,即分段长度不应太小也不应太大。

**实验评估。**我们在模拟机器人控制环境和LLM微调任务中,将SP3O与Online DPO(Guo et al.,2024 (https://arxiv.org/html/2608.02951#bib.bib27))、P3O(Wu et al.,2024 (https://arxiv.org/html/2608.02951#bib.bib21))和ZPG(Zhang and Ying,2025a (https://arxiv.org/html/2608.02951#bib.bib17))进行了实验对比。在两个实验中,我们表明SP3O在大多数设置下优于其他算法,并且随着时域的增长其优势越来越大。我们还对分段长度进行了小型消融研究,以表明使用过小或过大的分段长度都可能导致次优性能,这与命题1 (https://arxiv.org/html/2608.02951#Thmproposition1)中描述的权衡一致。

## 2 预备知识

我们考虑一个无限时域带折扣马尔可夫决策过程(MDP),由元组M=(S,A,d0,r,γ,P)定义,其中状态空间为S,动作空间为A,初始状态分布为d0,奖励函数r(s,a):S×A→[0,1],折扣因子γ∈(0,1),以及转移核P。我们考虑从偏好反馈中进行强化学习的设置,其中智能体不直接观察奖励r(s,a),而必须使用通常由人类生成的偏好反馈来训练。策略π:S→Δ(A)是从状态空间到动作概率分布的函数。我们考虑参数化策略πθ,其中θ可以是神经网络。我们定义MDP M在策略π下的状态和状态-动作值函数为:

VMπ(s) = E_{at∼π(⋅|st), s1=s}[∑t=1∞γt−1r(st,at)],(2a)

QMπ(s,a) = E_{at∼π(⋅|st), s1=s, a1=a}[∑t=1∞γt−1r(st,at)],(2b)

其中st是时间t的状态,at是时间t采取的动作。我们还定义策略π在时间步t的状态占用度量为dM,tπ(s)=P[st=s∣s1∼d0,π],策略π的折扣状态占用度量为:dMπ(s)=(1−γ)∑t=1∞γt−1dM,tπ(s),以及策略π的价值为期望折扣奖励,如下所示:

JM(π)=E_{s1∼d0}[VMπ(s1)] (3)

我们的目标是找到最大化价值的策略πθ∗,即θ∗∈argmaxθ JM(πθ)。

### 2.1 分段上的偏好反馈

给定两个长度为L的分段σ1={sk1,ak1}k=1L和σ2={sk2,ak2}k=1L,我们假设σ1以如下概率被偏好于σ2:

P[σ1≻σ2]=logistic([R(σ1)+γL−1Q^(sL1,aL1)]−[R(σ2)+γL−1Q^(sL2,aL2)]),(4)

其中R(σ)=∑k=1L−1γk−1r(sk,ak)是长度为L的分段σ的折扣奖励和,且 Q^(sL,aL)=QMπref(sL,aL)+ξ

相似文章

不要偷看答案:面向无标签 RLVR 的结果掩码组相对策略优化

arXiv cs.AI

本文提出 OM-GRPO,一种无标签 RLVR 框架,通过对答案片段上的梯度进行掩码,将奖励估计与策略优化解耦,并引入对比增强奖励(Contrast-Augmented Reward),无需额外采样即可细化奖励估计。该框架在多种推理基准上持续优于现有无标签方法,并与有监督的 ground-truth 奖励训练表现相当。

奖励模型的可引导文化偏好优化

arXiv cs.CL

介绍了SCPO,一种新颖的奖励模型训练算法,它以平衡的方式整合了多样化的文化偏好,在基线之上取得了高达7个百分点的改进和280%的数据效率提升。

面向进度与可靠性的智能体强化学习组策略优化

arXiv cs.AI

ProGPO是一种免学习评论器的方法,用于LLM智能体基于组的RL中的步骤级优势估计,它使用精确前缀动作比较和基于rollout的状态势,以改善长视界任务上的信用分配。在ALFWorld和WebShop上使用Qwen2.5模型的实验表明,它优于现有的智能体RL基线。