LEMUR:从偏好反馈中学习与多目标强化学习对齐
摘要
本文介绍了LEMUR,一个结合多目标强化学习与基于偏好的多人类反馈学习的框架,无需预定义奖励函数即可学习帕累托最优策略。
arXiv:2607.29559v1 公告类型:新
摘要:强化学习(RL)系统通常使用单一的、明确指定的标量奖励函数进行训练。然而,现实世界的决策任务通常涉及多个相互竞争的目标,例如性能与效率,而真实奖励函数难以指定或无法获取。虽然多目标强化学习(MORL)通过将奖励建模为向量来解决此类权衡,但现有方法通常假设可以访问每个目标的明确奖励函数,从而继承了单目标强化学习所面临的相同挑战。与此同时,基于偏好的强化学习(PbRL)通过从人类反馈中学习奖励,在无需预定义奖励函数的情况下解决复杂任务方面显示出巨大潜力,但主要在单目标设置中进行研究。在这项工作中,我们通过LEMUR弥合了这一差距:使用偏好反馈进行多目标强化学习的对齐学习,这是一个新颖的框架,智能体通过交互式地从多个人的偏好中学习,以学习最优多目标策略。我们的方法从人类反馈中联合学习策略和多个特定目标的奖励模型,使智能体在学习过程中能够有效平衡相互竞争的目标。我们在各种基准多目标任务上评估了LEMUR,实证结果表明其性能优于基线方法。我们的方法为在没有预定义奖励函数的情况下解决多目标决策任务提供了一个有前景的方向。
查看缓存全文
缓存时间: 2026/08/03 07:32
# 从偏好反馈中学习多目标强化学习对齐 Source: https://arxiv.org/html/2607.29559 Manith Adikari1,4, Bei Peng2, Samuele Vinanzi3, Angelo Cangelosi1,4 ###### 摘要 强化学习(RL)系统通常使用单一的、明确定义的标量奖励函数进行训练。然而,现实世界的决策任务往往涉及多个相互竞争的目标,例如性能与效率的权衡,而此类任务的真值奖励函数难以明确指定或无法获取。多目标强化学习(MORL)通过将奖励建模为向量来处理这类权衡,但现有方法通常假设每个目标都有明确指定的奖励函数,因而继承了单目标强化学习所面临的相同挑战。与此同时,基于偏好的强化学习(PbRL)在无需预定义奖励函数的情况下,通过从人类反馈中学习奖励,在解决复杂任务方面展现出巨大潜力,但相关研究大多局限于单目标设定。在本工作中,我们通过 LEMUR 弥合了这一差距:一种从偏好反馈中学习多目标强化学习对齐的新框架,该框架允许智能体通过交互式地从多个人类的偏好中学习,从而获得最优的多目标策略。我们的方法从人类反馈中联合学习策略和多个特定目标的奖励模型,使智能体能够在学习过程中有效权衡相互竞争的目标。我们在多种基准多目标任务上评估了 LEMUR,实验结果证明其性能优于基线方法。我们的方法为在没有预定义奖励函数的情况下解决多目标决策任务提供了一个有前景的方向。 ## 1 引言 强化学习(RL)在训练自主智能体方面取得了显著成功,从游戏博弈(Mnihet al.2013 (https://arxiv.org/html/2607.29559#bib.bib383))到机器人技术(Tanet al.2018 (https://arxiv.org/html/2607.29559#bib.bib523))。通过将学习形式化为通过试错学习最大化累积奖励(Sutton and Barto1998 (https://arxiv.org/html/2607.29559#bib.bib101)),RL 为训练自主“目标寻求”智能体(McCarthy1997 (https://arxiv.org/html/2607.29559#bib.bib385))提供了一个自然框架。然而,标准 RL 依赖于两个关键假设:目标可以用单一标量奖励表示,并且该奖励函数是明确定义的。在实践中,这些假设在复杂的现实领域很少成立。现实世界的任务往往涉及多个相互竞争的目标(Dulac-Arnoldet al.2019 (https://arxiv.org/html/2607.29559#bib.bib554)),例如自动驾驶中速度与安全性的平衡(Wanget al.2026 (https://arxiv.org/html/2607.29559#bib.bib575)),或机器人技术中吞吐量与能源效率的权衡(Huanget al.2022 (https://arxiv.org/html/2607.29559#bib.bib573); Kouritemet al.2022 (https://arxiv.org/html/2607.29559#bib.bib572))。多目标强化学习(MORL)领域通过将奖励建模为向量来寻找一组帕累托最优策略(Roijerset al.2013 (https://arxiv.org/html/2607.29559#bib.bib525)):即在不降低其他目标期望回报的情况下,任何目标的期望回报都无法提高的策略。然而,现有的 MORL 方法通常假设每个目标的真值奖励函数是可访问且手动指定的(Hayeset al.2022b (https://arxiv.org/html/2607.29559#bib.bib139))。因此,它们继承了单目标强化学习领域中的奖励指定挑战,而且现在涉及多个目标。手动设计一个能够在相互竞争的目标之间实现充分平衡的奖励函数是困难的,并且可能导致过度简化,从而产生次优策略(Knoxet al.2012 (https://arxiv.org/html/2607.29559#bib.bib545))和可能的奖励利用(Amodeiet al.2016 (https://arxiv.org/html/2607.29559#bib.bib526))。为了避免复杂的奖励工程,基于偏好的强化学习(PbRL)直接从人类反馈中学习奖励模型(Christianot al.2017 (https://arxiv.org/html/2607.29559#bib.bib520)),从而使系统行为与人类偏好更好地对齐。尽管在单目标强化学习的奖励学习方面取得了进展,但该问题在 MORL 设定下仍未得到充分探索。虽然一些工作考虑了 MORL 中的奖励学习,但它们通常局限于大型语言模型(LLM)的后训练设置或狭窄的基于自然语言的任务(Bakkeret al.2022 (https://arxiv.org/html/2607.29559#bib.bib498); Rameet al.2023 (https://arxiv.org/html/2607.29559#bib.bib30); Yanget al.2024 (https://arxiv.org/html/2607.29559#bib.bib532)),并未研究在具有多个相互竞争目标的环境中联合学习策略和奖励的问题。奖励指定已经是扩展单目标强化学习设定的主要瓶颈,在 MORL 中则变得更加关键。由此产生两个关键挑战。首先,智能体必须优化多个目标,而其底层奖励函数是复杂、隐含或不可访问的。其次,即使人类反馈可用,将多标准奖励信号压缩为单一标量也会掩盖 MORL 本应优化的权衡结构(Vamplewet al.2011 (https://arxiv.org/html/2607.29559#bib.bib576); Roijerset al.2013 (https://arxiv.org/html/2607.29559#bib.bib525); Sorensenet al.2024 (https://arxiv.org/html/2607.29559#bib.bib32))。考虑训练一个机器人系统:非专家操作员可以可靠地判断任务级成功,例如物体是否被正确抓取或放置,而评估精细标准(如抓取稳定性、长期磨损或安全相关目标)则需要专家操作员。将这种异构反馈压缩为单一奖励可能会混淆不同的目标并稀释专家信号,因此有必要根据适当的反馈来源学习独立的、特定目标的奖励模型。这就产生了一个关键缺口:当奖励函数未知且必须从反馈中推断时,智能体如何学习冲突目标之间的最优权衡? 为了解决这一缺口,我们引入了 LEMUR:从偏好反馈中学习多目标强化学习对齐,一个在无预定义奖励函数的情况下学习平衡多个目标的框架。我们的方法从偏好反馈中联合学习策略和多个特定目标的奖励模型,使智能体能够在学习过程中有效平衡相互竞争的目标。通过去除已知奖励函数的假设并显式建模多个目标,我们的方法解决了在现实世界、人类对齐领域中扩展 MORL 的关键挑战。综上所述,我们的主要贡献如下: - •我们提出了一个新框架 LEMUR,它从偏好反馈中学习*多个*特定目标的奖励模型,然后使用多目标强化学习针对这些奖励模型优化策略。这使得智能体无需访问预定义奖励函数即可有效解决多目标决策任务,同时自然地适应异构反馈来源,其中不同的标注者可能对不同的目标拥有专业知识。 - •我们的大量实验表明,LEMUR 在一系列基准多目标环境(即高维连续控制任务)中优于基线方法,并进一步展示了 LEMUR 对标签噪声、受限反馈预算以及扩展到更多目标的鲁棒性。 参见图1:我们的框架 LEMUR 的图示:(1)对 MORL 智能体进行无监督预训练,通过最大化状态熵 H(s) 来探索并收集多样化经验。(2)从偏好反馈中进行奖励学习,其中每个奖励模型根据从每位教师查询得到的偏好分别学习。奖励模型用于将状态-动作对动态重新标注为每个目标的奖励向量(即每位教师的偏好)。(3)由 πφ 表示的多目标强化学习智能体使用每个已训练的奖励模型进行多目标策略优化,以最大化期望向量奖励。 ## 2 预备知识 多目标强化学习。我们将问题形式化为多目标马尔可夫决策过程(MOMDP)(White1982 (https://arxiv.org/html/2607.29559#bib.bib534)),由元组 ⟨S,A,T,γ,r⟩ 定义。这里,S 和 A 分别表示状态空间和动作空间,T 表示转移动态,γ∈[0,1) 是折扣因子。与标准 RL 不同,奖励是向量 r(s,a)∈R^m,包含 m 个不同的目标。智能体的目标是最大化期望折扣向量回报 J(π)=E_π[∑_{t=0}^∞ γ^t r(s_t,a_t)]。策略 π 将状态映射到动作分布。由于在 MORL 中通常不存在单一策略能最大化所有目标,智能体学习一组表示最优权衡的策略 Π,由帕累托支配定义(Hayeset al.2022a (https://arxiv.org/html/2607.29559#bib.bib524))。如果策略 π 在至少一个目标上优于 π′ 且在其他目标上不劣于 π′,则称 π 支配 π′(记为 J(π)≻J(π′))。解集为帕累托前沿 F={π∈Π∣∄π′∈Π:J(π′)≻J(π)}。 软演员-评论家(SAC)。SAC(Haarnojat al.2018 (https://arxiv.org/html/2607.29559#bib.bib535))是一种基于最大熵框架的离策略演员-评论家算法。它通过引入熵项来鼓励探索,从而增强标准单目标强化学习。智能体的目标是最大化 J(π)=E_π[∑_t γ^t (r_t + α H(π(⋅|s_t)))]。 从偏好反馈中学习奖励。我们遵循标准的基于偏好的强化学习(PbRL)框架,该框架使用“潜在奖励”作为价值的代理(Christianot al.2017 (https://arxiv.org/html/2607.29559#bib.bib520))。每个人的奖励函数根据其各自的偏好反馈独立学习。与先前工作类似,我们使用轨迹片段对 (σ^0,σ^1) 上的偏好。专家教师(例如人类)提供标签 y∈{0,1,0.5} 来表示其偏好。为了学习由 ψ 参数化的奖励函数 r̂,我们采用 Bradley-Terry 模型(Bradley and Terry1952 (https://arxiv.org/html/2607.29559#bib.bib536)),将偏好概率建模为 P[σ^1≻σ^0;ψ] = exp∑r̂(σ^1) / (exp∑r̂(σ^1)+exp∑r̂(σ^0))。给定数据集 D,通过最小化交叉熵损失来训练奖励函数: L^CE(ψ) = -E_D[ (1-y) log P[σ^0≻σ^1] + y log P[σ^1≻σ^0] ]. (1) 然后,学习到的奖励函数可配合任何 RL 算法用于更新策略,以最大化期望回报。 ## 3 问题设定 在本节中,我们提出在没有预定义奖励函数的情况下,针对多个相互冲突目标的 MORL 公式。 #### 潜在奖励向量。 在标准 MORL 中,奖励函数是已知向量 r(s,a)∈R^m。然而,在我们的工作中,智能体无法访问真值奖励函数。相反,我们假设存在 m 个不同的、相互冲突的人类用户(目标),其中每个维度 r_i 对应于第 i 个特定用户的潜在奖励函数。由于这些奖励不可访问,我们必须对其进行近似。我们定义一个参数化奖励向量 r̂_ψ(s,a) = [r̂_{ψ_1}(s,a), ..., r̂_{ψ_m}(s,a)]^T,其中每个分量是从人类偏好反馈中学习到的奖励模型(Christianot al.2017 (https://arxiv.org/html/2607.29559#bib.bib520))。 #### 多目标强化学习优化。 智能体的目标是最大化期望折扣向量回报。我们采用最普遍的 MORL 形式,即基于效用的方法(Roijerset al.2013 (https://arxiv.org/html/2607.29559#bib.bib525)),其中我们定义标量化函数 f_w(r) = w^T r,其中 w∈R^m 是单纯形上的偏好权重向量(即 ∑ w_i = 1)。因此,我们将最优 MORL 智能体定义为属于凸覆盖集(CCS)的策略,CCS 是 F 中对线性标量化偏好最优的子集(Roijerset al.2013 (https://arxiv.org/html/2607.29559#bib.bib525))。总而言之,MORL 智能体通过最大化由权重 w 线性标量化的*已学习*潜在奖励向量的期望回报来学习这些策略,其中 w 决定目标之间的权衡: J(π)=E_π[∑_{t=0}^∞ γ^t w^T r̂_ψ(s_t,a_t)]。 (2) ## 4 LEMUR LEMUR(从偏好反馈中学习多目标强化学习对齐),如图1所示,分为三个阶段:(1)无监督预训练,智能体通过内在奖励进行探索以收集多样化经验(第4.1节);(2)奖励学习,查询多位人类教师的偏好以训练特定目标的奖励模型(第4.2节);(3)针对学习到的奖励模型进行多目标强化学习训练(第4.3节)。阶段2和阶段3循环进行,持续改进奖励模型和多目标策略。完整伪代码见附录B。 ### 4.1 无监督预训练 标准 PbRL 受限于随机初始化覆盖范围不足,导致查询信息量不足。为了生成信息量丰富的查询,LEMUR 采用由内在动机驱动的无监督预训练阶段(Leeet al.2021b (https://arxiv.org/html/2607.29559#bib.bib500))。我们通过最大化状态熵来鼓励探索,并使用基于粒子的 k-最近邻(k-NN)估计器近似状态熵(Liu and Abbeel2021 (https://arxiv.org/html/2607.29559#bib.bib546))。内在奖励 r^int(s_t) = log(‖s_t - s_t^k‖) 是到 B 中第 k 个最近邻的归一化距离,智能体最大化 J_int(φ) = E_{π_φ}[∑_{t=0}^T γ^t r^int(s_t)]。这为缓冲区填充了多样化的行为。相似文章
面向人类反馈强化学习的元学习奖励塑造
MeRLa 是一个用于 RLHF 的元学习奖励塑造框架,通过学习任务特定的塑造函数来改善对齐,在多个基准上取得了最先进的结果,并显著降低了训练不稳定性。
从正确性到偏好:个性化智能体强化学习框架
本文提出了一个统一的个性化智能体强化学习框架,将通用任务奖励与个性化偏好奖励解耦,引入了PARPO和PSGM用于偏好对齐的策略优化和技能检索。
多智能体协商中基于对手建模的偏好估计
本文提出了一种新颖的偏好估计方法,将大型语言模型(LLM)的自然语言信息集成到结构化贝叶斯对手建模框架中,用于多智能体协商。该方法利用LLM从话语中提取定性线索,并将其转换为概率格式,在多方协商基准上展示了改进的协议达成率和偏好估计准确性。
借助大语言模型发现强化学习接口
本文介绍了 LIMEN,这是一个由大语言模型引导的演化框架,能够通过联合优化原始模拟器状态的观测映射与奖励函数,自动发现强化学习接口。该方法有效降低了人工设计成本,并证明了观测与奖励的协同设计优于单独优化其中任意单一组件。
RLearner-LLM:通过混合直接偏好优化平衡大语言模型的逻辑基础与流畅性
本文介绍了RLearner-LLM,一个使用混合直接偏好优化(Hybrid-DPO)的框架,旨在平衡LLM生成解释的逻辑正确性和流畅性。该框架在多个领域和基础模型上实现了显著的NLI蕴含改进,同时减轻了标准偏好信号中的冗长偏差。