利用逆强化学习进行多目标约束推断

arXiv cs.AI 论文

摘要

本文介绍了 MOCI,这是一种新颖的框架,能够从强化学习中的异构专家演示中推断共享约束和个体偏好,在预测性能和计算效率方面均优于现有基线。

arXiv:2605.06951v1 公告类型:新提交 摘要:通过观察专家演示,约束推断被广泛视为使强化学习智能体与安全边界和操作指南保持一致的关键。然而,现有的方法通常假设演示是同质的(即由单个专家或具有相同目标的多名专家生成)。此外,它们在捕捉个体偏好方面的能力有限,且往往面临计算效率低下的问题。在本文中,我们提出了多目标约束推断(MOCI),这是一种新颖的框架,旨在从异构专家轨迹中联合提取共享约束和个体偏好,其中多名专家追求不同的目标。MOCI 能够有效地对多样化且可能存在冲突的行为进行建模和学习。实证评估表明,MOCI 在标准网格世界基准测试中显著优于现有基线,实现了更高的预测性能,同时保持了具有竞争力的计算效率。这些结果确立了 MOCI 作为一种准确、灵活且在实际计算上可行的方法,适用于现实世界中的约束推断和偏好学习任务。
查看原文
查看缓存全文

缓存时间: 2026/05/11 07:09

# 基于逆强化学习的多目标约束推理

来源: https://arxiv.org/html/2605.06951
Syed Ihtesham Hussain Shah 阿姆斯特丹自由大学理学院 s\.i\.h\.shah@vu\.nl &Floris den Hengst 阿姆斯特丹自由大学理学院 f\.den\.hengst@vu\.nl Aneta Lisowska 阿姆斯特丹自由大学理学院 a\.j\.lisowska@vu\.nl &Annette ten Teije 阿姆斯特丹自由大学理学院 annette\.ten\.teije@vu\.nl

###### 摘要

约束推理通常被认为对于通过观察专家演示来使强化学习智能体与安全性边界和操作指南保持一致至关重要。然而,现有的方法通常假设演示是同质的(即由单一专家或具有相同目标的多个专家生成)。它们捕捉个体偏好的能力有限,并且往往存在计算效率低下的问题。在本文中,我们引入了多目标约束推理(MOCI),这是一种新颖的框架,旨在从异构专家轨迹中联合提取共享约束和个体偏好,其中多个专家追求不同的目标。MOCI 能够有效地建模和学习多样化且 potentially 冲突的行为。实证评估表明,MOCI 显著优于现有的基线方法,在标准网格世界基准测试中实现了改进的预测性能,并保持了具有竞争力的计算效率。这些结果确立了 MOCI 作为一种准确、灵活且在计算上实用的方法,适用于现实世界中的约束推理和偏好学习任务。

## 1 引言

逆强化学习(IRL)是一种通过观察专家行为来学习其潜在目标的框架[13 (https://arxiv.org/html/2605.06951#bib.bib3)]。IRL 不是手动指定奖励函数,而是推断出最能解释专家演示行动的奖励。传统上,智能体的意图由学习的奖励函数建模,然而,准确匹配专家的行为可能会使奖励函数过于复杂,并对微小变化变得脆弱。与其在单一的奖励函数中捕捉专家复杂多样的动机,不如通过联合学习一个简单的奖励函数并推断一组清晰的硬约束来更轻松地解释专家行为[12 (https://arxiv.org/html/2605.06951#bib.bib1)]。尽管联合学习约束和奖励函数能产生更简单的奖励模型以更好地解释专家轨迹,但现有工作[8 (https://arxiv.org/html/2605.06951#bib.bib13),7 (https://arxiv.org/html/2605.06951#bib.bib21)]受到两个限制性假设的影响:(1)数据集是同质的,即由单一类型的专家生成;(2)专家的奖励函数在事先是完全已知的。这些假设在现实世界场景中是有问题的,因为观测数据通常来自异构专家群体,且奖励函数是未知的。例如,在城市驾驶中,不同的驾驶员表现出不同的驾驶风格,从激进到谨慎不等,但都受到相同的共享物理和法律约束,如限速和车道边界。同时,驾驶员有不同的驾驶和导航偏好,例如以最小距离到达目的地,或者选择更长但风景更优美的路线。在本文中,我们解决从异构专家演示中推断共享约束和学习个体偏好的挑战。我们提出了多目标约束推理(MOCI),这是一种新颖的框架,旨在从由具有不同偏好的多个专家生成的无标签演示中,在具有所有专家共享的硬约束的环境中,联合恢复共享约束和偏好。MOCI 通过应用最大熵逆强化学习对每个组进行学习,从而联合学习共享约束和个性化奖励权重,使得个体专家偏好与共享环境约束得以分离。我们在多目标 GridWorld 环境(一个用于序贯决策问题的成熟基准)上评估了我们的方法。这种受控设置允许我们系统地验证所提出的方法。本文的其余部分组织如下:第2节 (https://arxiv.org/html/2605.06951#S2) 形式化了构建该框架的基础前提和基础概念,包括约束马尔可夫决策过程(CMDP)和最大熵逆强化学习(IRL)。第3节 (https://arxiv.org/html/2605.06951#S3) 介绍了所提出的多目标约束推理(MOCI)算法,并对其计算复杂度进行了详细分析。第4节 (https://arxiv.org/html/2605.06951#S4) 详细介绍了使用模拟异构 Gridworld 环境的实验设置,并讨论了框架的实证结果。第5节 (https://arxiv.org/html/2605.06951#S5) 提供了 MOCI 与现有基线技术之间的性能比较。最后,第6节 (https://arxiv.org/html/2605.06951#S6) 总结了研究结论并讨论了当前的局限性。

## 2 预备知识

在本节中,我们形式化了构建多目标约束推理(MOCI)框架的基础概念。我们定义了环境、智能体目标的结构以及从数据中推断这些目标的方法。

### 2.1 约束马尔可夫决策过程

标准马尔可夫决策过程(MDP)定义为元组 $\mathcal{M}=\langle\mathcal{S},\mathcal{A},\mathcal{T},\gamma,R\rangle$,其中 $\mathcal{S}$ 是状态空间,$\mathcal{A}$ 是动作空间,$\mathcal{T}(s'\mid s,a)\in\mathcal{S}\times\mathcal{A}\to\Delta(\mathcal{S})$ 是转移概率分布,$\gamma\in[0,1)$ 是折扣因子,$R(s,a)\in\mathcal{S}\times\mathcal{A}\to\mathbb{R}$ 是奖励函数[15 (https://arxiv.org/html/2605.06951#bib.bib5)]。智能体的行为由策略 $\pi(a\mid s)\in\mathcal{S}\to\Delta(\mathcal{A})$ 定义,该策略将状态映射到动作上的概率分布。**约束马尔可夫决策过程**(CMDP)[16 (https://arxiv.org/html/2605.06951#bib.bib4)] 通过限制允许策略的集合来扩展此框架。虽然 CMDP 可以使用成本函数和预算阈值来表述,但我们关注硬环境约束(如墙壁或严格的物理限制)的上下文,这些约束定义为禁止或不安全状态的集合,记为 $C\subset\mathcal{S}$,遵循 Kim 等人[6 (https://arxiv.org/html/2605.06951#bib.bib17)]和 Qadri 等人[10 (https://arxiv.org/html/2605.06951#bib.bib16)]近期的相关工作。因此,CMDP 增强为 $\mathcal{M}_C=\langle\mathcal{S},\mathcal{A},\mathcal{T},\gamma,R,C\rangle$。长度为 $H\in\mathbb{N}$ 的轨迹 $\xi=\{(s_0,a_0),(s_1,a_1),\dots,(s_T,a_T)\}$ 被认为是有效的,当且仅当它不违反 $C$ 中的任何约束[11 (https://arxiv.org/html/2605.06951#bib.bib6)]。这使用二元指示函数形式化:

$$
\mathbb{I}^C(\xi)=\begin{cases}1&\text{if }s_t\notin C\text{ for all }t\in\{0,\dots,H\}\\ 0&\text{otherwise}\end{cases}\tag{1}
$$

### 2.2 多目标 MDP

**多目标马尔可夫决策过程**(MOMDP)将传统 MDP 扩展为具有向量奖励函数 $\boldsymbol{R}\in\mathcal{S}\times\mathcal{A}\to\mathbb{R}^d$,以建模具有 $d$ 个潜在竞争目标的环境(例如,在最大化安全性的同时最小化旅行时间)[3 (https://arxiv.org/html/2605.06951#bib.bib14),5 (https://arxiv.org/html/2605.06951#bib.bib15)]。如果知道这些多个目标对于特定个人或用例的组合方式,则该向量奖励可以坍缩为标量奖励。如果所谓的*标量化*函数在目标上是线性的,我们将其权重 $w:=[w_1,\dots,w_p]$ 称为该个体的偏好,使得其奖励函数 $R=w^\top\boldsymbol{R}$。

在实践中,这通常通过特征表述来表达,其中 $\phi(s,a)\in\mathbb{R}^d$ 表示状态-动作特征向量,智能体的特定偏好由权重向量 $w$ 定义。具有偏好 $w$ 的智能体的标量化奖励[14 (https://arxiv.org/html/2605.06951#bib.bib2)]可以定义为:

$$
R_w(s,a)=w^\top\phi(s,a)\tag{2}
$$

在异构多智能体设置[19 (https://arxiv.org/html/2605.06951#bib.bib8)]中,不同的专家 $k\in\{1,\dots,K\}$ 共享相同的状态-动作特征 $\phi$,但拥有不同的私有偏好权重 $w_k$,导致在同一底层环境中产生多样化的最优策略。

### 2.3 逆强化学习

逆强化学习(IRL)解决了在给定智能体演示行为的情况下提取其潜在奖励函数的问题[2 (https://arxiv.org/html/2605.06951#bib.bib9)]。形式上,我们假设可以访问 MDP 的转移函数,但其奖励函数未知,记为 $\mathcal{M}\setminus R$,以及由专家策略 $\pi_E$ 生成的专家轨迹数据集 $\mathcal{D}=\{\xi_1,\dots,\xi_N\}$。

IRL 的目标是找到一个奖励函数 $R^*$,使得专家的策略 $\pi_E$ 是最优的[1 (https://arxiv.org/html/2605.06951#bib.bib10)]。如果奖励线性参数化为 $R(s,a)=w^\top\phi(s,a)$,则 IRL 问题可以表述为寻找权重向量 $w^*$,使得专家的预期特征计数与优化 $w^*$ 的策略的预期特征计数相匹配:

$$
\mathbb{E}_{\pi_E}\left[\sum_{t=0}^T\gamma^t\phi(s_t,a_t)\right]=\mathbb{E}_{\pi_{w^*}}\left[\sum_{t=0}^T\gamma^t\phi(s_t,a_t)\right]\tag{3}
$$

然而,这个问题本质上是不适定的,因为多个奖励函数(包括全零的平凡奖励)可以解释相同的行为。

### 2.4 最大熵 IRL

为了解决 IRL 问题的歧义性,[20 (https://arxiv.org/html/2605.06951#bib.bib18)] 引入了**最大熵逆强化学习**(MaxEnt IRL)。MaxEnt IRL 应用最大熵原理来选择与专家的经验特征期望相匹配的轨迹概率分布,同时不做其他假设(即,在其他方面尽可能随机)。

在 MaxEnt 框架下,智能体选择特定轨迹 $\xi$ 的概率与该轨迹的总累积奖励呈指数比例:

$$
P(\xi\mid w)=\frac{1}{Z(w)}\exp\left(\sum_{(s,a)\in\xi}w^\top\phi(s,a)\right)=\frac{1}{Z(w)}e^{R_w(\xi)}\tag{4}
$$

其中 $Z(w)$ 是配分函数,表示从起始状态出发的所有可能轨迹的积分(或求和):

$$
Z(w)=\sum_{\xi'\in\Xi}e^{R_w(\xi')}\tag{5}
$$

然后通过最大化演示轨迹 $\mathcal{D}$ 的对数似然来找到奖励权重 $w$:

$$
\mathcal{L}(w)=\sum_{i=1}^{|\mathcal{D}|}\log P(\xi_i\mid w)=\sum_{i=1}^{|\mathcal{D}|}\left(w^\top\phi(\xi_i)-\log Z(w)\right)\tag{6}
$$

该对数似然的梯度简洁地简化为演示的经验特征计数与当前权重向量 $w$ 下的预期特征计数之间的差异,从而允许通过梯度上升进行高效优化。

## 3 多目标约束推理(MOCI)

在本节中,我们介绍了联合学习共享约束和个体偏好的方法。我们还提供了所提出算法的计算复杂度的理论分析,突出了其相对于状态数、动作数和演示数的可扩展性。

### 3.1 方法

令 $\mathcal{D}=\{\xi_1,\dots,\xi_N\}$ 为最大长度为 $H$ 的演示轨迹数据集。我们假设存在一个**约束多目标马尔可夫决策过程**(CMOMDP)$\langle\mathcal{S},\mathcal{A},\mathcal{T},\gamma,\boldsymbol{R},C\rangle$ 以及 $K$ 个潜在专家类型(集群),其中每种类型 $k\in\{1,\dots,K\}$ 由特定的偏好权重向量 $w_k$ 表征,使得 $R_k=w_k^\top\boldsymbol{R}$,以及先验概率 $\pi_k=P(k)$。关键在于,演示并未标记其关联的专家类型 $k\in K$,因为推断专家偏好是本工作的一个关键目标。

尽管专家在偏好上有所不同,但所有智能体共享相同的状态-动作特征函数 $\phi$,并在共享的一组硬物理约束下运行,记为 $C$。遵循 Ziebart 等人[20 (https://arxiv.org/html/2605.06951#bib.bib18)]的最大熵逆强化学习(MaxEnt IRL)框架,在受约束 $C$ 且由类型 $k$ 的专家生成的情况下,观测到特定轨迹 $\xi$ 的概率定义为:

$$
P(\xi\mid C,w_k)=\frac{1}{Z(C,w_k)}e^{R_{w_k}(\xi)}\mathbb{I}^C(\xi)\tag{7}
$$

其中,$R_{w_k}(\xi)=\sum_{(s,a)\in\xi}w_k^\top\phi(s,a)$ 是在偏好 $w_k$ 下轨迹的累积奖励。$Z(C,w_k)$ 是受约束马尔可夫决策过程(MDP)中所有可行路径上的配分函数。详细分析和证明见附录-B (https://arxiv.org/html/2605.06951#A2)。$\mathbb{I}^C(\xi)$ 是一个指示函数,如果轨迹 $\xi$ 不违反 $C$ 中的任何约束则为 1,否则为 0,如公式 (1 (https://arxiv.org/html/2605.06951#S2.E1)) 所示。对演示到专家类型的潜在分配进行边缘化,单个演示的似然为:

$$
P(\xi\mid C,\{w_k\},\{\pi_k\})=\sum_{k=1}^K\pi_k\frac{e^{R_{w_k}(\xi)}}{Z(C,w_k)}\mathbb{I}^C(\xi)\tag{8}
$$

我们的目标是通过最大化

相似文章

优化训练策略的幻象:单调推理策略作为LLM强化学习的真正目标

Hugging Face Daily Papers

我们介绍了MIPI(单调推理策略改进)及其实例化MIPU,这是一个用于LLM的两步RL框架,通过将优化与推理策略改进明确对齐来解决训练-推理不匹配问题。在FP8量化展开下,MIPU在Qwen3-1.7B和Qwen3-4B模型上实现了改进的推理性能和训练稳定性。

基于互信息的多目标探索与偏好优化

arXiv cs.CL

提出MI-EPO,一种基于信息理论的多目标对齐框架,用于大型语言模型,通过互信息增强探索,确保生成的响应可区分且与不同偏好向量对齐,在冲突目标间实现稳定权衡。

通过双层优化实现交互场景的交互式逆向强化学习

arXiv cs.LG

本文介绍了交互式逆向强化学习(IIRL),这是一个学习者通过与专家主动互动来推断奖励函数的框架,其形式化为随机双层优化问题。作者提出了 BISIRL 算法,为该交互式学习范式提供了收敛性保证和实验验证。