鲁棒峰值成本约束强化学习
摘要
本文研究了鲁棒峰值成本约束强化学习,通过控制轨迹上的最大成本并考虑动态不确定性来解决标准CMDP的局限性。作者表明零对偶间隙可能不成立,并提出了一种基于鲁棒值估计的替代优化框架。
arXiv:2607.15457v1 Announce Type: new
摘要:我们研究鲁棒峰值成本约束强化学习(RP-CRL),其目标是最大化期望奖励,同时控制轨迹中遇到的最大成本。这一设置源于安全关键应用,其中单次大违规可能是灾难性的,因此无法通过基于期望累积成本的标准CMDP框架充分捕捉。现有的可达性约束强化学习方法采用基于拉格朗日的方法,然而峰值成本约束MDP的底层对偶性质尚不清楚。我们证明,与标准CMDP不同,峰值成本约束MDP可能不允许零对偶间隙。我们进一步考虑一个鲁棒公式来解决转移动态中模拟器与真实世界的不匹配。为了解决这个问题,我们开发了一个替代优化框架和一种基于积分概率度量的鲁棒值估计方法。我们证明,通过适当的超参数选择,替代解决方案达到与原问题相同的鲁棒奖励值,同时违反约束的程度最多为epsilon。实验表明,所提出的方法在动态扰动下有效强制执行安全性,同时保持强大的奖励性能。
查看缓存全文
缓存时间: 2026/07/20 09:27
# 鲁棒峰值成本约束强化学习
来源: https://arxiv.org/html/2607.15457
Shilpa Mukhopadhyay¹, Sourav Ganguly¹, Santosh Mohan Rajkumar³, Honghao Wei², Debdipta Goswami³ 和 Arnob Ghosh¹
¹ 电气与计算机工程系,新泽西理工学院,纽瓦克,新泽西州,美国 (电子邮件: {sm3934,sg2786,arnob.ghosh}@njit.edu)
² 电气工程与计算机科学学院,华盛顿州立大学,普尔曼,华盛顿州,美国 (电子邮件: [email protected])
³ 机械与航空航天工程系,俄亥俄州立大学,哥伦布,俄亥俄州,美国 (电子邮件: {rajkumar.36,goswami.78}@osu.edu)
###### 摘要
我们研究鲁棒峰值成本约束强化学习 (RP-CRL),其目标是在控制轨迹中遇到的最大成本的同时最大化预期奖励。该设置受安全关键应用的启发,在这些应用中,单次严重违规可能是灾难性的,因此无法由基于预期累积成本的标准 CMDP 框架充分捕获。现有的可达性约束强化学习方法采用基于拉格朗日的方法,但峰值成本约束 MDP 的底层对偶性质仍不清楚。我们表明,与标准 CMDP 不同,峰值成本约束 MDP 可能不承认零对偶间隙。我们进一步考虑了一个鲁棒公式化,以解决从仿真到现实世界过渡动态不匹配的问题。为了解决这个问题,我们开发了一个代理优化框架和一个基于积分概率度量的鲁棒值估计方法。我们证明,通过适当选择超参数,代理解可以达到与原始问题相同的鲁棒奖励值,同时违反约束的程度最多为 ε。实验表明,所提出的方法在动态扰动下有效保证了安全性,同时保持了较强的奖励性能。
## I. 引言
安全性是智能决策问题中的基本要求。受此启发,最近的强化学习 (RL) 研究广泛研究了约束马尔可夫决策过程 (CMDP) [2 (https://arxiv.org/html/2607.15457#bib.bib10), 14 (https://arxiv.org/html/2607.15457#bib.bib19), 13 (https://arxiv.org/html/2607.15457#bib.bib18), 25 (https://arxiv.org/html/2607.15457#bib.bib13)]。在标准 CMDP 框架中,安全是通过要求*预期累积成本*保持在指定阈值以下来强制执行的。然而,这种公式化对于许多实际应用是不够的,在这些应用中,主要关注的不是总累积成本,而是*轨迹中遇到的最大成本*。在这种情况下,即使一次大的违规也可能是灾难性的,无论整体累积成本有多小。例如,一条轨迹可能在大多数时间步产生小成本,但经历一次严重的安全违规,使其比另一条最大成本始终均匀有界的轨迹危险得多。
为了解决这一局限性,最近的工作 [28 (https://arxiv.org/html/2607.15457#bib.bib4), 11 (https://arxiv.org/html/2607.15457#bib.bib7)] 考虑了可达性约束强化学习 (RCRL),其目标是在峰值成本约束下最大化预期奖励,即轨迹中遇到的最大成本保持在指定阈值 (通常为 0) 以下。这些工作开发了基于拉格朗日的方法来解决由此产生的优化问题。然而,与标准 CMDP 设置(其中零对偶间隙已得到充分确立)不同,这种保证尚未针对峰值成本约束 MDP 得到证明。因此,这些基于拉格朗日的方法是否能恢复真正的最优解仍不清楚。
现有工作的另一个局限性是它没有考虑过渡动态的不确定性 [28 (https://arxiv.org/html/2607.15457#bib.bib4), 11 (https://arxiv.org/html/2607.15457#bib.bib7)]。在实践中,策略通常在仿真中训练,然后部署在现实世界中,而真实动态可能与仿真器中的不同。因此,在仿真中满足峰值成本约束的策略在部署后可能由于模型不匹配而仍然违反相同的约束。这引出了以下核心问题:
峰值成本约束 MDP 是否承认零对偶间隙?我们如何开发一种算法来解决鲁棒峰值成本约束问题,从而弥合仿真到现实的差距?
我们的贡献:
- • 我们表明,与标准 CMDP 不同,峰值成本约束 MDP 可能无法承认零对偶间隙,即使是在双状态 MDP 中。关键原因在于相对于状态-动作占用度量的凸性被破坏了。
- • 我们公式化了一个鲁棒峰值成本约束问题,并提出了一个代理优化框架。我们表明,通过适当选择超参数,代理问题的最优解可以达到与原始问题相同的鲁棒奖励值,同时违反约束的程度最多为 ε。
- • 我们基于积分概率度量开发了一种有效的鲁棒值函数估计方法。实验表明,即使在环境受到扰动的情况下,所提出的方法也能有效地满足约束。
### I-A 相关工作
CMDP:约束马尔可夫决策过程 (CMDP) 是解决约束强化学习 (CRL) 问题的基本框架 [2 (https://arxiv.org/html/2607.15457#bib.bib10)]。CMDP 利用状态-动作占用度量的凸性,使得能够使用原-对偶方法来解决优化问题 [20 (https://arxiv.org/html/2607.15457#bib.bib11), 24 (https://arxiv.org/html/2607.15457#bib.bib12), 25 (https://arxiv.org/html/2607.15457#bib.bib13), 30 (https://arxiv.org/html/2607.15457#bib.bib14)]。这些方法具有完善的收敛保证,并在文献中得到了广泛研究 [13 (https://arxiv.org/html/2607.15457#bib.bib18), 14 (https://arxiv.org/html/2607.15457#bib.bib19), 8 (https://arxiv.org/html/2607.15457#bib.bib20)]。除了原-对偶方法之外,基于线性规划 (LP) 和基于模型的方法也得到了探索,直接解决原问题 [27 (https://arxiv.org/html/2607.15457#bib.bib15), 1 (https://arxiv.org/html/2607.15457#bib.bib16), 7 (https://arxiv.org/html/2607.15457#bib.bib17)]。然而,峰值约束目标与 CMDP 不同。
RCMDP:与标准 CMDP 不同,RCMDP 的优化问题在状态-动作占用度量上是非凸的,这使得传统的拉格朗日或原-对偶方法的使用变得复杂 [26 (https://arxiv.org/html/2607.15457#bib.bib21)]。一些研究试图在强对偶假设下使用原-对偶方法来解决这一挑战,但这些方法通常缺乏迭代复杂性保证 [29 (https://arxiv.org/html/2607.15457#bib.bib22)]。最近的工作引入了仰角图重新公式化来解决原-对偶方法的局限性,但这些方法需要计算成本高昂的二分搜索过程,并且对策略值估计中的噪声敏感 [16 (https://arxiv.org/html/2607.15457#bib.bib2)]。[12 (https://arxiv.org/html/2607.15457#bib.bib1)] 通过联合优化鲁棒性和约束满足来避免这些局限性,从而消除了具有迭代保证的二分搜索的需要。然而,这些方法没有考虑我们考虑的峰值成本约束。
CMDP 中安全性和最优性的可行集与可达性分析:在安全控制和强化学习中,描述可行集是一个关键且持续的挑战 [5 (https://arxiv.org/html/2607.15457#bib.bib23)]。可行集通常使用安全证书(如控制屏障函数 (CBF) [6 (https://arxiv.org/html/2607.15457#bib.bib24), 6 (https://arxiv.org/html/2607.15457#bib.bib24), 17 (https://arxiv.org/html/2607.15457#bib.bib25)])来表示,它定义了系统可以恢复安全的那些状态集合。然而,基于能量的安全证书通常会导致过于保守或不准确的可行集,限制了它们的适用性 [18 (https://arxiv.org/html/2607.15457#bib.bib26)]。Hamilton-Jacobian (HJ) 可达性分析提供了一种更严格的方法来推导可行集,但由于涉及非平凡的偏微分方程,计算成本高昂 [3 (https://arxiv.org/html/2607.15457#bib.bib27)]。最近,考虑了基于 RL 的方法来寻找避免不安全集的策略 [9 (https://arxiv.org/html/2607.15457#bib.bib9), 10 (https://arxiv.org/html/2607.15457#bib.bib8), 23 (https://arxiv.org/html/2607.15457#bib.bib28)],然而,它们没有考虑最大化奖励作为目标。[28 (https://arxiv.org/html/2607.15457#bib.bib4), 11 (https://arxiv.org/html/2607.15457#bib.bib7)] 学习单一策略来平衡安全性和最优性,考虑了峰值成本约束优化。他们使用拉格朗日框架来解决问题,然而,他们没有提供强对偶保证。此外,上述工作均未考虑鲁棒优化框架,以便在仿真器模型(可能与真实环境不同)上训练的同时弥合仿真到现实的差距。
## II. 预备知识与问题公式化
### II-A 约束马尔可夫决策过程
一个约束马尔可夫决策过程 (CMDP) 由下式定义:
M = ⟨S, A, P, r, c, γ, d₀⟩,
其中 S 和 A 表示状态和动作空间,P(·|s,a) 是(可能未知的)转移核,r: S×A → ℝ 是奖励函数,c: S×A → ℝ 是成本函数,γ ∈ (0,1) 是折扣因子,d₀ 是初始状态分布。策略表示为 π(·|s): S → Δ(A)。
对于给定的转移模型 P 和策略 π,令 V_r^{P,π}(s) 和 V_c^{P,π}(s) 分别表示折扣负奖励和成本值函数:
V_r^{P,π}(s) = -E[∑_{t=0}^∞ γ^t r(s_t, a_t) | s₀=s, π, P],
V_c^{P,π}(s) = E[∑_{t=0}^∞ γ^t c(s_t, a_t) | s₀=s, π, P].
来自初始分布 d₀ 的相应目标值为:
J_r^P(π) = E_{s∼d₀}[V_r^{P,π}(s)], J_c^P(π) = E_{s∼d₀}[V_c^{P,π}(s)].
标准 CMDP 寻求最大化奖励,同时将预期折扣成本保持在预算 b 以下。对应于折扣负奖励,CMDP 目标变为:
min_π J_r^P(π) s.t. J_c^P(π) ≤ b.
当 Slater 条件成立时,标准 CMDP 承认零对偶间隙 [21 (https://arxiv.org/html/2607.15457#bib.bib30)],因此基于拉格朗日的方法提供了一种有效的求解方法。
### II-B 峰值成本约束
尽管 CMDP 被广泛使用,但一个主要限制是约束仅通过*预期累积折扣成本*来表达。然而,在许多应用中,仅控制累积成本是不够的;相反,必须确保轨迹中遇到的*最大*成本保持在所需阈值以下。
具体示例(可达性与持久安全) 在许多安全关键环境中,我们要求系统永远不要进入不安全区域。令 c(s) 是一个基于状态的安全函数,使得对于安全状态 c(s) ≤ b,对于不安全状态 c(s) > b。那么,对于策略 π,沿轨迹 τ = (s₀, s₁, ...) ∼ π 的安全性需要 max_{t∈N} c^π(s_t) ≤ 0,概率为 1,其中 b 是某个安全阈值。也就是说,沿轨迹遇到的最大安全违规必须保持非正。
受此启发,我们考虑以下峰值约束问题:
min_π J_r^P(π) s.t. max_{s∈S^{π,P}} c(s) ≤ b,
其中 S^{π,P} = {s∈S: Pr(∃t≥0, s_t=s | s₀∼d₀, π, P) > 0}。我们假设初始状态总是提供至少一个可行的策略。通常,我们考虑长度为 T 的情节设置,那么 t 将受限于 T。
注意,峰值约束难以评估,因为需要预测给定时间 t 的未来状态。参考文献 [9 (https://arxiv.org/html/2607.15457#bib.bib9)] 首先观察到,对于固定策略 π,该峰值成本约束可以通过使用折扣递归的值函数来表示。特别地,定义
Q_{c,peak}^{π,P}(s,a) = (1-γ)c(s) + γ max{c(s), E_{P(·|s,a)}[V_{c,peak}^{π,P}(·)]} (1)
且
V_{c,peak}^{π,P}(s) = ⟨π(·|s), Q_{c,peak}^{π,P}(s,·)⟩.
对于 γ<1,由 (1) 引入的算子是一个压缩映射,因此 V_{c,peak}^π 可以通过定点迭代为给定策略 π 计算。对于有限时域情节设置,我们可以简单取 γ=1。
这导致了以下修改后的优化问题:
min_π J_r^P(π) s.t. max_{s∈S^{π,P}} [V_{c,peak}^{π,P}(s)] ≤ b. (2)
一个相关的公式化也被 [28 (https://arxiv.org/html/2607.15457#bib.bib4)] 考虑过。他们提出了以下基于拉格朗日的目标:
min_π max_{β≥0} [V_r^{π,P}(s) + β(s) V_{c,peak}^{π,P}(s)], (3)
其中 β(s) 是一个依赖于状态的拉格朗日乘子,用于惩罚约束违反。
### II-C [28] 中拉格朗日方法的局限性
虽然 [28 (https://arxiv.org/html/2607.15457#bib.bib4)] 采用了 (3) 中的拉格朗日公式化,但它并未建立强对偶保证。这是一个关键问题,因为峰值成本约束问题与标准 CMDP 有根本不同:约束不再基于加性折扣累积成本,而是取决于轨迹中遇到的最大成本。特别地,可达集 S^{π,P} 本质上依赖于策略 π。
在本文中,我们表明峰值成本约束相似文章
面向安全强化学习的鲁棒防护
提出了一种新颖的防护框架,用于鲁棒马尔可夫决策过程(RMDP),该框架在不确定的转移动态下正式保证安全性,并证明了其正确性和最优性。该方法结合了学习模型的PAC保证,使得在未知环境中实现安全强化学习成为可能。
从累积约束到自适应运行时安全控制用于非平稳强化学习
提出CPSS,一种运行时安全机制,将累积成本约束转换为自适应状态级阈值,用于非平稳环境中的安全强化学习,在高速公路合流场景中展示了违规次数的减少。
通过分位数贝叶斯风险MDP实现在线强化学习中鲁棒性与探索的动态权衡
本文提出了一种用于在线强化学习的分位数贝叶斯风险感知MDP框架,该框架能够随时间自适应地平衡鲁棒性与探索,提供了理论遗憾界并展示了强大的实证性能。
效用约束策略优化
本文介绍了一种简单而强大的方法,用于效用约束马尔可夫决策过程(UCMDPs),该方法无需预先固定约束界限即可实现风险敏感约束,在Safety Gymnasium基准测试中优于基线方法。
CSPO:面向安全强化学习的约束敏感策略优化
本文提出约束敏感策略优化(CSPO),一种用于安全强化学习的一阶原始-对偶方法,该方法融合局部约束灵敏度以改善安全恢复并减少安全边界附近的振荡,在导航和运动基准上实现了更高的约束回报。