CSPO:面向安全强化学习的约束敏感策略优化
摘要
本文提出约束敏感策略优化(CSPO),一种用于安全强化学习的一阶原始-对偶方法,该方法融合局部约束灵敏度以改善安全恢复并减少安全边界附近的振荡,在导航和运动基准上实现了更高的约束回报。
arXiv:2606.14415v1 Announce Type: new
摘要:安全强化学习(Safe RL)旨在最大化期望回报的同时满足安全约束,通常建模为约束马尔可夫决策过程(CMDPs)。原始-对偶方法虽能很好地扩展到深度强化学习,但往往存在约束校正延迟的问题,导致振荡行为和长时间的安全违规。本文提出约束敏感策略优化(CSPO),一种一阶原始-对偶方法,将局部约束灵敏度融入策略更新。CSPO通过从安全边界的最短带符号距离推导出的约束敏感校正来增强原始目标,实现更智能的安全恢复步长,补偿拉格朗日乘子更新的延迟,减少边界附近的振荡,并保留原始约束问题的KKT解。在导航和运动基准上的实验表明,与最先进的原始-对偶和基于惩罚的方法相比,CSPO实现了更快的安全恢复和较高的奖励保持,从而获得了更高的约束回报。
查看缓存全文
缓存时间: 2026/06/15 09:12
# CSPO:面向安全强化学习的约束敏感策略优化 来源:https://arxiv.org/html/2606.14415 ###### 摘要 安全强化学习(Safe RL)旨在最大化期望回报的同时满足安全约束,通常建模为约束马尔可夫决策过程(CMDP)。虽然原始-对偶方法可以扩展到深度强化学习,但它们常常遭受延迟约束校正的问题,导致振荡行为和长时间的安全违规。在本文中,我们提出了*约束敏感策略优化(CSPO)*,一种一阶原始-对偶方法,将局部约束敏感性纳入策略更新中。CSPO通过从安全边界的最短带符号距离导出的约束敏感校正来增强原始目标,从而能够更智能地恢复至安全状态,补偿延迟的拉格朗日乘子更新,减少边界附近的振荡,并保留原始约束问题的KKT解。在导航和运动基准上的实验表明,与最先进的原始-对偶和基于惩罚的方法相比,CSPO实现了更快的安全恢复和较高的奖励保持,从而获得更高的约束回报。 机器学习,ICML ## 1 引言 强化学习在高维决策问题中取得了显著成功,包括机器人运动、自动驾驶和复杂游戏(Wang等,2022 (https://arxiv.org/html/2606.14415#bib.bib23))。标准强化学习的一个主要限制是它优化期望回报而没有明确考虑安全约束,这在现实应用中是不可接受的,因为违反约束可能导致物理损坏或不安全行为。安全强化学习旨在克服这一点,通常使用CMDP框架(Altman, 2021 (https://arxiv.org/html/2606.14415#bib.bib2))形式化问题,其中智能体必须确保期望累积成本保持在规定限制以下,从而限制可行策略的集合。安全强化学习中的一个主要工作线使用二阶信任域方法(Achiam等,2017 (https://arxiv.org/html/2606.14415#bib.bib1); Yang等,2020 (https://arxiv.org/html/2606.14415#bib.bib25); Milosevic等,2025 (https://arxiv.org/html/2606.14415#bib.bib13))处理CMDP,通过序列二次规划近似约束目标,同时提供强有力的理论保证,但它们需要昂贵的Fisher矩阵求逆。实证研究表明,更简单的一阶方法可以在连续控制基准上表现相当甚至更好(Ray等,2019 (https://arxiv.org/html/2606.14415#bib.bib17))。这激发了原始-对偶拉格朗日方法(Chow等,2018 (https://arxiv.org/html/2606.14415#bib.bib4); Tessler等,2019 (https://arxiv.org/html/2606.14415#bib.bib22)),它使用一阶梯度的联合更新策略和乘子,以及惩罚方法(Zhang等,2022 (https://arxiv.org/html/2606.14415#bib.bib26); Liu等,2020 (https://arxiv.org/html/2606.14415#bib.bib12))将成本惩罚添加到奖励目标中。然而,两者都有局限性。首先,惩罚方法需要精心调整(通常很大)的惩罚因子;否则,它们要么产生过于保守的策略,要么产生持续的约束违规。其次,原始-对偶方法遭受众所周知的*对偶滞后*效应(Tessler等,2019 (https://arxiv.org/html/2606.14415#bib.bib22); Paternain等,2019 (https://arxiv.org/html/2606.14415#bib.bib15)),导致当乘子较小时出现不安全行为,当乘子变大时出现过度保守,从而表现出振荡的学习动态(Platt & Barr, 1987 (https://arxiv.org/html/2606.14415#bib.bib16))。此外,安全恢复需要考虑*约束函数的局部敏感性和陡度*。平坦区域可能需要更强的校正更新以恢复可行性,而陡峭区域则需要更谨慎的步骤以避免过冲。然而,现有方法未能利用这一结构,不对局部约束陡度加以区分地统一惩罚约束违规。如图1 (https://arxiv.org/html/2606.14415#S2.F1)(‘原始-对偶’)所示,忽略陡峭边界附近的约束敏感性可能导致过冲和振荡行为,造成不稳定和低效的安全恢复。 在本文中,我们引入了**约束敏感策略优化(CSPO)**,这是一种一阶安全强化学习算法,保留了原始-对偶方法的简单性,同时显式利用局部一阶约束信息。CSPO在原始更新中增加了一个仅在违规发生时应用的约束校正。通过使用约束梯度的范数缩放此校正,CSPO使约束执行强度适应局部约束敏感性,减少延迟的约束校正,并实现更快、更平滑地返回可行性(见图1中的CSPO动态 (https://arxiv.org/html/2606.14415#S2.F1))。重要的是,CSPO在可行集和最优解方面仍然等价于原始约束问题。此外,我们引入了三个互补指标来评估安全恢复:**安全恢复时间(TTS)**,衡量恢复可行性的速度,**奖励保持(RP)**,量化恢复期间的奖励保持,以及**违规频率(VF)**,捕捉训练过程中违反安全约束的频率。 我们的贡献是: - •我们提出了CSPO,一种一阶原始-对偶安全强化学习算法,结合局部约束敏感性以加速从约束违规中恢复。 - •我们证明了CSPO保留了原始约束问题的可行集和最优解。 - •我们引入了三个安全指标(TTS, RP, VF)来评估安全恢复动态。 - •在实验上,CSPO在连续控制基准上表现出更快、更稳定的安全收敛,并具有强劲的性能。 ## 2 背景 ### 2.1 马尔可夫决策过程 我们考虑一个折扣MDP \(\mathcal{M}=(\mathcal{S},\mathcal{A},r,P,\mu,\gamma)\),其中 \(\mathcal{S}\) 是状态空间,\(\mathcal{A}\) 是动作空间,\(r:\mathcal{S}\times\mathcal{A}\times\mathcal{S}\to\mathbb{R}\) 是奖励函数,\(P(s'\mid s,a)\) 是转移核,\(\mu\) 是初始状态分布,\(\gamma\in[0,1)\) 是折扣因子。一个平稳策略 \(\pi\) 是在给定状态下动作上的分布 \(\pi(a\mid s)\),并诱导一个轨迹 \(\tau=(s_0,a_0,s_1,a_1,\dots)\),其中 \(s_0\sim\mu\),\(a_t\sim\pi(\cdot\mid s_t)\),\(s_{t+1}\sim P(\cdot\mid s_t,a_t)\)。\(\pi\) 的折扣回报为
\[
J(\pi) \;=\; \mathbb{E}_{\tau\sim\pi}\Bigg[\sum_{t=0}^{\infty}\gamma^t r_t\Bigg]. \tag{1}
\]
我们分别用 \(V^\pi(s)\)、\(Q^\pi(s,a)\) 和 \(A^\pi(s,a)\) 表示 \(\pi\) 的值函数、状态-动作值函数和优势函数,定义分别为
\(V^\pi(s)=\mathbb{E}_{\tau\sim\pi}[\sum_{t=0}^{\infty}\gamma^t r_t\mid s_0=s]\),
\(Q^\pi(s,a)=\mathbb{E}_{\tau\sim\pi}[\sum_{t=0}^{\infty}\gamma^t r_t\mid s_0=s,a_0=a]\),
\(A^\pi(s,a)=Q^\pi(s,a)-V^\pi(s)\)。
请参阅图注
图1:CSPO在玩具约束优化问题上的几何直觉。虚线表示目标水平集 \(f(\theta)\),点线表示约束水平集 \(g(\theta)\),紫色曲线是边界 \(g(\theta)=0\),阴影区域不可行。从不可行迭代 \(\pi_0\) 开始,标准拉格朗日更新可能在高度敏感区域过冲和振荡,而CSPO通过 \(\|\nabla g(\theta)\|\) 缩放约束校正,实现稳定的可行性恢复并减少奖励退化。
### 2.2 约束马尔可夫决策过程(CMDP)
一个CMDP(Altman, 2021 (https://arxiv.org/html/2606.14415#bib.bib2))在MDP基础上增加了成本函数 \(\{c_i\}_{i=1}^m\),其中每个 \(c_i:\mathcal{S}\times\mathcal{A}\times\mathcal{S}\rightarrow\mathbb{R}_+\) 将转移映射到即时成本。对于一个平稳策略 \(\pi\),\(c_i\) 的折扣成本回报为:
\[
J_{c_i}(\pi)=\mathbb{E}_{\tau\sim\pi}\!\left[\sum_{t=0}^{\infty}\gamma^t c_i(s_t,a_t,s_{t+1})\right]. \tag{2}
\]
给定成本限制 \(d_1,\dots,d_m\),可行策略集为
\[
\Pi_{\mathrm{safe}}=\{\pi\in\Pi:\; J_{c_i}(\pi)\leq d_i\;\forall i\}. \tag{3}
\]
因此,安全强化学习旨在找到一个最优可行策略:
\[
\pi^{\star}=\arg\max_{\pi\in\Pi_{\mathrm{safe}}}\; J(\pi). \tag{4}
\]
即在满足成本约束的前提下最大化回报。我们类似地定义 \(V_{c_i}^\pi\)、\(Q_{c_i}^\pi\) 和 \(A_{c_i}^\pi\) 为与成本函数 \(c_i\) 相关的值函数、状态-动作值函数和优势函数,分别定义为
\(V_{c_i}^\pi(s)=\mathbb{E}_{\tau\sim\pi}[\sum_{t=0}^{\infty}\gamma^t c_{i_t}\mid s_0=s]\),
\(Q_{c_i}^\pi(s,a)=\mathbb{E}_{\tau\sim\pi}[\sum_{t=0}^{\infty}\gamma^t c_{i_t}\mid s_0=s,a_0=a]\),
\(A_{c_i}^\pi(s,a)=Q_{c_i}^\pi(s,a)-V_{c_i}^\pi(s)\)。
### 2.3 约束策略优化
设 \(d_\pi(s)=(1-\gamma)\sum_{t=0}^{\infty}\gamma^t\Pr(s_t=s\mid\pi)\) 为策略 \(\pi\) 的归一化折扣状态访问分布。对于任何有界函数 \(f:\mathcal{S}\times\mathcal{A}\times\mathcal{S}\to\mathbb{R}\),令 \(J_f(\pi)\) 表示相应的折扣回报,\(A_f^\pi\) 为其优势函数。*性能差引理*(Kakade & Langford, 2002 (https://arxiv.org/html/2606.14415#bib.bib9))指出,对于任意两个策略 \(\pi\) 和 \(\pi'\),
\[
J_f(\pi')-J_f(\pi)=\frac{1}{1-\gamma}\; \mathbb{E}_{s\sim d_{\pi'},\,a\sim\pi'}\!\big[A_f^\pi(s,a)\big]. \tag{5}
\]
将 (5) 应用于奖励 \(r\) 和每个成本 \(c_i\) 允许将安全强化学习目标 (4) 重写为迭代策略搜索。对于参数化随机策略 \(\pi_\theta(a\mid s)\),其中 \(\theta\in\mathbb{R}^d\),以及当前策略 \(\pi_{\theta_k}\),更新后的策略 \(\pi_{\theta_{k+1}}\) 通过最大化奖励优势同时满足成本约束得到:
\[
\footnotesize \pi_{\theta_{k+1}} = \arg\max_{\pi_\theta}\; \mathbb{E}_{s\sim d_{\pi_\theta},\,a\sim\pi_\theta}\big[A_r^{\pi_{\theta_k}}(s,a)\big] \tag{6}
\]
\[
\text{s.t.}\quad J_{c_i}(\pi_{\theta_k}) + \frac{1}{1-\gamma}\mathbb{E}_{s\sim d_{\pi_\theta},\,a\sim\pi_\theta}\big[A_{c_i}^{\pi_{\theta_k}}(s,a)\big] \leq d_i,
\]
## 3 约束敏感策略优化
我们考虑一个可微的参数化策略类 \(\{\pi_\theta:\theta\in\mathbb{R}^d\}\),当前迭代为 \(\theta_k\)。为清晰起见,我们考虑单约束情况,并将策略 \(\pi_\theta\) 的代理成本约束表示为:
\[
\footnotesize g(\theta)=J_c(\pi_{\theta_k})+\frac{1}{1-\gamma}\mathbb{E}_{s\sim d_{\pi_\theta},\,a\sim\pi_\theta}\!\left[A_c^{\pi_{\theta_k}}(s,a)\right]-d. \tag{7}
\]
根据优势函数的定义,该约束满足 \(g(\theta_k)=J_c(\pi_{\theta_k})-d\),即当前策略迭代 \(\pi_{\theta_k}\) 的约束违规。我们将可行参数集定义为 \(\Gamma=\{\theta\in\mathbb{R}^d: g(\theta)\leq 0\}\)。
### 3.1 约束的一阶几何
考虑一个策略更新 \(\theta_{k+1}=\theta_k+\Delta\theta\)。对于足够小的信任域有界更新,并假设 \(g\) 连续可微且梯度局部Lipschitz,约束可以展开为二阶:
\[
g(\theta_{k+1})=g(\theta_k)+\nabla_\theta g(\theta_k)^\top \Delta\theta + \mathcal{O}(\|\Delta\theta\|^2). \tag{8}
\]
等价地,如果 \(\nabla g\) 在 \(\theta_k\) 的邻域内是 \(L_g\)-Lipschitz的,则
\[
\big|g(\theta_k+\Delta\theta)-g(\theta_k)-\nabla_\theta g(\theta_k)^\top \Delta\theta\big| \leq \frac{L_g}{2}\,\|\Delta\theta\|^2.
\]
在信任域有界更新 \(\|\Delta\theta\|\leq\varepsilon\) 且 \(\varepsilon>0\) 很小的情况下,近似误差为 \(\mathcal{O}(\varepsilon^2)\),而一阶变化为 \(\mathcal{O}(\varepsilon)\)。因此,对于小步长,\(\mathcal{O}(\|\Delta\theta\|^2)\) 可以忽略。
在约束违规期间,我们寻找返回安全边界的最小更新。形式化为:
\[
\min_{\Delta\theta}\; \frac{1}{2}\|\Delta\theta\|^2 \quad \text{s.t.}\quad g(\theta_k)+\nabla_\theta g(\theta_k)^\top \Delta\theta=0. \tag{9}
\]
求解 (9) 得到:
\[
\Delta\theta^{\star} = -\frac{g(\theta_k)}{\|\nabla_\theta g(\theta_k)\|^2}\nabla_\theta g(\theta_k),\qquad \|\Delta\theta^{\star}\| = \frac{|g(\theta_k)|}{\|\nabla_\theta g(\theta_k)\|} \tag{10}
\]
其中 \(\nabla_\theta g(\theta_k)\) 表示代理约束关于策略参数的梯度,在当前迭代 \(\theta_k\) 处求值。该更新的长度 \(\|\Delta\theta^{\star}\|\) 给出了从 \(\theta_k\) 到可行集 \(\Gamma\) 的*最短带符号距离*。然而,在随机梯度估计下,一步精确地达到 \(g(\theta_{k+1})=0\) 可能过于激进。相反,我们强制违规的*分数减少*:
\[
g(\theta_{k+1}) \leq \sigma\, g(\theta_k),\quad \sigma\in(0,1],
\]
这对应于目标为*缩放后的*线性化约束的边界:
\[
g(\theta_k)+\nabla_\theta g(\theta_k)^\top \Delta\theta = \sigma\, g(\theta_k).
\]相似文章
SAPO:用于智能体强化学习的单次展开自回归策略优化
SAPO 是一种用于智能体强化学习的低内存、高计算效率框架,它在单个自回归骨干中共享策略和价值函数,在 ALFWorld 和 WebShop 的实验中表现优于 PPO 和 GRPO。
StepPO:面向智能体强化学习的步骤对齐策略优化
StepPO 引入了一种面向智能体强化学习的步骤中心范式,该范式将策略优化与智能体决策粒度对齐,在多轮交互任务中优于以令牌为中心的方法。
软自适应策略优化
SAPO引入了一个平滑、温度控制的门控机制,以自适应地减弱强化学习中的离策略更新,与使用硬裁剪的方法相比,提升了训练稳定性和性能。
Boundary-Seeking Policy Gradient for Safe Reinforcement Learning
Introduces Boundary-Seeking Policy Gradient (BSPG), a first-order method for safe reinforcement learning that actively drives the policy toward the constraint boundary, with convergence guarantees and improved reward/boundary tracking on a Safety-Gymnasium task.
SLPO:通过代理策略扩展潜在推理
介绍了一种代理潜在策略优化(SLPO)方法,将结果奖励强化学习应用于自回归潜在推理器,实现测试时扩展和变长策略,从而在更难实例上提高准确率。