安全探索者:一种针对带有恢复干预的强化学习的无偏策略梯度
摘要
安全探索者(SafeExplorer)引入了一种用于带有恢复干预的强化学习的无偏策略梯度估计器,在机器人任务上显著减少了训练期间的跌倒次数,同时达到或超过了标准PPO的最终奖励。
查看缓存全文
缓存时间: 2026/07/13 07:56
# SafeExplorer:一种用于带恢复干预的强化学习的无偏策略梯度方法 来源:https://arxiv.org/html/2607.08925 Elham Daneshmandelham\.daneshmand@mail\.mcgill\.ca 麦吉尔大学 & MilaMajid Khadivmajid\.khadiv@tum\.de 慕尼黑工业大学Glen Bersethglen\.berseth@umontreal\.ca 蒙特利尔大学 & MilaHsiu\-Chin Linhsiu\-chin\.lin@mcgill\.ca 麦吉尔大学 & Mila ###### 摘要 直接在物理机器人上训练强化学习智能体使得每一次跌倒都代价高昂,因为跌倒可能损坏平台,并且无法像模拟器重置那样撤销;因此目标是在训练期间最小化跌倒次数,而不是像约束马尔可夫决策过程公式那样在跌倒次数和回报之间进行权衡。标准的缓解措施是,每当智能体离开设计者指定的*安全区域*(它应保持的状态空间子集)时,将控制权交给一个独立的*恢复策略*,但由此产生的混合策略轨迹会静默地使每次在策略更新产生偏差,并且当恢复策略是确定性的时,能够消除这种偏差的重要性采样校正就无法正确定义。我们通过对近端策略优化进行即插即用的修改来解决这个偏差。其核心是一个无偏的策略梯度估计器,它仅在安全时间步使用得分函数,并且从不评估恢复策略的密度,因此即使在恢复策略是确定性的时候(这正是重要性采样失效之处)也保持有效,并且在恢复策略是随机的情况下经验性上优于重要性采样。由于恢复策略在安全区域边界附近仍然使信用分配变慢,还有两个进一步的组件加速学习:当动力学和恢复策略是确定性时,恢复触发状态的闭环形式价值,以及仅在恢复*成功*时复制恢复动作的模仿损失。在一个三环境、五种子基准测试中,与标准PPO相比,所得到的算法在 HalfCheetah、Ant 和 Unitree Go1 上分别将训练期间的跌倒次数减少了 233 倍、48 倍和 26 倍,同时匹配或超过了 PPO 的最终奖励,而在恢复策略不可靠的 Ant 上,它是唯一达到最佳最终奖励 80% 的方法。 ## 1 引言 \Ac RL 策略通常在直接针对其部署任务进行训练时表现最佳,但将这种训练转移到物理机器人上却因一个与渐近性能无关的原因而变得困难:学习需要失败,而在真实硬件上每一次失败都有代价。一次*跌倒*,即导致回合结束的平衡丧失,会损坏平台,并且无法像模拟器重置那样撤销。近期的方法通过在大规模并行模拟中收集数十万个回合来学习有能力的控制器(Lee 等人,2020 (https://arxiv.org/html/2607.08925#bib.bib32);Rudin 等人,2021 (https://arxiv.org/html/2607.08925#bib.bib43);Agarwal 等人,2022 (https://arxiv.org/html/2607.08925#bib.bib2)),在这些模拟中失败是免费的,但在真实机器人上则不然(Ibarz 等人,2021 (https://arxiv.org/html/2607.08925#bib.bib22);Smith 等人,2023b (https://arxiv.org/html/2607.08925#bib.bib49))。因此,限制真实世界训练的不是最终奖励,而是达到该奖励所经历的跌倒次数,而 SafeExplorer 的目标就是让这个次数保持很小。 在真实硬件上保持学习的常用方法是将智能体与一个独立的*恢复策略*配对,这个控制器在智能体离开设计者指定的*安全区域*时接管控制权,并将系统引导回标称状态。由于安全区域设置得较为保守,智能体经常离开它,因此恢复策略触发的频率远高于跌倒发生的频率,将大多数潜在的跌倒转化为廉价、可逆的干预。该控制器很容易由现成的组件组装而成,例如模型预测控制求解器(Pua & Khadiv,2024 (https://arxiv.org/html/2607.08925#bib.bib40))、软演员-评论家专家(Haarnoja 等人,2018 (https://arxiv.org/html/2607.08925#bib.bib18))或手工编码的例程(Lee 等人,2019 (https://arxiv.org/html/2607.08925#bib.bib31))。但它有一个隐藏的成本:智能体收集的数据不再由智能体单独产生,而是由*混合策略*产生——在安全区域内是主策略,在安全区域外是恢复策略——因此每个轨迹是两种控制器的混合,而不是来自正在改进的策略的样本。这种混合破坏了在策略假设。PPO(Schulman 等人,2017 (https://arxiv.org/html/2607.08925#bib.bib46))及相关方法估计产生轨迹的策略的梯度,因此它们仅在轨迹分布与正在更新的策略匹配时才有效。一旦恢复策略介入,每次更新都会偏向恢复策略的行为。大多数安全强化学习工作未处理这种不匹配,就好像所有数据都来自主策略一样进行更新(Srinivasan 等人,2020 (https://arxiv.org/html/2607.08925#bib.bib53);Thananjeyan 等人,2021 (https://arxiv.org/html/2607.08925#bib.bib58);Yang 等人,2022 (https://arxiv.org/html/2607.08925#bib.bib65)),或者通过塑造奖励以阻止进入恢复来回避它(Tessler 等人,2018 (https://arxiv.org/html/2607.08925#bib.bib57);Stooke 等人,2020 (https://arxiv.org/html/2607.08925#bib.bib54))。标准的补救措施,重要性采样校正(Degris 等人,2012 (https://arxiv.org/html/2607.08925#bib.bib12)),也没有解决这个问题:确定性恢复(MPC 求解器或贪婪的 SAC 动作器)产生单个动作而非分布,因此重要性比值的分母没有密度,在恰恰需要它的地方未定义,这与促使确定性策略梯度(Silver 等人,2014 (https://arxiv.org/html/2607.08925#bib.bib47))的障碍相同。因此,使真实世界训练可行的机制正是破坏学习信号的机制,正确的梯度必须将恢复策略分解出去而非通过它重新加权。 贡献。我们通过 SafeExplorer 来弥补这一差距,这是一个建立在具有恢复策略的安全强化学习理论基础上的实用算法。我们做出四项贡献。*第一*,我们证明了一个针对任意混合策略的无偏策略梯度定理(定理 1 (https://arxiv.org/html/2607.08925#Thmtheorem1)),该混合策略在状态子集上将控制权交给外部恢复策略。该梯度仅在主策略动作的状态使用主策略得分函数,并且从不评估恢复策略的动作密度,因此同样适用于确定性和随机性恢复,经验上在每个测量的场景中匹配或优于重要性采样校正,在重要性比值爆炸的地方梯度方差低数个数量级(注 1 (https://arxiv.org/html/2607.08925#Thmremark1))。该定理是通用的:安全区域干预是我们发展的实例(推论 2 (https://arxiv.org/html/2607.08925#Thmtheorem2)),而跳转启动强化学习(Uchendu 等人,2023 (https://arxiv.org/html/2607.08925#bib.bib62))(推论 8 (https://arxiv.org/html/2607.08925#Thmtheorem8))和状态触发的屏蔽强化学习(推论 9 (https://arxiv.org/html/2607.08925#Thmtheorem9))作为相同分解的推论而成立。*第二*,我们界定了我们优化的混合策略回报与我们部署的主策略回报之间的差距(定理 4 (https://arxiv.org/html/2607.08925#Thmtheorem4));这个差距随着安全区域增大而缩小,并在安全区域覆盖所有可达状态的理想极限下消失。*第三*,当动力学和恢复策略是确定性的时候,恢复触发状态的价值存在闭合形式表达式(命题 6 (https://arxiv.org/html/2607.08925#Thmtheorem6));用作评论家在该状态的目标,它在安全区域边界提供了密集、准确的监督,而在那里在策略信号原本稀缺。*第四*,我们添加了一个结果门控的兼容性正则化项(定义 7 (https://arxiv.org/html/2607.08925#Thmtheorem7)),它仅从*成功*的恢复片段中拉取主策略动作,这是一种基于恢复策略已证明有效的行为的热启动;没有门控,它退化为数据集聚合风格的模仿学习损失(Ross 等人,2011 (https://arxiv.org/html/2607.08925#bib.bib42))(命题 10 (https://arxiv.org/html/2607.08925#Thmtheorem10))。这四个部分共同将恢复策略从偏差源转变为信号源。在一个三环境、五种子基准测试中,与标准 PPO 相比,它们在 HalfCheetah、Ant 和 Go1 上将训练期间的跌倒次数分别减少了 233 倍、48 倍和 26 倍,同时匹配或超过 PPO 的最终奖励。在恢复策略不可靠的 Ant 上,SafeExplorer 是唯一达到最佳奖励 80% 成功阈值的的方法。 ## 2 相关工作 我们研究的设置——智能体与一个外部的恢复策略配对,该恢复策略在安全区域外接管——使得训练轨迹遵循一种混合策略,这种混合策略会使每次在策略更新产生偏差。我们在腿式运动方面进行评估,其中端到端强化学习已取得快速进展(Ha 等人,2025 (https://arxiv.org/html/2607.08925#bib.bib17);Lee 等人,2020 (https://arxiv.org/html/2607.08925#bib.bib32);Peng 等人,2018 (https://arxiv.org/html/2607.08925#bib.bib38);Tan 等人,2018 (https://arxiv.org/html/2607.08925#bib.bib56);Peng 等人,2020 (https://arxiv.org/html/2607.08925#bib.bib39);Rudin 等人,2021 (https://arxiv.org/html/2607.08925#bib.bib43);Agarwal 等人,2022 (https://arxiv.org/html/2607.08925#bib.bib2);Kumar 等人,2021 (https://arxiv.org/html/2607.08925#bib.bib30);Haarnoja 等人,2019 (https://arxiv.org/html/2607.08925#bib.bib19);Bogdanovic 等人,2022 (https://arxiv.org/html/2607.08925#bib.bib9)),并且真实世界微调现已常规(Smith 等人,2023b (https://arxiv.org/html/2607.08925#bib.bib49);2024 (https://arxiv.org/html/2607.08925#bib.bib50);a (https://arxiv.org/html/2607.08925#bib.bib48);Liu 等人,2024 (https://arxiv.org/html/2607.08925#bib.bib33))。这些方法通过奖励设计和模拟到真实的鲁棒性来确保安全,但没有人面对恢复策略注入到在策略梯度中的偏差。因为该偏差来自混合轨迹而非腿式机器人的任何属性,我们的校正可以嵌入到运动流水线中,而不受限于运动或某个特定机器人。 离策略强化学习 校正这种偏差看起来像一个标准的离策略问题,但离策略策略梯度和评估方法(Degris 等人,2012 (https://arxiv.org/html/2607.08925#bib.bib12);Gu 等人,2017 (https://arxiv.org/html/2607.08925#bib.bib16);Jiang & Li,2016 (https://arxiv.org/html/2607.08925#bib.bib24))依赖于第 1 节 (https://arxiv.org/html/2607.08925#S1) 所示确定性恢复策略使其未定义的重要性比值。截断重要性采样方案如 V-trace(Espeholt 等人,2018 (https://arxiv.org/html/2607.08925#bib.bib13))和 Retrace(Munos 等人,2016 (https://arxiv.org/html/2607.08925#bib.bib34))无能为力,因为奇点位于截断的上游。我们的定理 1 (https://arxiv.org/html/2607.08925#Thmtheorem1) 将恢复测度分解出去而非重新加权,因此统一适用于确定性和随机性恢复,包括 MPC 控制器(Chiu 等人,2022 (https://arxiv.org/html/2607.08925#bib.bib10))。 混合策略和干预数据 如果重新加权不是路径,那么替代方案是询问先前工作如何使用相同的混合策略数据,而第二个策略介入的轨迹实际上很常见:它们出现在 DAgger(Ross 等人,2011 (https://arxiv.org/html/2607.08925#bib.bib42);Kelly 等人,2019 (https://arxiv.org/html/2607.08925#bib.bib29))、人在环强化学习(Spencer 等人,2020 (https://arxiv.org/html/2607.08925#bib.bib52);Saunders 等人,2018 (https://arxiv.org/html/2607.08925#bib.bib44))和跳转启动强化学习(Uchendu 等人,2023 (https://arxiv.org/html/2607.08925#bib.bib62))中。这些方法要么模仿介入策略,要么丢弃其转移,因此它们无法从这些数据中提取偏差校正的在策略梯度。我们的掩码梯度(定理 1 (https://arxiv.org/html/2607.08925#Thmtheorem1))直接恢复该梯度,并且我们的兼容性正则化项(第 4.4 节 (https://arxiv.org/html/2607.08925#S4.SS4))在 JSRL 设置中简化为一个具有基于结果的门的依赖于状态的模仿损失(命题 10 (https://arxiv.org/html/2607.08925#Thmtheorem10))。 约束和安全过滤器 将安全委托给外部恢复策略本身就是少数选择:安全强化学习的主流(García & Fernández,2015 (https://arxiv.org/html/2607.08925#bib.bib15))将安全构建到策略中,而不是交给一个独立的控制器。约束马尔可夫决策过程将安全编码为对长期成本的约束(Altman,1999 (https://arxiv.org/html/2607.08925#bib.bib5)),通过原对偶方案优化,如约束策略优化(Achiam 等人,2017 (https://arxiv.org/html/2607.08925#bib.bib1))、奖励约束策略优化(Tessler 等人,2018 (https://arxiv.org/html/2607.08925#bib.bib57))和 PID-拉格朗日变体(Stooke 等人,2020 (https://arxiv.org/html/2607.08925#bib.bib54))。因为它们权衡成本与回报,它们适用于一些失败可容忍的软约束设置,而我们则将跌倒视为需要最小化的东西,而非需要与回报权衡的东西。更接近硬保证的是控制屏障函数方法(Ames 等人,2019 (https://arxiv.org/html/2607.08925#bib.bib6))和屏蔽(Junges 等人,2015 (https://arxiv.org/html/2607.08925#bib.bib25);Alshiekh 等人,2018 (https://arxiv.org/html/2607.08925#bib.bib4);Dalal 等人,2018 (https://arxiv.org/html/2607.08925#bib.bib11);Srinivasan 等人,2020 (https://arxiv.org/html/2607.08925#bib.bib53);Hasanbeig 等人,2020 (https://arxiv.org/html/2607.08925#bib.bib20);Kang 等人,2022 (https://arxiv.org/html/2607.08925#bib.bib27)),它们在执行时投影不安全动作;这正是我们机制中干预是单步投影的情况,因此我们的设置将其作为一个实例包含在内。密切相关的是状态约束马尔可夫决策过程族(Zhao 等人,2023 (https://arxiv.org/html/2607.08925#bib.bib67))和几乎必然安全的强化学习(Sootla 等人,2022 (https://arxiv.org/html/2607.08925#bib.bib51))。第 3 节 (https://arxiv.org/html/2607.08925#S3) 将所有这些形式置于 Wachi 等人 (2024 (https://arxiv.org/html/2607.08925#bib.bib63)) 的约束形式分类法中。 带恢复策略的强化学习 最接近我们工作的方法完全承诺于这种委托:它使用显式恢复策略作为约束(CMDP)成本和逐点过滤器的替代方案,面临相同的混合策略偏差,该偏差从我们的屏蔽强化学习推论的单步投影扩展到多步恢复片段。Thananjeyan 等人 (2021 (https://arxiv.org/html/2607.08925#bib.bib58)) 训练一个安全评论家,并在约束风险超过阈值时切换到恢复策略;他们有意用任务策略提出的动作重新标记恢复转移,这对于他们的离策略 Q-learning 目标是一致的(第 B.7 节 (https://arxiv.org/html/2607.08925#A2.SS7)),但一旦带入在策略更新中就成为了我们校正的偏差源。Yang 等人 (2022 (https://arxiv.org/html/2607.08925#bib.bib65)) 将类似的模板应用于带奖励塑造的腿式运动,而 Lee 等人 (2019 (https://arxiv.org/html/2607.08925#bib.bib31)) 训练了一个无模型的四足机器人恢复控制器,这是外部恢复的一个例子。
相似文章
基于重试的策略梯度强化学习中探索的涌现
本文提出ReMax,一种新的强化学习目标函数,通过基于多个样本的期望最大回报来评估策略,从而将探索作为涌现属性引入,无需显式的探索奖励。作者推导了策略梯度公式,并提出了RePPO,一种PPO变体,在MinAtar和Craftax基准测试上实现了高效探索。
Boundary-Seeking Policy Gradient for Safe Reinforcement Learning
Introduces Boundary-Seeking Policy Gradient (BSPG), a first-order method for safe reinforcement learning that actively drives the policy toward the constraint boundary, with convergence guarantees and improved reward/boundary tracking on a Safety-Gymnasium task.
CSPO:面向安全强化学习的约束敏感策略优化
本文提出约束敏感策略优化(CSPO),一种用于安全强化学习的一阶原始-对偶方法,该方法融合局部约束灵敏度以改善安全恢复并减少安全边界附近的振荡,在导航和运动基准上实现了更高的约束回报。
Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents
Introduces SSPO, a step-level self-distilled policy optimization method for training deep search agents, which uses evidence anchors and advantage weights to improve credit assignment beyond sparse outcome rewards. SSPO outperforms GRPO on benchmarks like BrowseComp and GAIA with only ~5% overhead per step.
StepPO:面向智能体强化学习的步骤对齐策略优化
StepPO 引入了一种面向智能体强化学习的步骤中心范式,该范式将策略优化与智能体决策粒度对齐,在多轮交互任务中优于以令牌为中心的方法。