调整速度作为非平稳强化学习的安全约束
摘要
本文提出将调整速度作为非平稳强化学习的安全约束,从适应可行性角度定义安全性,并利用表示学习与上下文预测,在预测的适应需求超过系统可达容量时主动调节行为。
arXiv:2607.21646v1 公告类型:新
摘要:在非平稳环境下确保强化学习的安全性,需要确定学习系统能否在所需的恢复时间内安全地适应预测的环境变化。现有的安全强化学习方法通常假设环境是平稳的,并未明确将调整速度视为安全问题。然而,当环境随时间演变时,延迟适应可能导致瞬时的危险行为。
本文提出将调整速度作为非平稳强化学习的安全约束。核心思想是从适应可行性的角度定义安全性:当保持安全所需的适应超出学习系统的校准恢复能力时,未来状态或区域可能变得不安全。所提出的框架利用学习到的上下文表示和短期上下文预测来估计适应需求,并将其与智能体可达的适应能力进行比较。
当预测的适应需求超过校准恢复能力时,该框架主动收紧可执行动作集,并激活动作级保护机制,以在违规发生前减少危险行为。
在非平稳驾驶环境中的实验表明,所提出的方法主要在上下文变化附近的短时间窗口内减少安全违规。消融研究进一步表明,保护机制在抑制峰值和尾部风险方面更为保守,而优化级别的调整则提供了短时切换条件违规的额外减少。
这些结果支持将适应可行性作为非平稳强化学习中实用的安全原则,并表明主动干预可以在环境变化期间提高安全性。
查看缓存全文
缓存时间: 2026/07/27 07:40
# 调整速度作为非平稳强化学习的安全约束
来源:https://arxiv.org/html/2607.21646
Timothy Tomashevskiy 计算与软件系 麦克马斯特大学 汉密尔顿,安大略省,加拿大 ttm207@gmail\.com
###### 摘要
在非平稳条件下确保强化学习的安全性,需要确定学习系统能否在环境预测变化所要求的恢复时域内进行适应。这里,调整速度指的是学习系统安全适应预测环境变化的能力。现有的安全强化学习方法通常假设环境是平稳的,因此没有明确地将非平稳条件下的适应速度视为安全问题。然而,当环境随时间演变时,智能体适应动态变化的速度对于维持安全性变得至关重要。
在这项工作中,我们提出将调整速度作为非平稳强化学习的一个安全约束。核心思想是根据适应可行性来定义安全性:未来状态或区域变得不安全,并非因为其本质危险,而是因为保持安全所需的适应超出了学习系统标定的恢复包络。我们利用表示学习和上下文预测来形式化这一关系,评估环境变化并将其与学习系统可达到的适应能力进行比较。
所需适应与可达到适应之间的比较用于在预测适应变得不可行时主动调节行为。在操作层面,该框架会在预测的适应需求超过学习系统可达到的适应能力时,收紧可行动作集并激活动作级屏蔽。
在非平稳驾驶环境中的实证评估表明,所提方法主要减少了与上下文变化对齐的短时域窗口内的违规行为。消融实验进一步显示,屏蔽在峰值风险和尾部风险抑制方面更为保守,而优化层面的调整则额外减少了短时域切换条件性违规。
这些结果支持以下观点:非平稳条件下的安全性取决于适应可行性:当预测的环境变化速度快于学习系统能够安全适应的速度时,主动安全干预变得必要。
## 1 引言
强化学习在机器人学、自动驾驶和自适应控制等序贯决策问题中取得了显著的实证成功 (Mnih 等,2015;Lillicrap 等,2016)。然而,许多实际部署环境本质上是非平稳的:交通模式演变、交互智能体改变行为、传感器条件漂移,任务动态可能随时间变化。这种分布偏移违反了大多数强化学习方法所依赖的平稳性假设,可能显著降低性能和安全性。
这一挑战在安全关键场景中尤为突出。在之前观察条件下安全的策略,在环境变化后可能变得不安全,即使长期运行性能尚未出现显著下降。在实践中,失败通常不是因为智能体永远无法适应,而是因为它无法在所需时域内恢复安全行为。环境动态变化后,系统可能在策略适应新动态之前就已经演化。在这个瞬态阶段,智能体继续执行可能在新条件下次优或不安全的动作。分布偏移后的适应涉及安全行为的恢复,而安全恢复的延迟可能导致不安全行为的爆发。
大多数现有的安全强化学习方法并未明确解决这一问题。基于约束马尔可夫决策过程、固定安全规范或奖励-惩罚公式的经典方法通常设计用于平稳或缓慢变化的环境 (Altman, 1999; Achiam 等,2017; Tessler 等,2019)。同时,关于非平稳、持续和上下文感知强化学习的研究主要集中在适应和性能恢复上,而非在转变过程中维持安全性 (Hallak 等,2015; Finn 等,2017; Kirkpatrick 等,2017)。因此,一个重要问题仍未得到充分解决:在非平稳条件下,安全适应本身何时是可行的?
在本文中,我们认为非平稳条件下的安全性应通过预测环境变化所需的适应与学习系统可达到的适应之间的关系来理解。问题不在于智能体的物理速度,也不仅仅在于策略最终能否适应,而在于当未来上下文变化展开时,它能否在所需时域内恢复安全行为。当预测的环境变化速度快于学习系统能够安全适应的速度时,除非激活额外的保护机制,否则短暂的 unsafe 行为可能不可避免。
这一观察引出了本工作的核心概念:调整速度作为安全约束。目标不是最大化适应速度本身,而是将适应可行性作为未来状态可接受性的标准。潜在上下文的预测偏移会引发一个所需的适应需求;如果该需求超出学习系统的可达到适应能力,则受偏移影响的未来状态或区域被视为不适应于普通适应,需要更强的安全干预。

变化幅度Δ_E\\Delta\_\{E\}Δ_A\\Delta\_\{A\}安全适应不安全区域图1:适应可行性的概念性说明。红色曲线表示由预测环境变化引发的所需适应速率,蓝色虚线表示学习系统可达到的安全适应速率。阴影区域表示适应不可行,其中环境变化速度快于学习系统能够安全适应的速度。在此区域内,普通学习可能太慢而无法维持安全性,从而激发通过约束收紧和屏蔽进行主动干预。为实现这一想法,我们引入了非平稳强化学习中的调整速度作为安全约束(ASASC-NS)。该框架学习当前环境的潜在上下文表示,预测短适应时域内的上下文演化,估计由预测偏移引起的适应需求,并将该量与智能体的经验标定恢复能力进行比较。当预测所需适应超过可达到的安全适应时,框架通过收紧安全约束和激活动作级屏蔽机制来主动干预。
我们提供了预测上下文偏移、标定恢复能力与安全干预之间关系的条件理论刻画。实证表明,所提机制主要在上下文变化对齐的短时域窗口内改善了安全性,而消融实验阐明了屏蔽在峰值风险和尾部风险抑制方面更为保守。更广泛地,本工作通过将焦点从静态安全规格转向可行安全适应,推动了安全持续强化学习的发展。
#### 贡献。
本文作出四项贡献。首先,它提出了调整速度作为非平稳强化学习的安全约束,并基于适应可行性形式化安全性,即由预测环境变化所需的适应是否保持在所需时域内标定的安全恢复包络内来定义。其次,它提出了一个主动框架(ASASC-NS),结合上下文表示、上下文预测、适应需求估计和动作级屏蔽,以预测安全适应可能不可行的区域。第三,它提供了环境变化和标定恢复能力如何在分布偏移下影响违规风险的条件理论刻画。第四,它实证显示了在上下文变化对齐的短时域窗口内减少安全违规,并分析了优化层面的调整和动作级屏蔽如何影响切换条件性、峰值和尾部风险指标。
## 2 相关工作
安全强化学习通常在约束马尔可夫决策过程(CMDP)中研究,其中通过明确的成本或风险约束来强制执行安全性 (Altman, 1999)。代表性方法包括约束策略优化 (Achiam 等,2017)、拉格朗日公式 (Tessler 等,2019) 和李雅普诺夫方法 (Chow 等,2018; Berkenkamp 等,2017)。这些方法提供了原则性的安全机制,但通常假设环境平稳或缓慢变化。
第二类工作通过屏蔽或安全滤波来强制执行安全性,即在执行前修改不安全动作 (Alshiekh 等,2018; Dalal 等,2018)。混合方法结合学习策略与控制理论的安全滤波器 (Wabersich and Zeilinger, 2021)。虽然有效,但这些机制在很大程度上是反应式的:它们在不安全行为被提出后才采取行动,而不是预测条件变化何时会使安全适应变得困难。
关于非平稳和持续强化学习的研究通过上下文MDPs (Hallak 等,2015)、元学习 (Finn 等,2017)、持续学习和防止遗忘的正则化 (Kirkpatrick 等,2017)、以及显式建模上下文动态 (Xie 等,2020; Nagabandi 等,2019) 来解决变化环境问题。最近关于深度持续学习和持续深度强化学习中可塑性丧失的研究表明,适应能力本身会随时间退化或变化 (Dohare 等,2024; Abbas 等,2023; Juliani and Ash, 2024)。最近的工作也开始通过上下文或不确定性感知约束来研究非平稳条件下的安全性 (Chen 等,2021; Ding and Lavaei, 2023; Wen 等,2022)。然而,现有方法通常不提供一个明确的操作准则来确定环境变化何时超过智能体安全适应的能力。因此,我们将CadaptC\_\{\mathrm{adapt}\}视为一个标定的恢复阈值,而不是一个完整的神经可塑性模型。
相比之下,我们通过适应可行性来建模非平稳条件下的安全性。所提框架预测适应何时变得不可行,识别应避免的不安全状态区域,并使用该信号指导策略适应和收紧动作级屏蔽。这将焦点从反应式纠正转向主动规避不安全状态区域。
## 3 预备知识
我们将非平稳环境中的强化学习建模为时间相关的马尔可夫决策过程Mt=(S,A,Pt,Rt)\mathcal{M}_{t}=(\mathcal{S},\mathcal{A},P_{t},R_{t}),其中转移核和奖励函数可能随时间变化。为了捕捉这种变异性,我们假设环境由一个潜在上下文变量zt∈Zz_{t}\in\mathcal{Z}控制,使得转移依赖于(st,at,zt)(s_{t},a_{t},z_{t})。
安全性通过一个不安全集U⊂S\mathcal{U}\subset\mathcal{S}定义,违规由下式指示:
vt=1{st∈U}.v_{t}=\mathbf{1}\{s_{t}\in\mathcal{U}\}.目标是保持任务性能的同时最小化违规。
当上下文变化时,在先前动态下学习的策略可能不再安全或有效。如果环境变化率超过智能体的适应能力,可能发生瞬态安全违规。这激发了明确考虑环境变化与适应能力之间关系的机制。
## 4 方法
本节介绍非平稳强化学习中的调整速度作为安全约束(ASASC-NS)。该方法监测预测的环境变化,并询问保持安全所需的适应是否位于所需时域内标定的恢复包络中。当预测的适应需求超过学习系统的可达到适应能力时,ASASC-NS利用该可行性信号进行优化层面的调整,并通过屏蔽收紧可行动作集。
### 4.1 上下文相关的非平稳MDP
我们通过上下文相关的MDP来建模非平稳性:
Mκ=(S,A,Pκ,rκ,cκ,γ),M_{\kappa}=(\mathcal{S},\mathcal{A},P_{\kappa},r_{\kappa},c_{\kappa},\gamma), (1)
其中潜在上下文κ\kappa索引转移动态、奖励和安全成本。状态和动作空间在不同上下文间共享,但相同的状态-动作对可能在上下文变化时导致不同的下一状态分布。在驾驶领域,交通密度、周围车辆速度、攻击性和观测噪声的变化因此影响Pκ(s′∣s,a)P_{\kappa}(s^{\prime}\mid s,a)和cκ(s,a)c_{\kappa}(s,a),而不需要新的状态空间。安全性由成本或风险信号cκ(s,a)c_{\kappa}(s,a)表示,当一个动作的预测风险低于当前阈值时,该动作是可接受的。
### 4.2 上下文提取与预测
上下文编码器不是一个完整的基于模型强化学习规划器。它是一个表示模块,用于从最近的转移证据中估计当前运行模式。令
ht={(si,ai,si+1)}i=t−mth_{t}=\{(s_{i},a_{i},s_{i+1})\}_{i=t-m}^{t} (2)
为最近转移的滑动窗口。编码器将此窗口映射到潜在上下文估计:
κ^t=fθ(ht).\hat{\kappa}_{t}=f_{\theta}(h_{t}). (3)
在实现中,fθf_{\theta}可以是循环编码器或基于转移元组的Transformer。它通过一个辅助的上下文条件下一状态预测损失进行训练:
Lctx(θ,ψ)=∑(si,ai,si+1)∈htℓ(si+1,p^ψ(si,ai,κ^t))+λconsLcons,\mathcal{L}_{\mathrm{ctx}}(\theta,\psi)=\sum_{(s_{i},a_{i},s_{i+1})\in h_{t}}\ell\!\left(s_{i+1},\hat{p}_{\psi}(s_{i},a_{i},\hat{\kappa}_{t})\right)+\lambda_{\mathrm{cons}}\mathcal{L}_{\mathrm{cons}}, (4)
其中Lcons\mathcal{L}相似文章
通过自适应安全约束实现非平稳环境下的安全持续强化学习
提出LILAC+框架,用于非平稳环境下的安全持续强化学习,该框架采用三种自适应安全机制:基于上下文的安全约束、适应速度约束和预算到状态的安全执行。在模拟驾驶环境中的评估表明,在分布偏移下,该框架减少了安全违规,同时保持了竞争性的性能。
从累积约束到自适应运行时安全控制用于非平稳强化学习
提出CPSS,一种运行时安全机制,将累积成本约束转换为自适应状态级阈值,用于非平稳环境中的安全强化学习,在高速公路合流场景中展示了违规次数的减少。
学习何时行动:通过运行时保证的通信高效强化学习
本文提出了一种框架(CARE),该框架在逐点李雅普诺夫安全护罩下联合学习控制输入和通信高效的定时决策,在倒立摆、小车-杆系统和平面四旋翼飞行器上实现了比经典方法更高的采样间隔。
自动驾驶中基于不确定性感知与时间规制的专家建议强化学习
本文提出了一种面向自动驾驶的不确定性感知强化学习框架,通过自适应不确定性阈值和承诺-冷却策略引导的专家建议,提升了安全性和效率。在CARLA模拟器上的实验表明,相较于IQN基线,成功率提高了5%-7%。
基于平滑安全结构化策略组合的安全在线学习
本文提出 AutoSafe,一种面向安全在线强化学习的安全感知策略架构,将结构化的安全监控与干预直接集成到动作生成中,实现性能和安全性行为之间平滑的、依赖于风险的过渡,在基准测试和物理 cart-pole 系统上得到了验证。