通过自适应安全约束实现非平稳环境下的安全持续强化学习
摘要
提出LILAC+框架,用于非平稳环境下的安全持续强化学习,该框架采用三种自适应安全机制:基于上下文的安全约束、适应速度约束和预算到状态的安全执行。在模拟驾驶环境中的评估表明,在分布偏移下,该框架减少了安全违规,同时保持了竞争性的性能。
arXiv:2605.18842v1 公告类型:新
摘要:非平稳环境下的安全强化学习需要安全机制能够随环境条件变化而适应。标准的安全强化学习方法通常假设固定约束或稳定的环境条件,这在分布偏移下可能变得不充分。我们提出LILAC+框架,用于非平稳环境下的安全持续强化学习,该框架结合了三种自适应安全机制:基于上下文的安全约束、适应速度约束和预算到状态的安全执行。基于上下文的约束利用推断和预测的环境上下文调整安全要求。适应速度约束在环境变化速率超过智能体安全适应能力时收紧安全要求。预算到状态执行将累积安全要求转化为可在决策时执行的局部状态级控制约束。这些机制共同为持续强化学习中的主动和反应性安全适应提供了统一方法。我们在模拟驾驶环境中对框架进行了评估,包括静态、已知非平稳和未知非平稳条件。结果表明,与无约束和固定约束基线相比,自适应安全约束在分布偏移下显著减少了安全违规,同时保持了竞争性的任务性能。这些发现表明,安全持续强化学习需要自适应的约束机制,该机制不仅响应当前状态信息,还响应预测的环境上下文、适应需求和剩余安全预算。
相似文章
从累积约束到自适应运行时安全控制用于非平稳强化学习
提出CPSS,一种运行时安全机制,将累积成本约束转换为自适应状态级阈值,用于非平稳环境中的安全强化学习,在高速公路合流场景中展示了违规次数的减少。
LiSA:通过保守策略归纳实现终身安全适应
LiSA(终身安全适应)是一个框架,通过将偶尔的失败转化为可重用的策略抽象,并利用基于证据的置信门控在稀疏和噪声反馈下保持良好性能,从而增强AI代理的安全护栏,解决实际部署中对自适应安全的关键需求。
调整速度作为非平稳强化学习的安全约束
本文提出将调整速度作为非平稳强化学习的安全约束,从适应可行性角度定义安全性,并利用表示学习与上下文预测,在预测的适应需求超过系统可达容量时主动调节行为。
基于平滑安全结构化策略组合的安全在线学习
本文提出 AutoSafe,一种面向安全在线强化学习的安全感知策略架构,将结构化的安全监控与干预直接集成到动作生成中,实现性能和安全性行为之间平滑的、依赖于风险的过渡,在基准测试和物理 cart-pole 系统上得到了验证。
碰撞前的预见:基于冻结视觉语言模型的预测性安全强化学习
本文提出VLM-Safe-RL框架,该框架将冻结的视觉语言模型集成到约束MDP的拉格朗日更新中,为高速视觉控制任务的安全强化学习提供预测性成本信号。该方法在Safety-Gymnasium FormulaOne L2上优于标准约束感知基线,并能泛化到未见过的环境。