基于自适应奖励塑造和策略比率重加权策略的高样本效率迁移强化学习

arXiv cs.LG 论文

摘要

本文提出了一种用于自动驾驶高速公路车道变换的安全迁移强化学习框架,采用自适应教师干预和奖励塑造来提高样本效率和安全性。实验表明,与基线相比,安全性提升超过52%,效率提升5%。

arXiv:2606.26527v1 公告类型:新 摘要:迁移学习通过重用源任务的知识提高策略学习效率,为安全高效的自动驾驶高速公路车道变换决策提供了一种可行范式。现有方法常因源域和目标域之间的分布偏移导致迁移不匹配,引发训练振荡和性能下降。此外,目标域适应依赖于探索性交互,在安全关键的车道变换情况下难以保证训练安全。为解决这些问题,本文提出了一种用于自动驾驶高速公路车道变换的安全迁移强化学习框架。首先,我们设计了一种基于瞬时安全成本的自适应教师干预机制,以抑制风险探索并逐步减弱干预强度,并对混合行为策略的回报边界进行了理论分析。这种干预还能产生双源样本用于联合训练。其次,一个教师引导的安全迁移模块通过奖励塑造将教师策略的动作评估信息嵌入学生学习中,以提高训练安全性和效率,并随着策略安全性的提升逐渐衰减教师指导。第三,一种教师引导的加权优化机制利用似然比因子调整策略优化中的样本权重,以稳定迁移性能。在不同交通密度下的实验以及在真实NGSIM数据集上的验证表明,我们的方法在安全性上超过基线方法52.2%以上,学习效率提升5.0%。结果验证了我们面向安全感知的迁移策略在各种交通条件下用于自动驾驶高速公路车道变换的有效性和鲁棒性。
查看原文
查看缓存全文

缓存时间: 2026/06/26 05:21

# 基于自适应奖励塑形与策略比重新加权的样本高效迁移强化学习  
**来源:** https://arxiv.org/html/2606.26527  

Wenjie Huang, Yang Li, Member, IEEE, Jingjia Teng, Mingwei Jin, Kai Song, Yougang Bian, Member, IEEE, Yongfu Li, Senior Member, IEEE, Qisong Yang, Helai Huang  

This work was supported by the National NSF of China \(52302493\) and the National K&D Program of China \(2023YFB2504700\)\. \(Corresponding Author: Yang Li\)  

Wenjie Huang, Yang Li, Jingjia Teng, Mingwei Jin, Kai Song, Yougang Bian are with the State Key Laboratory of Advanced Design and Manufacturing Technology for Vehicle, College of Mechanical and Vehicle Engineering, Hunan University, Changsha 410082, China \(e\-mail: huangwenjie@hnu\.edu\.cn; lyxc56@gmail\.com; tengjingjia@foxmail\.com; tipsy13103562826@163\.com; song\_kaivip@163\.com; byg10@foxmail\.com\)\.  

Yongfu Li is with the Key Laboratory of Intelligent Air\-Ground Cooperative Control for Universities in Chongqing, School of Automation, Chongqing University of Posts and Telecommunications, Chongqing 400065, China \(e\-mail: liyongfu@ieee\.org\)\.  

Qisong Yang is with the Xi’an Institute of High\-Tech, Xi’an 710025, China\. \(e\-mail: qisong\.yang\.93@outlook\.com\)\.  

Helai Huang is with the School of Traffic and Transportation Engineering, Central South University, Changsha, Hunan 410083, China\. \(email: huanghelai@csu\.edu\.cn\)  

###### 摘要  
迁移学习通过重用源任务的知识来提高策略学习效率,为安全高效的自主高速公路变道决策提供了一种实用范式。然而,现有方法常因源域与目标域之间的分布偏移导致迁移失配,从而引发训练不稳定和性能下降。此外,目标域自适应仍依赖探索性交互,在安全关键的变道场景中难以保证训练安全。为解决这些问题,本研究提出了一种面向自主高速公路变道的安全迁移强化学习框架。首先,基于瞬时安全代价开发自适应教师干预机制,以减少不安全探索并逐步衰减干预强度,同时从理论上分析了混合行为策略下的回报界。干预过程还会生成用于联合训练的双源样本。其次,提出一种教师引导的安全迁移学习机制,将教师策略的动作评估信息以奖励塑形项的形式融入学生学习,以提高训练安全性和效率,同时随着策略安全性提升逐步减弱教师引导。第三,提出一种教师引导的优化加权机制,通过基于似然比的因子重新加权策略优化中的样本贡献,从而提升迁移稳定性。在不同交通密度下的实验结果,以及在真实世界NGSIM数据集上的附加评估表明,所提方法在安全性上相比基线方法提升超过52.2%,在效率上提升5.0%。这些结果证明了所提方法在跨多样化交通场景中实现安全感知自主高速公路变道迁移的有效性和鲁棒性。

## I. 引言  
安全高效的变道决策对于自动驾驶系统和面向“15分钟城市”的智能交通系统至关重要,而强化学习在自主变道任务中已展现出巨大潜力[19 (https://arxiv.org/html/2606.26527#bib.bib16)]。然而,从零开始学习变道策略通常需要大量的环境交互和探索,导致训练成本高且安全风险大[20 (https://arxiv.org/html/2606.26527#bib.bib3)]。为解决这些问题,迁移强化学习利用源任务的先验知识来减轻训练负担并提高收敛效率[27 (https://arxiv.org/html/2606.26527#bib.bib1)],[32 (https://arxiv.org/html/2606.26527#bib.bib12)]。尽管如此,现有迁移强化学习方法仍存在若干局限性。首先,源域与目标域之间的分布差异常导致知识失配,进而可能造成数据利用率低、样本效率低、训练不稳定、负迁移以及收敛性能下降[44 (https://arxiv.org/html/2606.26527#bib.bib4)]。其次,虽然迁移机制可以提高学习效率,但目标域训练通常仍需要探索,这使得在安全关键场景中难以保证训练安全,限制了此类方法在安全关键场景中的部署[13 (https://arxiv.org/html/2606.26527#bib.bib5)]。因此,现有的自动驾驶迁移强化学习方法仍难以同时实现训练安全性和策略学习效率。

图1:本方法关键组件示意图,它将从源任务(⋄⋄)中学到的知识有效迁移到目标任务(∘∘),从而加速学习过程,提高数据效率和安全性表现。

为了应对上述挑战,现有的迁移强化学习方法大致可分为三类:面向安全的迁移方法[45 (https://arxiv.org/html/2606.26527#bib.bib6),38 (https://arxiv.org/html/2606.26527#bib.bib17),43 (https://arxiv.org/html/2606.26527#bib.bib9)]、面向效率的迁移方法[24 (https://arxiv.org/html/2606.26527#bib.bib10),26 (https://arxiv.org/html/2606.26527#bib.bib11)]以及基于域自适应的迁移方法[28 (https://arxiv.org/html/2606.26527#bib.bib7),42 (https://arxiv.org/html/2606.26527#bib.bib8)]。面向安全的迁移方法主要关注提升迁移过程中的训练安全性,通常通过教师引导[45 (https://arxiv.org/html/2606.26527#bib.bib6)]、鲁棒控制[38 (https://arxiv.org/html/2606.26527#bib.bib17)]和安全约束[43 (https://arxiv.org/html/2606.26527#bib.bib9)]等机制来减少目标域训练中的危险探索。然而,在早期适应新环境时,不安全行为仍可能出现。面向效率的迁移方法通过重用源任务的先验知识来减轻训练负担并加速策略收敛,从而提高迁移效率[24 (https://arxiv.org/html/2606.26527#bib.bib10),26 (https://arxiv.org/html/2606.26527#bib.bib11)]。然而,这些方法通常缺乏对目标域训练安全性的显式处理,也未能解决源-目标差异导致的分布偏移和训练不稳定性。基于域自适应的迁移方法主要通过域迁移[28 (https://arxiv.org/html/2606.26527#bib.bib7)]、对应学习或表示迁移来建模源-目标差异,以提升跨域迁移性能[42 (https://arxiv.org/html/2606.26527#bib.bib8)]。然而,目前仍缺乏一种统一有效的方法来处理源-目标差异导致的分布偏移、训练不稳定性和负迁移。因此,在保证安全性的同时提升策略学习的收敛效率和稳定性,以实现快速、稳定且安全的基于强化学习的决策,仍然是当务之急。

为解决上述问题,本文首先利用从源任务中学习的策略为目标任务提供安全指导,如图1所示。在此基础上,进一步开发了一种面向自主高速公路变道的教师引导安全迁移强化学习框架,如图2所示。该框架将自适应教师干预、教师引导的策略学习和教师引导的优化整合在一个统一的迁移学习范式中。通过这种设计,该方法旨在降低目标域学习中的探索风险,提高教师指导的有效性,并增强迁移稳定性。

图2:所提出的安全迁移学习方法总体框架。首先在简单高速环境中离线训练一个教师Soft Actor-Critic(SAC)智能体。在复杂高速环境的学生训练过程中,教师提供更安全的动作干预、安全引导的策略学习信号以及用于双源数据学习的教师干预样本。

主要贡献总结如下:
- • 我们提出了一种基于瞬时安全代价的自适应教师干预机制,利用自适应阈值实现干预衰减,并从理论上分析了混合行为策略下回报的上下界。此外,干预过程自然产生两种类型的样本,可根据干预率确定的混合比例进行双源数据联合训练。
- • 我们提出了一种教师引导的安全迁移学习机制,将教师策略的动作评估信息作为奖励塑形项融入学生策略学习过程。在安全约束下,通过安全相关权重调节引导效果,从而增强学生策略的安全意识和学习效率。
- • 我们进一步开发了一种教师引导的优化加权机制。通过构建基于似然比的加权因子,重新加权策略优化中样本的更新贡献,从而提升迁移过程的稳定性并提高教师知识的利用效率。
- • 在不同交通密度下的对比实验,以及基于真实世界NGSIM数据集的附加实验,证明了所提方法的有效性和鲁棒性,并在交通效率与安全性之间取得了良好平衡。

本文其余部分组织如下:第二部分回顾相关工作。第三部分描述问题设定和建模。第四、五、六部分介绍所提方法及理论分析。第七和第八部分给出实验设置和结果。第九部分总结全文。

## II. 相关工作

### II-A 迁移强化学习
现有迁移强化学习研究主要通过重用示范、预训练策略或在线教师辅助来改进策略适应。基于示范的方法通过将专家轨迹纳入策略优化来加速早期探索[36 (https://arxiv.org/html/2606.26527#bib.bib45),18 (https://arxiv.org/html/2606.26527#bib.bib46)],而策略迁移和蒸馏方法则在相关任务间重用预训练的行为或表示知识[29 (https://arxiv.org/html/2606.26527#bib.bib50),41 (https://arxiv.org/html/2606.26527#bib.bib51)]。与此同时,教师引导方法通过在在线训练期间提供动作建议或选择性干预,进一步提高学习效率[37 (https://arxiv.org/html/2606.26527#bib.bib56),2 (https://arxiv.org/html/2606.26527#bib.bib58)]。这类方法在强化学习中特别有吸引力,因为它们引入了外部指导,而无需学生完全依赖离线监督或直接策略克隆。这种在线辅助相比静态示范或固定预训练策略提供了更灵活的迁移机制。然而,大多数现有的教师辅助方法仍然主要在动作层面提供指导。虽然这类机制可以局部减少不安全探索[14 (https://arxiv.org/html/2606.26527#bib.bib78)],但它们通常无法将教师的评估信号传递到学生的值学习中。结果,学生可能遵循纠正后的动作,却没有充分内化其长期安全含义。此外,大多数指导机制是固定、启发式的,或者仅与学生当前学习状态弱耦合[11 (https://arxiv.org/html/2606.26527#bib.bib76)],这使得它们不太适合需要自适应指导的安全关键任务。与现有方法不同,我们提出了一种教师引导的安全迁移机制,通过奖励塑形将教师的动作评估融入学生策略学习,并在安全约束下使用安全相关权重自适应调节引导效果,从而提升安全意识和学习效率。

### II-B 安全迁移强化学习
在师生强化学习中,安全保证通常通过两种不同方式实现。一些研究在执行层面通过纠正或替换不安全的学生动作来保证安全;例如,动作屏蔽方法[1 (https://arxiv.org/html/2606.26527#bib.bib32)]及其在部分可观测设置下的扩展[5 (https://arxiv.org/html/2606.26527#bib.bib33)]显式阻止可能违反安全要求的动作,而基于模型的恢复方案通过恢复控制或自适应重规划进一步提高了这种保护的灵活性[23 (https://arxiv.org/html/2606.26527#bib.bib34)]。另一类研究并非在执行时直接纠正学生的不安全动作,而是通过将教师融入学习过程来提高训练安全性,无论是通过直接指导学生的决策,还是通过更广泛的保护机制。一些方法仅在必要时提供选择性教师建议[16 (https://arxiv.org/html/2606.26527#bib.bib38)],而另一些方法则进一步将这种建议与模仿学习相结合,帮助学生从教师支持的决策中习得更安全的行为[15 (https://arxiv.org/html/2606.26527#bib.bib39)]。然而,现有研究通常采用固定或启发式的干预方案,没有根据学生的瞬时安全状况或能力调整干预强度。此外,它们很少利用干预所产生的学生生成样本和教师引导样本作为互补的数据来源进行联合训练。与现有方法不同,我们开发了一种由瞬时安全代价驱动的自适应教师干预框架,通过自适应阈值逐步减少教师参与,并对由此产生的混合行为策略进行了理论分析。此外,由此产生的学生生成样本和教师引导样本在干预率依赖的混合策略下被联合用于双源训练。

### II-C 异构训练数据下的策略优化
强化学习通常基于智能体自身的在线交互进行训练,这往往面临探索效率低下和策略改进不稳定的问题。为解决这个问题,早期研究利用外部经验(如示范或成功轨迹)来增强训练。部分研究利用来自相关任务或多个任务的示范来提高学习效率[10 (https://arxiv.org/html/2606.26527#bib.bib61),7 (https://arxiv.org/html/2606.26527#bib.bib62)]。

相似文章

面向公平强化学习的推理时策略对齐

arXiv cs.LG

本文提出了一种推理时策略塑形框架,受大语言模型推理时对齐的启发,无需重新训练即可将预训练的强化学习策略引导至基于福利的公平目标。

通过自适应安全约束实现非平稳环境下的安全持续强化学习

arXiv cs.LG

提出LILAC+框架,用于非平稳环境下的安全持续强化学习,该框架采用三种自适应安全机制:基于上下文的安全约束、适应速度约束和预算到状态的安全执行。在模拟驾驶环境中的评估表明,在分布偏移下,该框架减少了安全违规,同时保持了竞争性的性能。

面向人类反馈强化学习的元学习奖励塑造

arXiv cs.LG

MeRLa 是一个用于 RLHF 的元学习奖励塑造框架,通过学习任务特定的塑造函数来改善对齐,在多个基准上取得了最先进的结果,并显著降低了训练不稳定性。