混合交通中基于强化学习的联网自动驾驶车辆车队汇入机动控制
摘要
本研究论文提出了一种使用深度强化学习的模拟框架,用于控制混合交通中联网自动驾驶车辆的车队汇入,表明PPO实现了高成功率,同时强调了安全与效率之间的权衡。
arXiv:2608.26860v1 公告类型:新
摘要:联网自动驾驶车辆(CAV)车队编队为提高道路安全性和交通容量提供了一种有前景的方法。然而,由于不确定性和异质驾驶行为,实际交通中的车队控制具有挑战性。强化学习(RL)在解决此类控制问题方面具有强大潜力,但其实际部署在安全性和学习效率方面提出了挑战。本文提出了一个通用的建模和模拟框架,用于研究CAV车队汇入机动并比较基于深度强化学习(DRL)的控制算法。该问题在混合交通环境中尤为具有挑战性,其中CAV与表现出异质纵向和横向行为的人类驾驶车辆共存。目标是通过将危险行为的惩罚纳入学习过程或使用外部安全控制器来约束学习策略,实现安全高效的汇入机动。本文使用基于代理的建模框架与城市移动性模拟(SUMO)模拟器相结合,评估深度Q网络(DQN)、双重深度Q网络(DDQN)和近端策略优化(PPO)。结果显示,PPO优于DQN和DDQN,汇入成功率约为98%,碰撞率低于1%,这主要归功于奖励函数中纳入的风险相关惩罚。然而,这种改进的性能需要更多的决策步骤来完成机动,揭示了安全、汇入有效性和决策效率之间的权衡。外部安全控制器有效防止碰撞,尽管其干预可能会降低汇入效率。结果突出了在设计混合交通中CAV车队汇入的RL控制器时,综合考虑安全和效率的重要性。
查看缓存全文
缓存时间: 2026/08/28 09:44
# 基于强化学习的联网自动驾驶车辆在混合交通中的车队汇入机动控制 来源:https://arxiv.org/html/2608.26860 标银 Email:[biao\.yin@univ\-eiffel\.fr](mailto:[email protected])通讯作者:通讯作者。地址:法国吉夫\-叙尔\-耶维特91190,居斯塔夫·埃菲尔大学,SATIE。纳迪尔·法赫里地址:法国马恩-拉-瓦莱77454,居斯塔夫·埃菲尔大学,Cosys\-Grettia。 ###### 摘要 联网自动驾驶车辆车队化为提高道路安全和通行能力提供了一种有前景的方法。然而,由于不确定性和驾驶行为的异质性,实际交通中的车队控制极具挑战性。强化学习在解决此类控制问题方面具有强大潜力,但其实际部署引发了安全性和学习效率方面的挑战。本文提出一个通用的建模与仿真框架,用于研究联网自动驾驶车辆车队汇入机动并比较基于深度强化学习的控制算法。该问题在混合交通环境中尤为困难,联网自动驾驶车辆与表现出异质纵向和横向行为的有人驾驶车辆共存。目标是通过对学习过程注入对风险行为的惩罚或使用外部安全控制器约束学习策略,实现安全高效的汇入机动。基于代理的建模框架结合城市交通微观仿真模拟器,用于评估深度Q网络、双重深度Q网络和近端策略优化算法。结果表明,近端策略优化算法优于深度Q网络和双重深度Q网络,实现了约98%的汇入成功率且碰撞率低于1%,这主要归功于奖励函数中加入的风险相关惩罚。然而,这种性能提升需要更多的决策步骤来完成机动,揭示了安全性、汇入有效性和决策效率之间的权衡。外部安全控制器能有效防止碰撞,尽管其干预可能会降低汇入效率。研究结果强调了在为混合交通中的联网自动驾驶车队汇入设计强化学习控制器时,综合考虑安全性和效率的重要性。源代码可在以下地址获取:https://github.com/biaoyin/platoon-drl/tree/platoon_join ###### 关键词: 车辆车队化,深度强化学习,联网自动驾驶车辆,混合交通,车队汇入,碰撞避免。 ## 1 引言 联网自动驾驶车辆能够实现车车通信和车路通信,以实现协同控制并减轻不良的人为驾驶行为(例如攻击性和走走停停的不稳定性)\[1 (https://arxiv.org/html/2608.26860#bib.bib1)\]\[2 (https://arxiv.org/html/2608.26860#bib.bib2)\]。联网自动驾驶车辆的优势延伸至交通流,带来安全性和效率的提升,并有助于环境可持续性。大量研究聚焦于车队内联网自动驾驶车辆的纵向速度协调控制,即一组联网自动驾驶车辆以一致的速度行驶,同时保持相邻车辆之间小而近乎恒定的距离,例如协同自适应巡航控制。研究表明,联网自动驾驶车队在提升道路容量、交通稳定性和能源效率方面具有巨大潜力。 车队优化通常涉及车队生命周期中的几个关键操作阶段。这些阶段规划了车辆如何组成车队、在车队内运行以及离开车队。每个阶段都需要复杂的机制以确保安全性和效率。尽管跟车动力学(如协同自适应巡航控制)已被广泛研究,但初始的车队汇入阶段至关重要,它使联网自动驾驶车辆能够在指定位置融入车队。这需要精确的速度控制和时机恰当的换道机动。关键挑战在于管理纵向和横向控制,以避免交通干扰,如拥堵或碰撞。在联网自动驾驶车辆与有人驾驶车辆共存的近期混合交通中,这一挑战更为严峻。 在以往的工作中,车队汇入的传统方法主要基于规则、优化模型或概念化技术(如虚拟车队)进行探索。基于规则的方法能够以较低的计算复杂度实现协调汇入行为,但其性能在高动态环境中可能受限。基于优化的方法(如模型预测控制)可以通过将问题表述为约束优化问题来提高灵活性和性能,但同时需要更高的计算成本和更精确的建模。虚拟车队通过在物理汇入之前将车辆组织成逻辑车队,引入了更高层次的协同。这使得能够提前同步速度、精确调整位置,并主动为目标车队创造间隙。该技术主要用于匝道汇入场景,其中汇入车辆提前被虚拟地整合到主路车队中,如文献中所述。 近年来,强化学习算法越来越多地用于解决车队汇入任务的复杂性。早期的基础工作主要关注单智能体环境。在基于值的强化学习领域,文献引入了一种深度Q网络解决方案,用于离散单元格道路环境内的车队汇入。结果表明,所提出的深度Q网络方法比基于规则的方法需要更少的汇入行驶时间和更少的车辆换道次数。与此同时,文献中探索了基于策略的强化学习方法,该方法将近端策略优化应用于自动换道机动,并在密集交通中实现了95%的成功率。为了应对车队协调固有的多智能体特性,后续研究扩展了强化学习框架以处理智能体间的竞争与合作。一系列多智能体强化学习算法已被应用于联网自动驾驶车队编队形成。然而,迈向实际部署的关键一步在于应对混合交通环境,即联网自动驾驶车辆和有人驾驶车辆共存。在此背景下,文献提出了一个两阶段框架:第一阶段枚举给定特定车辆序列下的所有可行编队;第二阶段采用多智能体策略,根据编队计划引导每辆车(包括自动和有人驾驶车辆)进入其指定位置。为了进一步加速收敛,也研究了混合方法,例如将遗传算法与深度强化学习结合用于智能车队化。除了编队规划和收敛速度之外,汇入机动过程中的碰撞仍然是一个持续存在的根本挑战。文献揭示了两种主要的安全策略。第一种是附加一个独立的安全控制器——一个外部的、基于规则的模块——以覆盖潜在危险的决策并确保无碰撞执行。第二种是在奖励函数中加入内部的汇入风险惩罚,从而在训练过程中内在地抑制不安全行为。最近的一项研究将控制屏障函数集成到强化学习框架中,以保证包含联网自动驾驶车辆和有人驾驶车辆的混合车队编队过程的安全汇入,在纵向和横向控制方面展示了有前景的结果。 尽管取得了这些进展,现有研究表明大多数框架和仿真依赖于过度简化或抽象化的环境,未能捕捉真实的微观交通动力学。从混合交通车道过渡到专用联网自动驾驶车道——一个高度实际的场景——尚未得到系统的充分研究,而这被认为对混合交通的流量组织是高效的。最关键的是,虽然安全模块(外部防护)和基于惩罚的奖励(内部成本)已分别被探索,但缺乏在多样动态交通条件下评估它们各自作用、权衡和组合效果的综合对比分析。为弥补这些空白,本文提出一个通用的基于强化学习的建模框架,该框架构建在交通微观仿真模拟器环境中,系统地研究联网自动驾驶车队汇入机动。 因此,我们的主要贡献有三方面:1)开发一个系统框架,使联网自动驾驶车辆能够从混合交通车道汇入高速公路的专用联网自动驾驶车道车队;2)实现并比较三种不同类型的深度强化学习算法以学习最优汇入策略;3)在多样交通条件下进行全面的性能分析,特别强调评估训练过程中风险惩罚与用于碰撞避免的独立安全防护的作用,从而为设计稳健可靠的车队汇入控制器提供关键见解。 论文其余部分组织如下。第2节介绍强化学习基础和典型的深度强化学习算法。第3节详细阐述方法论,包括仿真系统架构、车队任务建模和算法实现。随后,我们展示仿真实验和结果分析。最后一节给出结论。 ## 2 背景知识 ### 2\.1 强化学习基础 强化学习旨在使智能体通过与环境交互来学习。智能体通过采取动作并从环境接收反馈来学习如何决策。具体而言,决策过程被建模为马尔可夫决策过程,由元组定义,其中和分别表示状态和动作空间,\(P(s'|s,a)\)表示状态转移概率,\(r(s,a,s')\)是奖励函数,\(\gamma \in (0,1]\)是未来奖励的折扣因子。在每个时间步\(t\),智能体根据环境的当前状态\(s_t\)选择动作\(a_t\)。然后环境通过转换到新状态\(s_{t+1} \sim P(\cdot|s_t, a_t)\)并返回奖励\(r_{t+1} = r(s_t, a_t, s_{t+1})\)做出响应。强化学习的目标是学习一个策略\(\pi: \mathcal{S} \to \mathcal{A}\),形式为条件概率\(\pi(a_t|s_t)\),以最大化无限时间或有限时间范围\(T\)内的期望累积折扣奖励,定义为\(J(\pi) = \mathbb{E}_\pi\left[\sum_{t=0}^{T-1} \gamma^t r_{t+1}\right]\)。Q学习是一种基于贝尔曼方程的经典强化学习方法,它通过迭代更新\(Q(s,a)\)的估计值来最大化目标\(J(\pi)\)。 ### 2\.2 DQN 和 DDQN 当使用深度神经网络近似值函数(例如Q函数)或策略时,该方法被称为深度强化学习。作为深度强化学习算法之一,DQN在动作选择和评估中使用相同的Q值最大化,尽管在线网络和目标网络是分开维护的。目标值函数由下式给出: \(y^{\text{DQN}} = r + \gamma \max_{a'} Q(s', a'; \theta^-)\) (1) 其中\(\theta^-\)是目标网络的权重。目标是找到Q网络中的\(\theta\),以估计最佳Q函数,即\(Q(s,a; \theta) \approx Q^*(s,a)\),通过最小化以下损失函数: \(\mathcal{L}(\theta) = \mathbb{E}\left[\left(y^{\text{DQN}} - Q(s,a; \theta)\right)^2\right]\) (2) 其中\(\theta\)可以通过梯度下降进行优化,\(\theta^-\)定期从\(\theta\)克隆(例如,采用软更新策略)以保持稳定性。 由于估计的\(Q(s,a; \theta)\)存在噪声,最大算子可能导致系统性的过估计偏差。因此,DDQN被提出使用两个不同的网络(具有相同架构),其中在线网络选择最佳动作,而目标网络评估其价值,如式(3)所示: \(y^{\text{DDQN}} = r + \gamma Q(s', \arg\max_{a'} Q(s', a'; \theta); \theta^-)\) (3) 其中argmax使用在线权重\(\theta\),而Q值使用目标权重\(\theta^-\)。式(2)中的损失函数随后使用\(y^{\text{DDQN}}\)代替\(y^{\text{DQN}}\)。 通常,采用\(\epsilon\)-贪婪策略进行动作选择。以概率\(1-\epsilon\)选择最佳动作,以概率\(\epsilon\)随机选择动作。具体而言,我们采用由指数衰减函数确定的、与时间相关的\(\epsilon(t)\),如式(4)所示: \(\epsilon(t) = \exp\left(\log(\epsilon_{\text{start}}) + \frac{t}{\epsilon_{\text{decay}}}\big(\log(\epsilon_{\min}) - \log(\epsilon_{\text{start}})\big)\right)\) (4) 在经过大量仿真步长\(\epsilon_{\text{decay}}\)后,满足\(\epsilon(t) = \epsilon_{\min}\),这意味着在最终收敛时主要选择最佳动作。 对于这两种算法,都使用经验回放缓冲区,从中随机采样一批存储的经验四元组(状态、动作、奖励、新状态)用于更新\(\theta\)。 ### 2\.3 PPO PPO不使用Q目标网络。它使用式(5)中的优势函数(通常通过GAE - 广义优势估计计算)来更新其策略,告诉智能体某个动作比平均好多少: \(\hat{A}_t = \delta_t + (\gamma\lambda)\delta_{t+1} + ... + (\gamma\lambda)^{T-t+1}\delta_{T-1}\) (5) 其中\(\delta_t = r_t + \gamma V(s_{t+1}) - V(s_t)\)。
相似文章
面向行人行为不确定性的安全自动驾驶的多智能体强化学习
本文提出了一种多智能体强化学习框架,该框架同时训练自动驾驶车辆和具有个性驱动乱穿马路行为的行人,与单智能体方法相比,碰撞率降低了30%,并展示了更真实的交互场景。
结构化强化学习在贝叶斯劝导中的应用:面向智能交互驾驶
本文针对交互驾驶中的贝叶斯劝导问题,提出了一种结构化强化学习框架。在该框架中,领航车辆通过选择性披露交通信息来引导网联车辆。该方法引入了MAPL和SQP算法,相比现有方法实现了30%的成本效率提升。
基于深度强化学习的车辆路径问题:工业卡车规划案例研究
本文提出了一种基于深度强化学习的车辆路径问题求解方法,并通过三个工业卡车规划案例进行了演示。与基线结果相比,该方法实现了超过10%的成本降低,并讨论了对更多VRP变体的泛化。
用于自适应交通信号控制的可解释强化学习
本文提出了一种可解释的以实体为中心的强化学习框架,用于自适应交通信号控制,该框架采用具有多头交叉注意力和自注意力的双阶段注意力网络,以提供可解释的亲和矩阵,同时将确定性动作掩码集成到PPO中以确保安全合规性。
基于分层冲突感知观测的滑行路径规划值分解强化学习框架
本文介绍了 CaTR,这是一个用于实时多机滑行道路径规划的值分解强化学习框架,它利用分层前瞻性交通表示来平衡安全性与效率。