用于深度强化学习与模型预测控制之间共享控制权限的Composite-Gradient Learning
摘要
本文提出了一种复合梯度学习方法,该方法整合了深度强化学习和模型预测控制,用于自主系统中的共享控制权限,并在交通网络上进行评估,显示在强交互下有适度效益。
arXiv:2609.17697v1 Announce Type: new
摘要:集成深度强化学习(DRL)和模型预测控制(MPC)方法通过结合其互补能力,越来越多地用于控制自主系统。DRL通过与环境交互学习控制策略。MPC使用系统模型优化控制输入,同时考虑约束。在具有共享控制权限的DRL-MPC框架中,DRL智能体和MPC控制器各自确定部分控制输入。然而,常见的学习公式将MPC视为环境的一部分,因此没有明确考虑MPC对控制的贡献或其与DRL智能体的交互。本文提出了一种新颖的复合梯度学习(CGL)方法,通过将DRL和MPC控制输入表示为联合动作,并在训练期间更新DRL智能体时考虑它们的交互,将MPC控制器整合到学习过程中。CGL在两个具有不同交互强度的多类别高速公路交通网络上进行了评估,并与将MPC视为环境一部分或仅部分将MPC纳入学习的替代方法进行了比较。结果显示,CGL在弱交互下效益有限,但在强交互下的一部分训练运行中学习到的控制策略性能高于替代方法,尽管平均控制性能增益仍然适度。
查看缓存全文
缓存时间: 2026/09/17 08:50
# 基于复合梯度学习的深度强化学习与模型预测控制共享控制权
来源:https://arxiv.org/html/2609.17697
Azita Dabiri,Bart De Schutter††注:本研究得到了欧盟“地平线2020”研究与创新计划下的欧洲研究委员会资助(资助协议号101018826 - ERC高级资助项目CLariNet)。††注:作者隶属于荷兰代尔夫特理工大学系统与控制中心(Delft Center for Systems and Control),荷兰代尔夫特 \{g.oenuer, a.dabiri, b.deschutter\}@tudelft.nl。
###### 摘要
集成深度强化学习(DRL)与模型预测控制(MPC)的方法正越来越多地用于控制自主系统,其结合了二者的互补能力。DRL通过与环境交互学习控制策略。MPC则利用系统模型优化控制输入,同时考虑约束条件。在共享控制权的DRL-MPC框架中,DRL智能体和MPC控制器各自确定部分控制输入。然而,常见的学习方法将MPC视为环境的一部分,因此未明确考虑MPC对控制的贡献及其与DRL智能体的交互作用。本文提出了一种新颖的**复合梯度学习(CGL)方法**,通过将DRL和MPC控制输入表示为一个联合动作,并在训练期间更新DRL智能体时考虑它们的交互作用,从而将MPC控制器集成到学习过程中。CGL在两个DRL与MPC控制输入交互强度不同的多类别高速公路交通网络上进行了评估,并与将MPC视为环境一部分或仅部分将MPC纳入学习的替代方法进行了比较。结果表明,在弱交互下CGL收益有限,但在强交互下的部分训练轮次中,CGL能学习到性能优于替代方法的控制策略,尽管平均控制性能提升幅度仍然适中。
## I 引言
模型预测控制(MPC)和深度强化学习(DRL)已成为控制复杂系统的主流方法,应用范围从工业过程控制到机器人学[1 (https://arxiv.org/html/2609.17697#bib.bib9), 2 (https://arxiv.org/html/2609.17697#bib.bib4)]。尽管这两种方法都处理序列决策问题,但它们采用不同的方法。MPC[1 (https://arxiv.org/html/2609.17697#bib.bib9)]使用显式预测模型来预测有限时域内的系统演变,优化一系列控制输入并明确考虑系统约束,仅应用优化序列中的第一个控制输入,并以滚动时域方式重复此过程。另一方面,DRL[2 (https://arxiv.org/html/2609.17697#bib.bib4)]通过与环境交互直接学习控制策略,无需显式系统模型,允许在模型知识有限或系统动态不确定时获得控制策略。DRL还使得训练后能快速计算控制输入,因为训练后的策略网络通过单次前向传递直接将当前观测映射到动作,无需在线优化。
DRL和MPC的互补特性激发了混合框架的发展,将MPC内置的优化和约束处理能力与DRL的快速在线计算和模型无关性相结合[3 (https://arxiv.org/html/2609.17697#bib.bib11)]。分层DRL-MPC框架通过为两种方法分配不同的任务和时间尺度来利用这种组合。此类框架改进了交通管理[4 (https://arxiv.org/html/2609.17697#bib.bib7)]和微电网能量管理[5 (https://arxiv.org/html/2609.17697#bib.bib12)]等自动化应用中的控制性能。然而,尽管整体有所进展,集成DRL和MPC仍是一个发展中的领域,实际应用有限。
本文考虑一种分层DRL-MPC框架[6 (https://arxiv.org/html/2609.17697#bib.bib8)],其中控制权和控制输入在DRL和MPC之间划分,允许MPC以较低频率运行,用于那些较慢更新率能适应MPC高计算时间的控制措施,而DRL则通过利用其短部署时间来控制高频控制措施。例如,高频和低频控制输入分别对应高速公路网络中的匝道调节率和车辆分流率[7 (https://arxiv.org/html/2609.17697#bib.bib10)]、机器人运动控制中的执行器指令和参考轨迹[8 (https://arxiv.org/html/2609.17697#bib.bib1)],以及功率电子变换器控制中的半导体开关指令和电机电流参考值[9 (https://arxiv.org/html/2609.17697#bib.bib2)]。因此,该分层DRL-MPC框架在保持上层MPC优化和约束处理能力的同时,减少了相对于纯MPC控制的在线计算量。
在此分层DRL-MPC框架[6 (https://arxiv.org/html/2609.17697#bib.bib8)]中,训练DRL智能体时,MPC控制器被视为环境的一部分,因为在此类框架中将MPC控制器视为环境的一部分是常见做法[3 (https://arxiv.org/html/2609.17697#bib.bib11)]。然而,当控制权和控制输入在MPC和DRL之间划分时,由于MPC控制器需要未来的DRL动作来预测其优化时域内的系统演变,DRL智能体会影响MPC控制输入的计算。当MPC被视为环境的一部分时,这种依赖关系未被明确纳入控制性能的评估学习或DRL智能体的更新中,从而使学习公式不完整。这可能会限制MPC控制器和DRL智能体的控制输入强耦合时的性能。
例如,在高速公路交通控制问题中,这种耦合可能出现:上层MPC控制器使用路线引导来调节指向受控匝道的交通流,而下层DRL智能体使用匝道调节来控制车辆从该匝道进入高速公路主线。高层的MPC控制输入决定了到达受控匝道的交通需求,从而决定了下层DRL智能体面临的工作条件。相反,在MPC时域内预测的DRL动作通过塑造预测的交通演变,影响了MPC控制器的路线引导控制输入。这些交互作用共同在MPC控制器和DRL智能体之间形成了双向耦合。
为了将这种耦合纳入学习过程,我们将分层控制问题表述为一个马尔可夫决策过程(MDP),其中DRL动作和MPC控制输入构成一个联合动作空间。基于此表述,我们提出了一种新颖的复合梯度学习方法,该方法捕捉了DRL动作的直接效应及其通过MPC控制输入的间接效应,从而解决了将MPC视为环境一部分的不完整学习公式问题[3 (https://arxiv.org/html/2609.17697#bib.bib11)]。
本文的主要贡献如下:
- • 我们将具有共享控制权的分层DRL-MPC控制框架表述为一个MDP,其中下层DRL动作和上层MPC控制输入形成一个联合动作,以捕捉两个控制层级之间的交互作用。
- • 我们提出了一种新颖的复合梯度学习方法,其中控制性能的学习评估考虑了联合动作,并且DRL智能体的更新同时捕捉了DRL动作的直接效应及其通过MPC控制输入的间接效应。
- • 我们开发了一种层级感知的数据存储和采样方案,通过复用在两个连续MPC控制输入更新之间收集的数据中的MPC计算,降低了学习过程的计算成本。
本文的结构安排如下:第二节 (https://arxiv.org/html/2609.17697#S2) 描述了具有共享控制权的分层DRL-MPC框架。第三节 (https://arxiv.org/html/2609.17697#S3) 介绍了所提出的复合梯度学习方法。第四节 (https://arxiv.org/html/2609.17697#S4) 介绍了多类别高速公路交通案例研究,并评估了在不同DRL-MPC控制输入耦合条件下该方法的性能。最后,第五节 (https://arxiv.org/html/2609.17697#S5) 总结了本文并概述了未来的研究方向。
## II 具有共享控制权的分层DRL-MPC框架
图1:(a) 示意图展示了所提出的DRL-MPC框架,该框架在DRL智能体和MPC控制器之间划分控制输入。(b) 高层MPC控制器的低频控制输入和下层DRL智能体的高频控制输入的时间尺度。分层DRL-MPC框架在DRL和MPC之间划分控制权和控制输入[6 (https://arxiv.org/html/2609.17697#bib.bib8)],其中MPC控制器使用一个训练好的DRL智能体副本(其策略在部署期间保持固定)来获取MPC预测受控系统未来状态所需的高频控制输入(见图1 (https://arxiv.org/html/2609.17697#S2.F1)(a))。这使得MPC控制器能够在其预测窗口内预测受控系统的未来状态,即使下层的控制输入不是由MPC控制器决定,而是由DRL智能体决定。通过这种耦合,DRL智能体通过影响MPC优化中使用的状态预测来影响MPC解。
设 \(\boldsymbol{x}(k) \in \mathcal{X}\) 表示受控系统在采样步 \(k\) 的状态,其中 \(\mathcal{X}\) 是系统的状态空间,\(T\) 是采样时间间隔长度。高层和低层控制输入根据离散时间动力学模型共同决定受控系统的演变:
\(\boldsymbol{x}(k+1) = f\big(\boldsymbol{x}(k), \boldsymbol{\bar{u}}_{\mathrm{h}}(k), \boldsymbol{\bar{u}}_{\mathrm{l}}(k), \boldsymbol{d}(k)\big),\) (1)
其中 \(f\) 表示系统动力学,\(\boldsymbol{\bar{u}}_{\mathrm{h}}(k)\) 和 \(\boldsymbol{\bar{u}}_{\mathrm{l}}(k)\) 分别表示在采样步 \(k\) 应用于受控系统的高层和低层控制输入,\(\boldsymbol{d}(k)\) 表示外部干扰。
设 \(k_{\mathrm{l}}\) 表示下层DRL智能体的控制步计数器,其控制更新间隔长度为 \(T_{\mathrm{l}}\)(见图1 (https://arxiv.org/html/2609.17697#S2.F1)(b))。低层控制间隔与采样时间间隔的关系为 \(T_{\mathrm{l}} = m_{\mathrm{l}}T\),\(k = m_{\mathrm{l}}k_{\mathrm{l}}\),\(m_{\mathrm{l}} \in \mathbb{N}^{+}\),\(m_{\mathrm{l}} \ge 1\),其中 \(m_{\mathrm{l}}\) 是一个低层控制间隔内的采样间隔数,\(k = m_{\mathrm{l}}k_{\mathrm{l}}\) 确定对应于低层更新步 \(k_{\mathrm{l}}\) 的采样步,\(\mathbb{N}^{+}\) 表示正整数集。在每个低层控制步,DRL智能体接收观测 \(\boldsymbol{x}_{\mathrm{rl}}(k_{\mathrm{l}}) \in \mathcal{X}_{\mathrm{rl}}\)。设 \(\boldsymbol{\eta}_{\mathrm{rl}}(k_{\mathrm{l}})\) 表示智能体可用的辅助信息,这些信息不一定包含在当前受控系统状态中,例如外部测量值或先前的状态和控制输入。DRL观测可能将系统状态的选定或转换组件与这些辅助信息组合,由观测映射 \(H_{\mathrm{rl}}\) 定义为:
\(\boldsymbol{x}_{\mathrm{rl}}(k_{\mathrm{l}}) = H_{\mathrm{rl}}\big(\boldsymbol{x}(m_{\mathrm{l}}k_{\mathrm{l}}), \boldsymbol{\eta}_{\mathrm{rl}}(k_{\mathrm{l}})\big).\) (2)
DRL智能体每隔 \(T_{\mathrm{l}}\) 时间单位计算高频控制输入为 \(\boldsymbol{u}_{\mathrm{l}}(k_{\mathrm{l}}) = \pi_{\theta}\big(\boldsymbol{x}_{\mathrm{rl}}(k_{\mathrm{l}})\big)\),\(\boldsymbol{u}_{\mathrm{l}}(k_{\mathrm{l}}) \in \mathcal{U}_{\mathrm{l}}\),其中 \(\pi_{\theta}\) 是具有参数 \(\theta\) 的确定性DRL策略,\(\mathcal{U}_{\mathrm{l}}\) 是允许的低层控制输入集。然后,在控制间隔 \([k_{\mathrm{l}}T_{\mathrm{l}}, (k_{\mathrm{l}}+1)T_{\mathrm{l}})\) 内应用于受控系统的低层控制输入计算为 \(\boldsymbol{\bar{u}}_{\mathrm{l}}(m_{\mathrm{l}}k_{\mathrm{l}} + s) = \boldsymbol{u}_{\mathrm{l}}(k_{\mathrm{l}})\),\(s \in \mathbb{I}_{m_{\mathrm{l}}}\),其中 \(\mathbb{I}_{m} = \{0, 1, \dots, m-1\}\),\(m \in \mathbb{N}^{+}\)。因此,控制输入 \(\boldsymbol{u}_{\mathrm{l}}(k_{\mathrm{l}})\) 使用零阶保持(ZOH)策略在 \(T_{\mathrm{l}}\) 时间单位的时间间隔内应用。
设 \(\boldsymbol{u}_{\mathrm{h}}(k_{\mathrm{h}})\) 表示在高层控制步 \(k_{\mathrm{h}}\) 应用的高层控制输入(见图[1 (https://arxiv.org/html/2609.17697#S2.F1)(b)]),并设 \(\boldsymbol{u}_{\mathrm{h},j \mid k_{\mathrm{h}}}\) 表示在高层控制步 \(k_{\mathrm{h}}\) 计算的高层控制步 \(k_{\mathrm{h}}+j\) 处的高层控制输入,其中 \(j \in \mathbb{I}_{N_{\mathrm{p}}}\)。MPC控制器计算控制序列:
\(\boldsymbol{\tilde{u}}_{\mathrm{h}}(k_{\mathrm{h}}) = \left[ \boldsymbol{u}_{\mathrm{h},0 \mid k_{\mathrm{h}}}^\top, \boldsymbol{u}_{\mathrm{h},1 \mid k_{\mathrm{h}}}^\top, \dots, \boldsymbol{u}_{\mathrm{h},N_{\mathrm{p}}-1 \mid k_{\mathrm{h}}}^\top \right]^\top\),
该序列在预测时域 \(N_{\mathrm{p}}\) 个高层时间步上,每步持续时间为 \(T_{\mathrm{h}}\) 时间单位,其中 \(T_{\mathrm{h}} = m_{\mathrm{h}}T\),\(k = m_{\mathrm{h}}k_{\mathrm{h}}\),\(m_{\mathrm{h}} = q m_{\mathrm{l}}\),\(q \in \mathbb{N}^{+}\)。这里 \(q\) 是一个高层控制间隔内的低层控制间隔数,使高层和低层控制输入更新对齐(见图1 (https://arxiv.org/html/2609.17697#S2.F1)(b))。在高层和低层更新时间点重合时,它们的步计数器因此满足 \(k_{\mathrm{l}} = q k_{\mathrm{h}}\)。
在高层控制时间步 \(k_{\mathrm{h}}\),设 \(\boldsymbol{\hat{x}}_{\ell \mid k_{\mathrm{h}}} = \boldsymbol{\hat{x}}(m_{\mathrm{h}}k_{\mathrm{h}} + \ell)\) ...相似文章
混合交通中基于强化学习的联网自动驾驶车辆车队汇入机动控制
本研究论文提出了一种使用深度强化学习的模拟框架,用于控制混合交通中联网自动驾驶车辆的车队汇入,表明PPO实现了高成功率,同时强调了安全与效率之间的权衡。
基于约束流形控制的安全且可泛化的分层多智能体强化学习
本文提出了一种分层多智能体强化学习框架,该框架通过低层的约束流形强制执行硬安全约束,同时通过高层策略学习实现有效协调,提供了理论上的安全保障,并实现了近乎完美的安全率和良好的泛化能力。
基于多AUV自组网的目标跟踪:一种价值梯度引导的多智能体扩散强化学习方法
本文提出了VGG-MADiffRL——一种价值梯度引导的多智能体扩散强化学习算法,以及MDCA——一种分层控制架构,用于在受限声学通信和动态水下扰动下多AUV自组网中的协同目标跟踪。
可扩展的约束多智能体强化学习:通过状态增强与一致性实现可分离动力学
本文提出了一种分布式方法,用于约束多智能体强化学习,该方法采用状态增强策略学习和对偶变量上的邻居间一致性,以在满足全局资源约束的同时实现智能体数量线性扩展。在智能电网需求响应上的实验表明,一致性协调对可行性至关重要:与集中式训练方法不同,它能够扩展到数千个智能体。
DRG-MAPPO:用于协同空战的分层动态角色图多智能体强化学习
一种结合图注意力机制和动态角色分配的分层多智能体强化学习框架,提高了空战中的战术协调和胜率。