结构化强化学习在贝叶斯劝导中的应用:面向智能交互驾驶
摘要
本文针对交互驾驶中的贝叶斯劝导问题,提出了一种结构化强化学习框架。在该框架中,领航车辆通过选择性披露交通信息来引导网联车辆。该方法引入了MAPL和SQP算法,相比现有方法实现了30%的成本效率提升。
arXiv:2607.13576v1 公告类型:新
摘要:交互驾驶是一种有前景的动态交通管理方法,其中配备实时交通数据的智能领航车辆协调网联车辆的路线选择。为应对决策协调的挑战,本文考虑了贝叶斯劝导的战略信息披露框架。在此框架中,委托人(领航车辆)旨在通过选择性披露信息(如前方的实时交通状况)并利用信号,引导代理人(网联车辆)的部分可观测序贯决策朝向自身目标。然而,代理人为最大化长期收益而做出的远视反应,使得委托人的信号策略设计在计算上具有挑战性。我们提出了一种在线结构化强化学习框架,用于合成计算高效且对有远见的代理人具有说服力的信号策略。本文的主要贡献如下:(i) 针对具有近似最佳响应的单调代理人,我们提出了MAPL,一种用于加速在线学习的结构化策略学习算法;(ii) 识别出单调代理人条件下委托人Q函数超模结构的充分条件;(iii) 识别出确保委托人信号策略说服力的充分条件;(iv) 面向委托人的超模Q学习(SQP),利用委托人动作价值的超模结构合成计算高效且对单调学习代理人具有说服力的信号策略;(v) 针对车道选择的贝叶斯劝导驾驶实时应用的数值分析表明,与现有的信号策略设计方法相比,所提方法在优化领航车辆和网联车辆的行驶奖励方面实现了30%的成本效率提升。
查看缓存全文
缓存时间: 2026/07/16 04:22
# 面向贝叶斯劝说的结构化强化学习:在智能交互式驾驶中的应用 来源:https://arxiv.org/html/2607.13576 ###### 摘要 交互式驾驶,即配备实时交通数据的智能头车协调联网车辆的路径选择,为动态交通管理提供了一种有前景的方法。为了解决决策协调的挑战——头车优先考虑全局交通流,而联网车辆寻求最短路径——本文考虑了贝叶斯劝说的战略性信息揭示框架。在此框架中,委托人(头车)旨在通过选择性揭示信息(例如前方实时交通状况)利用信号,引导代理人(联网车辆)的部分可观测序列决策符合其自身目标。然而,代理人为了最大化其长期奖励而做出的远视反应(考虑了未来状态转移和信号披露)使得委托人的信号策略设计在计算上极具挑战性。此外,在现实环境中,委托人和代理人可能都不完全了解各自的奖励和转移动态。我们提出了一种在线结构化强化学习框架,以合成计算高效的信号策略,该策略对远视代理人具有*有效劝导性*。在此背景下,本文的主要贡献如下: \(i\) 针对具有近似最优响应的单调代理人,我们提出了 MAPL,一种结构化策略学习算法,该算法利用代理人策略的单调性结构,在大状态空间中进行更快的在线学习; \(ii\) 确定了在贝叶斯劝说模型上使委托人 Q(动作价值)函数具有超模结构的充分条件(针对单调代理人); \(iii\) 确定确保委托人信号策略对单调代理人具有有效劝导性的充分条件; \(iv\) 提出了面向委托人的超模 Q 学习 (SQP),该方法利用委托人动作价值的超模结构,合成针对单调学习代理人的计算高效且具有有效劝导性的信号策略; \(v\) 针对车道选择这一贝叶斯劝说式驾驶的实时应用进行的数值分析表明,与现有的信号策略设计方法相比,所提方法在优化头车和联网车辆的行驶奖励方面成本效率提高了 30%。此外,在贝叶斯劝说下对联网车辆车道选择的在线结构化学习,其性能优于现有的车道选择方法。 ## I. 引言 智能交通路由,将实时数据整合到车辆路线推荐中,已成为增强应对动态交通挑战适应性和响应性的有前景方法。采用智能领头架构的联网车辆为交通优化提供了一种前沿解决方案——参见图 4 (https://arxiv.org/html/2607.13576#S6.F4) 的示例。在此架构中,配备实时交通数据的头车可以通过速度调节、路线引导和队列编组来协调联网车辆,实现高效的交通管理[50 (https://arxiv.org/html/2607.13576#bib.bib217)]。这促进了智能交通网络的形成,其中头车和联网车辆通过实时交互和学习持续协作。 传统的交互式驾驶方法面临着协调决策的关键挑战:——联网车辆寻求最短路径,而头车优先考虑全局交通流和避免拥堵,这需要在实时路由中进行协调。为应对这一挑战,本文采用贝叶斯劝说的选择性信息披露框架,在为个体车辆提供路线引导的同时确保交通流效率。 贝叶斯劝说是一种战略性框架,委托人通过信号选择性揭示信息来影响代理人的行动。该框架已应用于多个涉及信息不对称的领域,包括交通路由[13 (https://arxiv.org/html/2607.13576#bib.bib1)]、推荐系统[29 (https://arxiv.org/html/2607.13576#bib.bib48)]、教育评分系统[6 (https://arxiv.org/html/2607.13576#bib.bib33)]、排队系统[24 (https://arxiv.org/html/2607.13576#bib.bib49)]等。在智能交互式驾驶的序列决策贝叶斯劝说框架中(如图 1 所示),委托人和代理人都观察环境状态,而一个额外的隐藏外部状态只有委托人知晓。在劝说式驾驶的背景下,这个隐藏状态可能代表前方的实时交通状况。委托人通过信号——关于前方交通或可能路线选择的警报——有策略地揭示隐藏状态的信息,以影响代理人的行动。信号策略是一个从隐藏外部状态和代理人状态到信号分布的概率映射。一个简单的例子是直接揭示策略;然而,直接揭示实时交通信息可能会导致许多车辆选择相同路线,最终造成拥堵[8]。这突显了需要精心设计的信号策略来引导路由决策,同时保持高效的交通流。因此,委托人通过有选择地披露这些外部状态来控制信息流,旨在使代理人的行动与其目标保持一致。 另一方面,代理人面临一个序列决策问题,并根据其偏好选择行动。短视代理人最大化期望的即时奖励,而远视代理人则考虑未来的状态转移和信号披露。因此,委托人必须有效解决一个嵌套规划问题——选择信号策略的同时预测代理人将如何对其做出反应。通常,考虑远视代理人的信号策略设计是 NP 难的[13 (https://arxiv.org/html/2607.13576#bib.bib1)]。此外,在现实环境中,委托人和代理人都可能不完全了解各自的奖励和转移动态。因此,我们提出一个在线学习框架,在该框架中我们对一个做出近似最优响应的强化学习代理人进行建模。 参见图注图 1:基于贝叶斯劝说的智能交互式驾驶示意图在第 III 节 (https://arxiv.org/html/2607.13576#S3) 中说明。此处,委托人(智能头车)和代理人(联网车辆)都知晓车辆状态 \(s\)。外部状态 \(\theta\)(实时交通)只有委托人知晓而代理人未知,它会影响决策结果。委托人利用此信息通过信号 \(g\) 劝说代理人,引导其行动朝向自身目标。给定信号策略后,代理人根据其对 \(\theta\) 的后验信念采取行动,获得即时奖励并随机转移到下一状态。 本文考虑一个单调代理人——即,一个通过选择"更高"的行动来响应"更高"信号的代理人,从而对信号披露产生有序且可预测的响应。这种行为在许多实际环境中是自然的——例如,传输控制、传感器调度、交通路由——在这些环境中,更强的信号会引导代理人采取更好的行动[28 (https://arxiv.org/html/2607.13576#bib.bib219)]、[36 (https://arxiv.org/html/2607.13576#bib.bib206)]。许多实际应用——例如信用评级、排队、交通路由——在这些领域中贝叶斯劝说被广泛使用,通常表现出单调阈值策略,例如向更高质量的公司分配更高的评级[14 (https://arxiv.org/html/2607.13576#bib.bib3)]或随着道路交通改善而提高行驶速度[36 (https://arxiv.org/html/2607.13576#bib.bib206)]。我们提出一个在线结构化强化学习框架,以合成计算高效的信号策略,该策略对远视代理人具有*有效劝导性*。本文的主要贡献如下: 1. **单调代理人策略学习 (MAPL)**:我们假设一个具有单调策略并能做出近似最优响应的代理人,并提出一种利用代理人策略单调性结构的结构化强化学习算法。算法 1 (MAPL) 能够在大状态空间中更快地在线学习代理人策略,同时获得更高的平均奖励。 2. **委托人 Q 因子的特征描述**:定理 1 给出了在考虑单调代理人的情况下,确保委托人 Q 值函数具有超模结构的贝叶斯劝说模型的充分条件。 3. **有效劝导性信号策略的结构化结果**:我们给出了确保信号策略对单调代理人具有有效劝导性的充分条件。具体来说,定理 2 描述了委托人的信号策略,而定理 3 推导出代理人奖励函数的充分条件,这些条件确保所设计的信号策略对单调代理人是有效劝导的。 4. **面向委托人的超模 Q 学习 (SQP)**:我们提出算法 2 (SQP),它利用委托人 Q 值的超模结构来合成计算高效的信号策略,该策略对单调代理人是有效劝导的。此外,算法 3 展示了在动态贝叶斯劝说中,委托人与近似最优响应代理人重复交互的在线强化学习框架。 5. **贝叶斯劝说式驾驶案例研究**:我们展示了 (i) 与传统的动态车辆路径推荐相比,使用 MAPL 进行联网车辆策略在线学习的计算效率;(ii) 与现有方法[46 (https://arxiv.org/html/2607.13576#bib.bib74)]、[13 (https://arxiv.org/html/2607.13576#bib.bib1)]、[3 (https://arxiv.org/html/2607.13576#bib.bib75)]相比,所提出的结构化强化学习框架在头车智能交互式驾驶信号策略设计中的成本效益和计算效率。 *据我们所知,这是首个探索动态贝叶斯劝说框架中在线强化学习结构化结果的工作,其应用涉及智能交通路由、传输控制、信用评级、传感器调度和排队系统。* ## II. 相关工作 能够预测并适应周围车辆变道行为的交互式驾驶方法在智能交通管理中日益受到关注[37 (https://arxiv.org/html/2607.13576#bib.bib54)]。在这项工作中,我们重点研究*基于车道的路由*,即决策在单个车道的粒度上进行,这得益于车对车 (V2V) 通信、实时交通感知和精确定位技术的进步。这种细粒度控制有助于协调车道分配和队列编组,使掌握全局交通状况的头车能够引导联网车辆进入高速编队。这种协调通过减少空气阻力提高了交通吞吐量和能源效率,并通过同步车辆行为促进了道路安全[50 (https://arxiv.org/html/2607.13576#bib.bib217)]。 ##### 现有的车道变换方法 经典的自动驾驶车辆车道变换方法主要依赖于基于规则的决策,这些决策根据预定义的安全约束(如最小间隙距离和碰撞时间阈值)来评估当前交通状况[48 (https://arxiv.org/html/2607.13576#bib.bib224)]。然而,这些方法依赖于瞬时交通状态,而不是预测未来的交通演变。模型预测控制 (MPC) 通过在有限预测范围内优化车辆轨迹同时满足动态和安全约束来解决这一限制[52 (https://arxiv.org/html/2607.13576#bib.bib218)]。然而,其性能对模型精度高度敏感,并且在复杂交通环境中计算需求巨大,限制了其在实时部署中的实用性。 ##### 在线强化学习方法 深度神经网络已被用于模拟复杂的车道变换行为[45 (https://arxiv.org/html/2607.13576#bib.bib222)]、[52 (https://arxiv.org/html/2607.13576#bib.bib218)]。然而,这些方法通常需要大规模训练数据和大量的计算资源[52 (https://arxiv.org/html/2607.13576#bib.bib218)]。此外,最近的进展转向了通过重复环境交互来学习车道选择的在线强化学习方法[1 (https://arxiv.org/html/2607.13576#bib.bib215)]。然而,在多年辆环境中,完全共享的信息反而可能导致交通拥堵[26 (https://arxiv.org/html/2607.13576#bib.bib47)]。这促使了对战略性信息揭示框架的探索,其中贝叶斯劝说成为智能交通管理的一种有前景的方法[37 (https://arxiv.org/html/2607.13576#bib.bib54)]。 ##### 贝叶斯劝说式驾驶 贝叶斯劝说提供了一个战略性框架,其中头车(委托人)有选择性地揭示实时交通信息,以影响联网车辆(代理人)的车道选择。在贝叶斯劝说式驾驶的背景下,通常假设委托人完全掌握环境的先验知识,从而可以预先计算信号策略[13 (https://arxiv.org/html/2607.13576#bib.bib1)]。此外,为了计算上的可处理性,通常假设头车的信号策略以及联网车辆的后验信念服从高斯分布。并且,假设了一个没有随机状态转移的简化代理人模型。在本文中,我们考虑在线强化学习环境,其中委托人和代理人都不知道奖励、状态转移动力学以及外部状态的先验信念,这使得信号策略的设计充满挑战。 ##### 短视代理人假设 此外,为了信号策略设计的计算可处理性,许多文献局限于短视代理人,即只优化即时奖励而不考虑未来转移和信号披露的代理人。例如,[13] 在完全已知模型且假设代理人是短视的情况下设计信号策略。最近,[46] 将此工作扩展到在线强化学习环境,委托人必须同时学习先验分布、奖励函数和转移动力学。然而,人们对动态贝叶斯劝说的兴趣日益增长,其中委托人和代理人随时间重复交互[13]、[26]、[12],这也是本文所考虑的情况。 ##### 动态贝叶斯劝说 在假设代理人具有最优策略的情况下,确定动态劝说中的最优信号策略通常是 NP 难的[13]、[46]。为了解决远视性问题,在假设模型动力学的前提下,[5] 等...
相似文章
面向行人行为不确定性的安全自动驾驶的多智能体强化学习
本文提出了一种多智能体强化学习框架,该框架同时训练自动驾驶车辆和具有个性驱动乱穿马路行为的行人,与单智能体方法相比,碰撞率降低了30%,并展示了更真实的交互场景。
自动驾驶中基于不确定性感知与时间规制的专家建议强化学习
本文提出了一种面向自动驾驶的不确定性感知强化学习框架,通过自适应不确定性阈值和承诺-冷却策略引导的专家建议,提升了安全性和效率。在CARLA模拟器上的实验表明,相较于IQN基线,成功率提高了5%-7%。
基于自适应奖励塑造和策略比率重加权策略的高样本效率迁移强化学习
本文提出了一种用于自动驾驶高速公路车道变换的安全迁移强化学习框架,采用自适应教师干预和奖励塑造来提高样本效率和安全性。实验表明,与基线相比,安全性提升超过52%,效率提升5%。
用于自适应交通信号控制的可解释强化学习
本文提出了一种可解释的以实体为中心的强化学习框架,用于自适应交通信号控制,该框架采用具有多头交叉注意力和自注意力的双阶段注意力网络,以提供可解释的亲和矩阵,同时将确定性动作掩码集成到PPO中以确保安全合规性。
SPS:通过概率挤压引导实现大语言模型强化学习中的更优探索
研究人员提出了 SPS(概率挤压引导),这是一种结合强化学习与逆强化学习的训练范式,旨在解决大语言模型推理训练中的概率挤压问题。该问题表现为概率质量过度集中于高奖励轨迹,导致探索空间受限及多样本性能(Pass@k)下降。在五个推理基准上的实验表明,该方法有效提升了模型的探索能力与 Pass@k 指标。