面向运行时可调公交信号优先的偏好条件多目标强化学习

arXiv cs.LG 论文

摘要

本文提出了一种偏好条件多目标强化学习控制器,用于公交信号优先,可在无需重新训练的情况下,在运行时调整公交优先与整体交通延误之间的权衡。实验表明,该控制器在维持可行性约束的同时,优于固定时间和基于规则的基线方法。

arXiv:2607.18286v1 公告类型:新 摘要:公交信号优先(TSP)需要平衡相互冲突的目标:减少公交延误同时限制对非公交交通的不利影响,并避免部分车辆极端等待。现有的强化学习(RL)方法通常编码公交感知特征(如载客量和时刻偏差),但优化固定的奖励或固定标量化,这在机构优先级随一天中的时间或中断条件变化时限制了操作灵活性。我们提出了一种偏好条件TSP控制器 $\pi(a \mid s,w)$,它在最小/最大绿灯时间和转换可行性约束下选择下一个信号相位,并可通过偏好参数 $w$ 在运行时调整公交优先权重与整体交通延误的权衡,无需重新训练。我们在IntersectionZoo之上实现了该控制器,引入了受约束的信号控制/TSP封装,并通过公交频率增强和基于时刻表的公交插入扩展了场景生成,以解决训练期间稀疏的公交优先事件。与固定时间控制、基于规则的TSP覆盖以及固定权重的PPO专家相比,实验表明,单个学习的条件策略在运行时偏好上覆盖了平滑的经验权衡前沿,优于固定时间和基于规则的基线,并保持了约束可行性,而尾部延迟诊断显示,在适中的偏好设置下,非公交外部性仍然有限,但在高公交优先权重下可能显著增加。本工作的源代码可在 https://github.com/urbanAIthi/morl-tsp 获取。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:18

# 面向运行时可调公交信号优先的偏好条件多目标强化学习
来源:https://arxiv.org/html/2607.18286

###### 摘要

公交信号优先(TSP)需要在竞争目标之间取得平衡:减少公交延误的同时,限制对非公交交通的不利影响,并避免部分车辆出现极端等待。现有的强化学习(RL)方法通常编码公交感知特征(例如,载客量和时刻表偏差),但优化固定的奖励或固定的标量化,这限制了当机构优先级因时段或中断条件变化时的运行灵活性。我们提出了一种偏好条件的TSP控制器 π\(a∣s,w\),该控制器在最小/最大绿灯时间和过渡可行性约束下选择下一个信号相位,并可通过运行时偏好参数 w 进行调优,以在公交优先强调与整体交通延误之间进行权衡,而无需重新训练。我们在IntersectionZoo之上实现了这一点,通过引入一个受约束的信号控制/TSP包装器,并通过公交流行度增强和基于时刻表的公交插入来扩展场景生成,以解决训练期间稀疏的公交优先事件。与固定时间控制、基于规则的TSP覆盖层以及固定权重的PPO专家相比,实验表明,一个单一学习到的条件策略在运行时偏好上覆盖了一个平滑的经验权衡前沿,优于固定时间和基于规则的基线,并保持了约束可行性,而尾部延迟诊断显示,对于适中的偏好设置,非公交外部性仍然有限,但在高公交优先权重下可能会显著增加。本工作的源代码可在 github.com/urbanAIthi/morl-tsp 获取。

## I. 引言

公交信号优先(TSP)通过在公交车接近信号交叉口时重新分配绿灯时间来提高公交行程时间和可靠性,但如果应用过于激进,可能会对非公交交通产生外部影响。由于机构优先级在一天中的不同时段和中断期间会发生变化,单个固定的“优先设定点”通常在操作上是不够的。在实践中,经典TSP使用基于规则的逻辑(例如,绿灯延长、早启绿灯或相位插入),这些逻辑由公交检测触发,并受安全定时规则和控制器能力的约束[18, 3]。

最近的强化学习方法将公交感知特征(如载客量和时刻表偏差)纳入TSP,但通常优化固定的奖励标量化,当期望的公交优先与网络延误权衡发生变化时,需要重新训练或重新调整[10, 7, 9, 23]。一种标准的解决方法是训练多个固定权重的专家并在它们之间进行选择,但这只会产生离散的操作点,并增加训练成本。在多目标强化学习中,最先进的权重灵活控制使用偏好条件的价值或策略网络,该网络将权重向量 w 作为输入(例如,UVFA/PCN风格的条件化),从而无需重新训练即可实现连续的运行时调优[16, 1, 15]。这种灵活目标视角尚未在共享操作约束的TSP中得到系统评估。

在基于RL的信号控制中,实证比较仍然不平衡:研究在模拟器/传感假设、交叉口布局、需求生成和基线实现方面差异很大,许多研究未在通用测试平台内进行比较,这使得最先进方法的声明更难解释[4, 5]。基准测试库专门为标准化场景和基线实现而引入,以便进行公平比较(例如,RESCO,LibSignal)[4, 12]。

我们提出了一种偏好条件的TSP控制器 π\(a∣s,w\),用于在基于IntersectionZoo(IZ)的交叉口上进行受约束的相位选择[8]。我们还引入了一个IZ到TSP的包装器(共享可行性层、公交状态提取和可配置的公交流行度),并通过偏好扫描评估运行时可调性,包括尾部延迟和公平性诊断,以揭示集中的非公交危害。

### I-A. 贡献

我们做出三个贡献:

- • **IZ–TSP 基准套件(包装器 + 基线包)**:在基于IZ的交叉口上,包含公交状态提取、可配置的公交流行度/属性以及约束匹配的基线包(固定时间 + 标准基于规则的绿灯延长/早启绿灯覆盖层)的标准化约束相位控制TSP任务,以实现跨方法的可重复、可比较评估。
- • **偏好条件的TSP控制器**:单个策略 π\(a∣s,w\),无需重新训练即可实现公交与所有车辆延误权衡的运行时调优,并通过偏好扫描进行评估。
- • **权衡与鲁棒性协议**:跨运行时偏好的帕累托风格报告以及分布偏移压力测试,附带尾部延迟/公平性诊断。

## II. 问题形式化与基准设计

我们研究具有固定一组绿灯相位 P 的单个信号交叉口的TSP。在每个决策步骤 t,控制器观察状态 s_t 和一个运行时偏好参数 w,该参数指定公交延误与所有车辆延误之间的期望标量化,并输出请求的下一个绿灯相位 a_t ∈ {0, ..., |P|-1}。对于基于请求的控制器(规则TSP和基于学习的方法),动作受到操作约束(例如,最小/最大绿灯时间和过渡可行性)的约束,这些约束由共享可行性层(第II-E节)强制执行,以便在相同约束下比较这些方法。

### II-A. 控制接口与时间约束

所有基于请求的控制器(规则TSP和基于学习的方法)与同一个相位控制器接口。每4秒,智能体请求下一个绿灯相位,而过渡相位不可选择。固定时间重放场景的tlLogic程序,因此不量化为4秒的决策网格。SUMO以1秒的模拟步长前进。控制器仅在满足时间约束时执行切换。在所有实验中,我们强制执行最小绿灯时间20秒和最大绿灯时间50秒。控制决策每4秒发出一次,因此绿灯只能以4秒(最小延长量)的增量延长。否则,控制器保持当前相位。请求不会在决策步骤之间持续。如果未执行切换,智能体将在下一个决策时间发出新请求。当执行绿灯到绿灯的切换时,控制器插入固定的3秒黄灯过渡阶段。不使用全红阶段,尽管包装器支持全红。

### II-B. 观测

在每个决策步骤 t,观测连接了信号状态、交通状况以及接近公交车的公交信息。信号特征编码当前活跃相位、自上次相位变化以来的时间、满足最小绿灯时间的时间以及每个相位上次活跃以来的时间。

交通特征是在停车线上游250米的固定检测范围内计算所有车辆。尚未通过上一个信号交叉口的车辆被排除在外。这些特征包括车道级别的密度和队列估计,以及每个车道的延误摘要。具体地,对于每个入口车道 ℓ,我们计算尾部延误统计量 CVaR_{0.1,ℓ,t}^{lane},定义为当前在车道 ℓ 上观测到的延误最严重的 10% 车辆的平均每车延误。

公交特征使用每个入口车道的固定大小公交槽编码:对于每个入口车道,我们分配 K=2 个公交槽,并通过公交距离停车线的距离 d 编码每个槽(保留最近的公交车,空槽补零)。距离停车线是到受控信号灯的车道/路径距离,裁剪到 [0, 250m] 并归一化。在报告的实验中,载客量和时刻表偏差元数据在包装器中可用于未来的公交感知控制器,但未包含在观测向量中,以隔离偏好条件的延误控制。这种固定大小的槽编码处理了变化的接近公交车数量,并遵循先前RL-TSP的实践(例如,每个方向选择最多前 K 辆公交车,其余补零)[10]。

### II-C. 目标、奖励向量与偏好条件化

我们使用剧集级别的延误指标评估控制器,该指标量化公交延误和非公交延误作为主要外部性度量。所有延误量都是在受控检测区域内计算的,该区域定义为对于公交车和非公交车辆均为上游固定长度为250米的路段。延误是相对于自由流的额外行程时间,根据在受控检测区域内行驶的距离和相应的边缘限速计算。

令 B 表示公交车,V 表示所有车辆。令 delay_k 为一次剧集中车辆 k 的累积延误。表格和图中报告的剧集级别评估指标是每车平均延误:
J_b = (1/|B|) Σ_{k∈B} delay_k
J_nb = (1/|V\B|) Σ_{k∈V\B} delay_k
我们还类似地对 V 计算所有车辆平均延误 J_all。

为了量化对非公交用户的过大影响,我们额外报告一个基于 CVaR_α 的非公交尾部延误诊断,该值在 V\B 中车辆的剧集延误分布上计算。

我们学习一个单一的条件策略
π(a|s,w)   (3)
在我们的实验中,我们使用单个公交优先权重 w_bus ∈ [0,1],并在所有车辆延误代理上使用互补权重。我们在评估时改变 w,以追踪经验权衡,而无需重新训练[16, 1, 15]。

对于训练,我们使用一个二维的每步奖励向量,包含公交延误和所有车辆延误分量。所有车辆分量还额外带有一个基于 CVaR_α 的非公交尾部延误惩罚,以阻止极端等待。具体地,d_t^bus 和 d_t^all 分别计算为决策时刻 t 时当前在检测区域内的公交车和所有车辆的瞬时区域内延误之和。令 D_t^nb 表示相应的瞬时非公交车辆延误集合,并定义
CVaR_{α,t}^{nb} ≜ CVaR_α(D_t^nb),
即瞬时非公交延误分布的经验条件风险价值。

每步奖励向量为
r_t^vec = [ -d_t^bus; - (d_t^all + λ_cvar * max(0, CVaR_{α,t}^{nb} - T_cvar)) ]。  (4)
我们在所有实验中使用 α=0.1, T_cvar=120s, λ_cvar=0.25。

为了稳定学习并提高权衡曲面的覆盖范围,我们使用一个简单的偏好课程。前150k步我们采样 w_bus ~ U(0.1, 0.9),之后采样 w_bus ~ U(0, 1)。

### II-D. 场景机制与包装器

我们的实现建立在SUMO-RL作为基于SUMO的信号控制的环境框架之上,并通过基于IZ的场景加载、公交元数据注入以及本文使用的TSP特定观测/奖励接口进行扩展[2, 8, 11]。在默认的IZ场景中,公交车相对于私家车较为稀疏(0.35%),因此优先事件稀少且冲突请求不常见。这削弱了优先仲裁的学习信号。因此,我们增加训练场景以增加公交优先事件的频率,同时保留底层交叉口几何形状和信号定义。

我们提供了两个场景包装器。第一个通过重新加权车辆类型混合来增加公交流行度。第二个注入基于时刻表的公交服务,并附加每辆公交车的元数据,包括路线标识、同时活跃的路由数量、载客量和时刻表偏差。所有包装器参数和采样分布都在发布的配置文件中指定,以确保精确的可重复性。

对于**分布内**评估,我们在相同的时刻表增强机制下进行训练和测试。具体地,我们每次剧集采样4条并发公交路线,并将这些服务添加到基础需求中。对于每条采样路线,发车间隔从[300, 900]秒均匀抽取,发车时间通过[-120, 600]秒的均匀偏移扰动。路线持续时间从[10,800, 36,000]秒均匀采样,路线定义可以在不同剧集之间重复使用。因此,活跃路线集及其时刻表实现在剧集之间变化。为了保持总需求大致恒定,我们移除底层场景中存在的任何公交车,并重新缩放剩余交通量,使总车辆计数保持不变。

我们还使用默认的IZ场景生成(即没有时刻表增强)进行**分布偏移**实验,这导致公交流行度显著降低。这测试了运行时可调性是否能够迁移到公交饱和度较低的环境。该协议类似于模拟中基于RL的域随机化的鲁棒性评估[20, 13, 22]。

### II-E. 可行性处理与防护措施

所有基于请求的控制器共享一个可行性层,该层实现第II-A节中的执行规则和时间约束。如果智能体提出不可行的相位变化,控制器将执行空操作(保持当前绿灯),并且该请求不会延续到下一个决策步骤。对于PPO,我们从策略分布中屏蔽不可行的动作。

相似文章

面向多目标强化学习的确定性帕累托最优策略综合

arXiv cs.LG

本文引入了一种基于切比雪夫标量化的新颖偏好条件贝尔曼算子,用于计算多目标马尔可夫决策过程中的确定性帕累托最优策略,并证明了该算子的收敛性及其在捕获完整帕累托前沿方面的有效性。

用于自适应交通信号控制的可解释强化学习

arXiv cs.AI

本文提出了一种可解释的以实体为中心的强化学习框架,用于自适应交通信号控制,该框架采用具有多头交叉注意力和自注意力的双阶段注意力网络,以提供可解释的亲和矩阵,同时将确定性动作掩码集成到PPO中以确保安全合规性。