基于图控制的异构道路网络交通信号接口

arXiv cs.LG 论文

摘要

本文提出一种基于图的交通信号控制接口,使用共享图神经网络为各个交通流向分配分数,并通过关联矩阵确定性地构造相位。实验评估了在合成和城市道路网络上的迁移效果,结果表明可行性,但对分布偏移敏感。

arXiv:2607.21831v1 公告类型:新 摘要:我们提出了一种交通信号控制接口,其中共享图神经网络为各个交通流向分配分数。每个路口使用确定性关联矩阵将这些分数转换为其自身可变大小的合法信号相位集合。有向走廊节点提供交通上下文,而运动节点表示通过路口的受控输入-输出路径。类型化均值聚合为每个运动产生一个标量;相位定义和信号时序保持在学习的网络之外。这使得图的大小和路口特定的动作数量独立于学习的参数形状。PPO实验在未见过的合成网格几何形状、改变信号覆盖范围和五个异构城市图上评估了该接口。策略在合成网格家族内的未见几何形状上保持了性能,而信号覆盖范围的变化则暴露了对信号覆盖分布偏移的敏感性。单个训练好的城市策略实例在所有五个城市图上执行,结果各异。这些结果提供了可行性证据,而非对任意道路网络迁移的一般性估计。
查看原文
查看缓存全文

缓存时间: 2026/07/27 07:42

# 一种基于图网络的异构道路网络交通信号控制接口
来源:https://arxiv.org/html/2607.21831

###### 摘要

我们提出一种交通信号控制接口,其中共享图神经网络为单个交通流向分配得分。每个交叉口使用确定性关联矩阵将这些得分转换为自身可变大小的合法信号相位集合。有向路段节点提供交通上下文,而流向节点表示通过交叉口的受控输入到输出路径。类型化均值聚合为每个流向产生一个标量;相位定义和信号时序保持在已学习网络之外。这使得图大小和交叉口特定动作计数独立于已学习的参数形状。PPO实验评估了该接口在未见过的合成网格几何形状、改变的信号覆盖范围以及五个异构城市图上的表现。策略在合成网格系列内的未见几何形状上保持了性能,而信号覆盖范围的变化暴露了对信号覆盖分布偏移的敏感性。单个训练好的城市策略实例在所有五个城市图上执行,产生了异构的结果。这些结果提供了可行性证据,而非对任意道路网络迁移性的普遍估计。

## 1 引言

交通信号动作空间是局部的。三岔路口、常规四岔路口以及带有保护转向的路口,其相位数和含义不必相同。因此,一个固定的“相位2”输出在不同道路网络之间没有可复用的语义。填充这样的输出头部会改变其张量形状,但不会使填充的相位索引在不同路口间具有共享含义。

我们提出一种交通信号控制接口,其中共享图神经网络为单个交通流向分配得分。每个交叉口使用确定性关联矩阵将这些得分转换为自身可变大小的合法信号相位集合。核心设计选择因此是一个狭窄的边界:学习优先处理可比较的流向对象,而确定性代码构建并操作每个交叉口的有效局部选择。

由此产生的系统结合了可复用的流向级图表示、交叉口特定动作空间的确定性构建,以及在合成和城市模拟上的可行性评估。其可变图维度和动作维度是设计的结构性属性。我们区分了通过构建确立的结构性属性、在异构图上进行的实现验证,以及关于学习性能的有界经验证据。因此,可变图维度和动作维度是主要结果,可训练性和跨场景执行是次要验证,而学习的与基线之间的结果是在不匹配控制器时序下的探索性比较。实证评估围绕三个研究问题组织:

RQ1 — 在合成生成器家族内的迁移。训练好的策略在由同一生成器产生的未见过的网格尺寸和宽高比上表现如何?

RQ2 — 分布偏移。当信号覆盖范围改变时会发生什么?

RQ3 — 城市可行性。同一个训练好的策略能否在几个异构的城市模拟上执行,观察到的结果变化如何?

流向压力和流向结构化控制有着丰富的先前渊源。Max-pressure方法从组成车流中为兼容阶段分配得分 [5 (https://arxiv.org/html/2607.21831#bib.bib1)],而PressLight将压力与学习控制联系起来 [6 (https://arxiv.org/html/2607.21831#bib.bib2)]。FRAP从流向特征学习相位需求和成对相位竞争,明确围绕冲突和对称性构建已学习的相位值 [7 (https://arxiv.org/html/2607.21831#bib.bib3)]。TransferLight是架构上最接近的比较:其学习的定向层次结构将车道段聚合成流向表示,将流向聚合成相位表示,以及相位间的交互,然后产生相位能量 [3 (https://arxiv.org/html/2607.21831#bib.bib4)]。它还使用权重绑定的去中心化智能体、领域随机化训练网络以及已学习的流向到相位语义。相比之下,我们学习的actor操作在一个城市级LaneGroup/流向上下文图上,并在每个流向处停止为一个标量;相位成员、相位枚举、关联求和以及时序保持确定性。更狭小的贡献在于这种共享的流向评分与自动构建的局部动作空间之间的透明边界,而非基于流向的控制本身或更广泛的迁移声明。

范围。本报告评估了一个实现和架构接口,而非提出新的强化学习算法。实验评估了在指定模拟家族内的迁移以及在异构动作空间上的执行。它们并未建立跨任意道路网络的通用迁移。

## 2 流向级控制接口

### 2.1 直觉与控制对象

一个*流向*是一条从入口路段到出口路段的合法受控路径;直行以及转弯都是流向。一个*相位*是一组兼容的流向,可以同时获得绿灯。控制器为每个交叉口选择一个相位,而不是独立设置单个灯色。

入口路段  出口路段  (a) 一个流向  
s1 s2 s3  (b) 对每个流向打分  
一起绿灯  保持红灯  (c) 选择一个相位  

图1:控制词汇表。共享模型单独对流向打分;每个交叉口提供自身兼容的相位集合。所示相位是示例性的,并非通用模板。

实现将连续的定向道路段分组为一个`LaneGroup`,当无信号延续明确无误时。相反方向保持分开,因为它们的队列、速度和目的地不同。在受控交叉口,一个合法的输入到输出连接成为一个流向节点。交叉口拥有其流向和相位,但其本身不是GNN节点。

表1:表示和动作接口中的角色。在每个决策时刻,特征从SUMO更新,共享GNN为每个流向输出一个得分,交叉口本地的关联矩阵将这些得分转换为相位logits。可用性掩码强制执行最小绿灯;运行时在接受的相位目标改变时插入黄灯。只有流向评分是学习的。

### 2.2 类型化图与消息传递架构

每个流向 \( m \) 有一个输入 LaneGroup \( i(m) \) 和一个输出 LaneGroup \( o(m) \),给出四个定向信息关系:

\[
L_{\mathrm{in}}\! \rightarrow M,\quad L_{\mathrm{out}}\! \rightarrow M,\quad M\! \rightarrow L_{\mathrm{in}},\quad M\! \rightarrow L_{\mathrm{out}}.
\]

输出到流向的关系将下游存储上下文返回给将馈送该路段的流向。无信号直通连接加权为 \( L \! \rightarrow L \) 边,权重为 \( w_{ql} = \exp(-t_{\mathrm{ff}} / 30\,\mathrm{s}) \)。

令 \( \rho \) 表示ReLU,\( \| \) 表示拼接,\( x_l, x_m \) 表示LaneGroup和流向特征向量。实现首先创建:

\[
\begin{aligned}
h_l^{(0)} &= \rho(E_L x_l), \quad (1)\\
h_m^{(0)} &= \rho\! \left( E_M [ x_m \| h_{i(m)}^{(0)} \| h_{o(m)}^{(0)} ] \right). \quad (2)
\end{aligned}
\]

对于关系 \( r \),目标 \( v \),源嵌入 \( z_q \),定义变换均值:

\[
\mathcal{A}_r^{(k)}(v; z) = \frac{1}{\max(1, |\mathcal{N}_r(v)|)} \sum_{q \in \mathcal{N}_r(v)} w_{qv} W_r^{(k)} z_q,
\]

其中 \( w_{qv}=1 \),除了在无信号连接边上。到流向 \( m \) 的入口和出口消息为:

\[
a_{\mathrm{in},m}^{(k)} = \mathcal{A}_{L_{\mathrm{in}} \to M}^{(k)}(m; h_L^{(k)}), \quad
a_{\mathrm{out},m}^{(k)} = \mathcal{A}_{L_{\mathrm{out}} \to M}^{(k)}(m; h_L^{(k)}). \quad (3)
\]

一个块首先更新流向嵌入:

\[
h_m^{(k+1)} = \rho\! \left( U_M^{(k)} [ h_m^{(k)} \| a_{\mathrm{in},m}^{(k)} \| a_{\mathrm{out},m}^{(k)} ] \right). \quad (4)
\]

然后形成返回消息:

\[
\begin{aligned}
b_{\mathrm{in},l}^{(k)} &= \mathcal{A}_{M \to L_{\mathrm{in}}}^{(k)}(l; h_M^{(k+1)}), \\
b_{\mathrm{out},l}^{(k)} &= \mathcal{A}_{M \to L_{\mathrm{out}}}^{(k)}(l; h_M^{(k+1)}), \quad (5)\\
c_l^{(k)} &= \mathcal{A}_{L \to L}^{(k)}(l; h_L^{(k)}), \quad (6)
\end{aligned}
\]

并更新LaneGroup嵌入:

\[
h_l^{(k+1)} = \rho\! \left( U_L^{(k)} [ h_l^{(k)} \| (b_{\mathrm{in},l}^{(k)} + c_l^{(k)}) \| b_{\mathrm{out},l}^{(k)} ] \right). \quad (7)
\]

每个关系有自己独立的线性映射,聚合采用均值而非注意力,返回消息使用刚从(4)更新的嵌入。空邻居产生零向量。两个块之后,一个MLP将每个 \( h_m^{(2)} \) 映射为一个标量 \( s_m \)。每个交叉口被视为参数共享的局部智能体:评论家均值池化该交叉口的流向嵌入,返回一个值,其局部奖励和价值序列产生一个独立的时序GAE流。对于PPO更新,可变大小的状态图作为断开的打包图拼接;具有匹配局部流向和相位维度的交叉口被分组以进行批处理的值和关联操作,小批量按交叉口/动作样本数量预算,而不是填充到统一的图或动作大小。

L0 M0 L1 M1 L2 邻居上下文在块2到达M1。块1:LaneGroups → 流向 → LaneGroups。块2:使用更新的上下文重复。

图2:类型化表示和更新顺序。通过此顺序,两个块允许信息通过共享LaneGroup从一个流向到达另一个流向。

上述参数矩阵在类型的所有节点和边上共享。其形状仅取决于特征和隐藏维度。因此参数形状独立于图和动作空间的大小。

### 2.3 确定性局部动作空间

构建流水线从SUMO `netconvert` [1 (https://arxiv.org/html/2607.21831#bib.bib6)] 获取受控连接和请求冲突数据。必须同时激活的连接形成原子组;组内具有内部SUMO冲突的组被拒绝。当SUMO报告任一方向存在冲突,或者不同入口引道合并到同一出口边时,两个组不兼容。Bron–Kerbosch枚举 [2 (https://arxiv.org/html/2607.21831#bib.bib7)] 产生所有最大兼容组集,每个组集成为一个可选的相位。这里,“最大”意味着不能再添加额外的兼容组,而非相位具有最大尺寸。

对于交叉口 \( j \),\( A_j \in \{0,1\}^{|P_j| \times |M_j|} \) 记录相位 \( p \) 是否启用流向 \( m \)。局部 logits 为:

\[
\boldsymbol{\ell}_j = A_j \mathbf{s}_j, \quad \ell_{j,p} = \sum_{m \in M_j} A_{j,p,m} s_m.
\]

例如,

\[
A_j = \begin{bmatrix} 1 & 1 & 0 & 0 \\ 0 & 0 & 1 & 1 \end{bmatrix}, \quad
\mathbf{s}_j = \begin{bmatrix} 1.2 & 0.7 & 0.6 & -0.4 \end{bmatrix}^{\mathsf{T}}, \quad
A_j \mathbf{s}_j = \begin{bmatrix} 1.9 & 0.2 \end{bmatrix}^{\mathsf{T}}.
\]

由此产生的 logits 有利于第一个相位;随后进行掩码和分类采样,然后运行时应用任何信号过渡。另一个交叉口可能提供一个 \( 6 \times 11 \) 矩阵而不改变评分器。

SUMO受控连接和冲突 → 原子激活组 → 最大兼容集 → 局部关联矩阵 \( A_j \) → 离线,确定性构建
GNN流向得分 \( \mathbf{s}_j \) × \( A_j \) = 相位logits \( \boldsymbol{\ell}_j = A_j \mathbf{s}_j \) → 可用性掩码 → 采样一个可用相位 → 在线,每五秒决策一次

图3:离线相位构建和在线动作选择。固定关联矩阵随每个交叉口变化;已学习的评分器则不变。

求和聚合特意限制了策略类别:相位logit是其启用流向的加性效用,因此actor不能直接表示任意相位内交互。共享流向的相位也具有相关的logits,并且当得分为正时,较大的相位可能仅仅因为包含更多项而获得更高的logit。这种限制保持了已学习/本地的接口透明,但其相位大小效应或诸如归一化或已学习相位聚合等替代方案并未单独评估。

## 3 实验设计与可复现性

### 3.1 训练协议与局部奖励

PPO [4 (https://arxiv.org/html/2607.21831#bib.bib5)] 优化完整的策略。所有报告的研究均使用两个消息传递块,\( 5\,\mathrm{s} \) 决策间隔,改变时立即插入 \( 3\,\mathrm{s} \) 黄灯,一个决策的最小绿灯,四个PPO周期,每个rollout 200个决策,以及熵系数 \( 0.001 \)。Rollout数量分配大致平衡不同大小训练图上的交叉口/动作样本。

代码为每个决策间隔 \( \Delta = 5\,\mathrm{s} \) 为每个交叉口 \( j \) 分配一个奖励。定性地,局部奖励鼓励车辆通过并离开入口引道,同时惩罚减速和排队。令 \( I_j \) 为其唯一入口车道,\( D_j = \sum_{l \in I_j} D_l \) 为总长度,\( n_l \) 为车辆数,\( \bar{v}_l \) 为平均速度,\( v_l^{\max} \) 为限速,\( V_j(t) \) 为这些车道上的车辆ID集合。使用 \( f_l(t) = \operatorname{clip}(\bar{v}_l(t)/v_l^{\max}, 0, 1) \),实现的项如下:

表2:报告运行中确切的局部奖励项。值在决策边界采样。

第一个制动样本为零,因为不存在前一张快照。每个交叉口的奖励为:

\[
r_j = \operatorname{clip}_{[-1,1]}\! \left( p_j + 10 d_j - 10 b_j - 0.02 q_j \right).
\]

全局延误、完成网络流量、直接吞吐量、相位切换和瞬移项在这些运行中权重为零。由于各项具有不同单位并手动加权,最终奖励是一个无量纲优化目标。它是一个局部代理,不能保证网络级吞吐量、完成率或等待密度有所改善:例如,一个交叉口的车辆释放可能将车辆移入拥塞的下游区域。

### 3.2 评估指标

每个episode记录每种子指标的指标,然后计算算术平均。对于一个模拟时长为 \( T \) 秒的episode,

相似文章

用于自适应交通信号控制的可解释强化学习

arXiv cs.AI

本文提出了一种可解释的以实体为中心的强化学习框架,用于自适应交通信号控制,该框架采用具有多头交叉注意力和自注意力的双阶段注意力网络,以提供可解释的亲和矩阵,同时将确定性动作掩码集成到PPO中以确保安全合规性。