标签
介绍了SPOT(采样策略观察树),一种模型无关的框架,通过构建有限时域前瞻树来揭示动作的下游后果,从而解释深度强化学习策略,并在SUMO-RL交通信号控制领域进行了演示。
本文提出一种基于图的交通信号控制接口,使用共享图神经网络为各个交通流向分配分数,并通过关联矩阵确定性地构造相位。实验评估了在合成和城市道路网络上的迁移效果,结果表明可行性,但对分布偏移敏感。
OverFlowLight 是一个实时框架,通过利用多模态感知检测排队溢出,并借助基于规则与强化学习(RL)的混合控制器插入专用溢出相位,从而预防交通阻塞。该系统已在 43 个交叉口部署,将溢出事件减少 60.4%,并将网络吞吐量提升 18.2%。
本文提出了一种用于噪声物联网环境中自适应交通信号控制的主动推理控制器,在传感器遮挡和恶劣天气条件下,空闲时间和CO2排放均优于DQN。
本文介绍了 OracleTSC,该方法利用 Oracle 信息奖励门槛和不确定性正则化来稳定大语言模型(LLMs)在交通信号控制中的强化微调。实验表明,该方法在使用 LLaMA-3-8B 模型的同时保持了可解释性,并在 LibSignal 基准测试中显著提升了交通流量指标。