标签
本文提出了一种偏好条件多目标强化学习控制器,用于公交信号优先,可在无需重新训练的情况下,在运行时调整公交优先与整体交通延误之间的权衡。实验表明,该控制器在维持可行性约束的同时,优于固定时间和基于规则的基线方法。