标签
本文针对交互驾驶中的贝叶斯劝导问题,提出了一种结构化强化学习框架。在该框架中,领航车辆通过选择性披露交通信息来引导网联车辆。该方法引入了MAPL和SQP算法,相比现有方法实现了30%的成本效率提升。