标签
本文提出了一种元多智能体强化学习(meta-MARL)框架,将多智能体强化学习(MARL)问题建模为马尔可夫博弈,并定义了一种新的求解概念——元纳什均衡(meta-NE),并证明其与基于梯度博弈算法的驻点等价。实验表明,在自动驾驶任务中,该方法相比预训练的 MARL 基线方法能够实现更快的适应。