标签
本文研究了三种信息不对称机制下具有重尾奖励的多智能体多臂老虎机问题,提出了鲁棒的分布式算法,其遗憾保证几乎匹配集中式算法的速率,并在帕累托分布奖励环境中进行了验证。
本文介绍了辅助博弈的在线变体,并为人类和辅助智能体提供了首个可证明高效的学习算法,实现了近乎最优的遗憾界。