标签
本文为平均奖励强化学习遗憾界引入了一种常数感知的比较协议,为通信MDP导出了显式的有限下界证书,并改进了已发表的系数。
本文首次为有限时域马尔可夫决策过程中的自然策略梯度算法提供了有限时间收敛保证,证明了在不同步长策略下的次线性和线性收敛速度。