标签
本文为在马尔可夫采样下的使用Polyak-Ruppert平均的无投影线性TD(0)算法提供了高概率保证,使用单一步长调度,该调度同时实现了鲁棒的无曲率依赖和快速的曲率依赖收敛率。
本文提出了一种用于扩散模型的时间差分(TD)学习目标,该目标在去噪轨迹上强制跨时间一致性。它将去噪重新表述为强化学习中的策略评估问题,展示了在样本质量(FID)上的显著改进,尤其适用于少步采样器。
本文提出了STHTD-MP,一种行为诱导的Mirror-Prox时序差分方法,用于强化学习中的更快速离策略预测。该方法用行为策略贝尔曼矩阵替换协方差度量,并提供了收敛性分析和实验比较。
本文通过提供一个反例解决了一个强化学习领域的开放性问题,表明在平均奖励设置下,尽管差分时序差分学习在使用局部时钟时能够收敛,但在使用全局时钟时可能会发散。