average-reward

标签

Cards List
#average-reward

Multichain鲁棒平均奖励Markov决策过程的向量Bellman理论

arXiv cs.LG ↗ · 5天前 缓存

本文介绍了用于鲁棒平均奖励Markov决策过程的向量Bellman理论,通过有限模型可解性和近似移位的Halpern规划算法,实现了在转移不确定性下的最优性能。

0 人收藏 0 人点赞
#average-reward

平均奖励强化学习的有限常数前沿与可审计遗憾证书

arXiv cs.LG ↗ · 2026-08-11 缓存

本文为平均奖励强化学习遗憾界引入了一种常数感知的比较协议,为通信MDP导出了显式的有限下界证书,并改进了已发表的系数。

0 人收藏 0 人点赞
#average-reward

鲁棒平均奖励马尔可夫决策过程:通过插入式归约实现极小极大最优学习

arXiv cs.LG ↗ · 2026-08-10 缓存

本文研究了鲁棒平均奖励马尔可夫决策过程的样本复杂度,在总变差不确定集下通过插入式归约导出了极小极大最优学习率。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈