mdps

标签

Cards List
#mdps

通过学习MDP实现安全强化学习的自适应概率性防护

arXiv cs.LG ↗ · 2026-08-21 缓存

本文介绍了一种用于安全强化学习的自适应概率性防护,其中防护是通过在线学习的MDP模型计算的,随着模型变得更精确而自适应。

0 人收藏 0 人点赞
#mdps

平均奖励强化学习的有限常数前沿与可审计遗憾证书

arXiv cs.LG ↗ · 2026-08-11 缓存

本文为平均奖励强化学习遗憾界引入了一种常数感知的比较协议,为通信MDP导出了显式的有限下界证书,并改进了已发表的系数。

0 人收藏 0 人点赞
#mdps

有限时域马尔可夫决策过程中自然策略梯度的有限时间分析

arXiv cs.LG ↗ · 2026-07-28 缓存

本文首次为有限时域马尔可夫决策过程中的自然策略梯度算法提供了有限时间收敛保证,证明了在不同步长策略下的次线性和线性收敛速度。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈