stochastic-control

标签

Cards List
#stochastic-control

从离散到连续:连续环境中神经强化学习的动力学

arXiv cs.LG · 2026-06-04 缓存

本文提出了一个用于连续环境中深度强化学习的理论框架,利用随机控制理论将其建模为连续时间随机过程。作者刻画了在两层网络无限宽极限下的演员-评论家算法的动力学,并推导了一个在极小的学习率下状态分布无穷小变化的方程。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈