stochastic-policy

标签

Cards List
#stochastic-policy

QuantFPFlow:连续强化学习中的Fokker-Planck策略优化的量子振幅估计

arXiv cs.LG · 2026-05-19 缓存

介绍QuantFPFlow,一种强化学习框架,利用量子振幅估计在连续控制的Fokker-Planck配分函数估计中实现二次加速,从而改善探索并避免局部最优。

0 人收藏 0 人点赞
#stochastic-policy

最大熵如何使强化学习更加稳健

ML at Berkeley · 2021-07-26 缓存

本文解释了将香农熵纳入强化学习目标函数,如何创造出更稳健的智能体,使其能够应对奖励和动态环境中出现的意外甚至对抗性变化。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈