model-free-rl

标签

Cards List
#model-free-rl

表示学习助力可扩展多任务深度强化学习

arXiv cs.LG · 2026-06-05 缓存

本文认为,表示学习(而非基于模型的规划)是可扩展多任务深度强化学习的关键。文章介绍了MR.Q,一种简单的无模型算法,通过辅助预测目标,在多种连续控制任务上优于之前基于世界模型的方法。

0 人收藏 0 人点赞
#model-free-rl

策略梯度与软Q学习之间的等价性

OpenAI Blog · 2017-04-21 缓存

# 策略梯度与软Q学习之间的等价性 来源:[https://openai.com/index/equivalence-between-policy-gradients-and-soft-q-learning/](https://openai.com/index/equivalence-between-policy-gradients-and-soft-q-learning/) OpenAI ## 摘要 策略梯度方法和Q学习方法是无模型强化学习中两种主要方法。Q学习方法在有效时样本效率很高,但目前还不太清楚它们为什么能够工作

0 人收藏 0 人点赞
← 返回首页

提交意见反馈