关于通过元强化学习学习探索的一些思考
摘要
OpenAI研究人员引入了E-MAML和E-RL²两种元强化学习算法,旨在改进需要大量探索来发现最优策略的任务中的探索性能。该工作展示了这些算法在包括Krazy World和迷宫任务在内的新颖环境中的有效性。
暂无内容
查看缓存全文
缓存时间: 2026/04/20 14:45
# 关于通过元强化学习学习探索的若干思考
来源: https://openai.com/index/some-considerations-on-learning-to-explore-via-meta-reinforcement-learning/
OpenAI
## 摘要
我们研究了元强化学习中的探索问题。提出了两个新的元强化学习算法:E-MAML 和 E-RL2。我们在一个新型环境"Krazy World"以及一系列迷宫环境上呈现了结果。我们展示了 E-MAML 和 E-RL2 在探索至关重要的任务上提供了更好的性能。
- 学习范式 (https://openai.com/research/index/?tags=learning-paradigms)
## 作者
Bradly Stadie, Ge Yang, Rein Houthooft, Xi Chen, Yan Duan, Yuhuai Wu, Pieter Abbeel, Ilya Sutskever
相似文章
学习探索:通过探索感知策略优化扩展代理推理
本文提出一种探索感知的强化学习框架,使LLM代理仅在不确定性高时自适应探索,从而提升在基于文本和基于GUI的基准测试上的性能。
@ethantsliu:meta-rl 引发代理式 LLM 探索 传统强化学习训练 LLM 代理使用固定策略,难以进行主动探索……
一篇新的研究论文将 LLM 代理训练重新定义为跨回合的 Meta-RL 问题,使用无评论家策略梯度实现在上下文中的适应,而无需梯度更新。LAMER 框架在长时程任务上相比标准 RL 基线将测试时性能提升了 11-19%,并且能更好地泛化到未见过的环境。
MetaResearcher:在对抗性虚拟环境中通过自我反思强化学习扩展深度研究
MetaResearcher 提出了一种框架,用于在对抗性虚拟环境中通过自我反思强化学习训练深度研究智能体,解决了静态环境和仅事实检索任务的局限性。
ExpRL:面向LLM中期训练的探索式强化学习
ExpRL是一种新的基于强化学习的中期训练方法,它使用人工编写的参考答案作为密集奖励支架(从未向策略展示),从而提升LLM推理能力,在AIME-2026等困难数学基准上取得了显著提升。
基于重试的策略梯度强化学习中探索的涌现
本文提出ReMax,一种新的强化学习目标函数,通过基于多个样本的期望最大回报来评估策略,从而将探索作为涌现属性引入,无需显式的探索奖励。作者推导了策略梯度公式,并提出了RePPO,一种PPO变体,在MinAtar和Craftax基准测试上实现了高效探索。