必须快速学习:强化学习泛化能力的新基准

OpenAI Blog 论文

摘要

OpenAI 推出了一个基于音速小子(Sonic the Hedgehog)的新型强化学习基准,用于测量 RL 智能体的迁移学习和小样本学习性能,同时包括基线算法的评估。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/04/20 14:45

# Gotta Learn Fast: 强化学习泛化能力新基准 来源: https://openai.com/index/gotta-learn-fast/ OpenAI ## 摘要 本报告介绍了一个基于《刺猬索尼克™》视频游戏系列的新强化学习(RL)基准。该基准旨在衡量迁移学习和少样本学习算法在强化学习领域的性能。我们还在新基准上提出并评估了一些基线算法。

相似文章

从仿真泛化

OpenAI Blog

# 从仿真泛化 来源: [https://openai.com/index/generalizing-from-simulation/](https://openai.com/index/generalizing-from-simulation/) 仿真机器人的强化学习成果充斥市场,这可能会给人一种印象,即强化学习能轻松解决大多数机器人任务。但常见的强化学习算法只在那些对动作的小幅扰动能带来奖励增量变化的任务中表现良好。一些机器人任务具有简单的奖励函数,比如行走任务,可以根据行进距离来评分

复古竞赛

OpenAI Blog

OpenAI 推出了复古竞赛(Retro Contest),这是一项迁移学习竞赛,在来自经典 SEGA Genesis 游戏的未见过的视频游戏关卡上评估强化学习算法,于 2018 年 4 月至 6 月期间进行。该竞赛使用 Gym Retro 平台,包括基准实现和技术基准论文,证明当前的强化学习算法在泛化任务上的表现明显低于人类。

深度强化学习中的安全探索基准测试

OpenAI Blog

OpenAI 提议将约束强化学习标准化作为安全探索的形式化框架,并推出 Safety Gym——一个用于评估高维连续控制任务中安全深度强化学习算法的基准测试套件,这些任务包含安全约束。

GRLO:从零开始迈向开放环境下的通用强化学习

arXiv cs.LG

GRLO 提出了一种新颖的强化学习后训练方法,仅使用 5000 条提示和 22.7 GPU 小时,就在多个领域(数学、代码等)实现了强大的泛化能力,在效率和数据需求上显著优于领域内的 RLVR 基线。