Procgen Benchmark
摘要
OpenAI推出Procgen Benchmark,这是一套程序生成的环境套件,旨在评估强化学习智能体在多样化任务中的泛化能力,解决Atari等传统基准中的过拟合问题。
我们发布了Procgen Benchmark,这是16个易于使用的程序生成环境,可直接测量强化学习智能体学习可泛化技能的速度。
查看缓存全文
缓存时间: 2026/04/20 14:55
# Procgen基准
来源:https://openai.com/index/procgen-benchmark/
在[多个](https://arxiv.org/abs/1804.06893)[环境](https://arxiv.org/abs/1806.10729)中,已经观察到智能体可能会过度拟合到非常大的训练集。这些证据表明,过度拟合在经典基准(如[雅达利学习环境](https://arxiv.org/abs/1207.4708))中普遍存在,而该基准长期以来一直被视为强化学习(RL)的黄金标准。虽然ALE中不同游戏之间的多样性是该基准最大的优势之一,但对泛化能力的重视不足是一个重大缺陷。对于每款游戏,必须提出一个问题:智能体是否在稳健地学习相关技能,还是在大致记忆特定的轨迹?
[CoinRun](https://openai.com/index/quantifying-generalization-in-reinforcement-learning/)的设计就是为了解决这个问题,它使用程序生成来构造不同的训练关卡集和测试关卡集。虽然CoinRun帮助我们更好地量化RL中的泛化,但它仍然只是一个单一环境。CoinRun可能无法完全代表RL智能体必须面临的众多挑战。我们希望两全其美:一个由许多不同环境组成的基准,每个环境都从根本上需要泛化能力。为了满足这一需求,我们创建了Procgen基准。CoinRun现在成为Procgen基准中的首个环境,将其多样性贡献给更大的整体。
包括[障碍塔挑战](https://arxiv.org/abs/1902.01378)和[通用视频游戏AI框架](https://arxiv.org/abs/1802.10363)在内的先前工作也鼓励使用程序生成来更好地评估RL中的泛化能力。我们设计的环境秉承类似的精神,其中两个Procgen环境直接受到[基于GVGAI工作](https://arxiv.org/abs/1806.10729)的启发。其他环境如Dota和StarCraft也提供了大量的环境内复杂性,但这些环境很难快速迭代(同时很难同时使用多个这样的环境)。通过Procgen基准,我们努力实现以下所有目标:实验便利性、环境内的高多样性和环境间的高多样性。
我们发现在几乎所有环境中,智能体都会强烈过度拟合小训练集。在某些情况下,智能体需要访问多达10,000个关卡才能弥补泛化差距。我们还在许多环境中看到了一个奇特的趋势:超过某个阈值后,训练关卡集增加时训练性能会提高!这与监督学习中的趋势相反,在监督学习中,训练性能通常会随着训练集大小的增加而下降。我们相信这种训练性能的提升来自于多样化关卡集提供的隐式课程。如果智能体学会了跨训练集中的关卡进行泛化,更大的训练集可以提高训练性能。我们之前在CoinRun中注意到了这种效果,并发现它在许多Procgen环境中也经常出现。
相似文章
GeneBench-Pro 介绍
OpenAI 推出 GeneBench-Pro,这是一个研究级基准,旨在测试 AI 代理在计算生物学中进行需要大量判断的分析的能力,涵盖基因组学、定量生物学和转化医学。
@OpenAI: 我们正在推出GeneBench-Pro,这是一个研究级基准测试,用于衡量一种更难实现的AI进步:智能体在导航…
OpenAI推出了GeneBench-Pro,这是一个研究级基准测试,用于测试AI智能体在计算生物学中导航混乱的生物数据、选择分析路径以及做出判断的能力。
Procgen 和 MineRL 竞赛
OpenAI 联合组织 MineRL 2020 竞赛,推进样本高效的强化学习算法研究,这些算法能够利用人类示范。参赛者需要在仅有 800 万个模拟器样本和 4 天单 GPU 训练时间的限制下,在 Minecraft 中获得钻石,同时可以访问 6000 多万帧的人类示范数据集。
深入解读GeneBench-Pro
GeneBench-Pro 是 OpenAI 推出的一项全面基准测试,旨在评估人工智能模型在复杂基因组学任务上的表现,包括体细胞肿瘤学、功能基因组学以及临床携带者筛查。
历经考验:在陌生环境中重新评估智能体的能力
GauntletBench是一个新的基于网页的基准测试,用于评估AI智能体在挑战性场景中的表现,重点关注时间感知、图形理解和3D推理。结果表明,最先进的智能体成功率仅为19.1%,而非专业人士则超过80%,凸显了当前智能体系统的显著局限性。