标签
这篇来自MIT的论文提出了一种对抗式生成器-判别器框架,将可验证奖励与从人类示范中学习到的信号相结合,以解决语言模型RLVR训练中的多样性崩溃、不自然响应和奖励黑客等问题。
一篇研究论文,将少量人类演示作为正则化目标与自对弈强化学习相结合,从而使用极少的人类数据(30分钟对比数千小时)并在单个消费级GPU上训练15小时,实现与人类兼容的驾驶策略。
OpenAI 联合组织 MineRL 2020 竞赛,推进样本高效的强化学习算法研究,这些算法能够利用人类示范。参赛者需要在仅有 800 万个模拟器样本和 4 天单 GPU 训练时间的限制下,在 Minecraft 中获得钻石,同时可以访问 6000 多万帧的人类示范数据集。