human-demonstrations

标签

Cards List
#human-demonstrations

@dair_ai:MIT推荐的关于可验证奖励强化学习部分的热门文章,大家一直在讨论。RLVR只优化…

X AI KOLs Timeline · 2026-07-03 缓存

这篇来自MIT的论文提出了一种对抗式生成器-判别器框架,将可验证奖励与从人类示范中学习到的信号相结合,以解决语言模型RLVR训练中的多样性崩溃、不自然响应和奖励黑客等问题。

0 人收藏 0 人点赞
#human-demonstrations

@dair_ai: // 自对弈加上一点人类数据 // 结合人类演示和自对弈强化学习的超酷论文。30分钟…

X AI KOLs Following · 2026-06-20 缓存

一篇研究论文,将少量人类演示作为正则化目标与自对弈强化学习相结合,从而使用极少的人类数据(30分钟对比数千小时)并在单个消费级GPU上训练15小时,实现与人类兼容的驾驶策略。

0 人收藏 0 人点赞
#human-demonstrations

Procgen 和 MineRL 竞赛

OpenAI Blog · 2020-06-20 缓存

OpenAI 联合组织 MineRL 2020 竞赛,推进样本高效的强化学习算法研究,这些算法能够利用人类示范。参赛者需要在仅有 800 万个模拟器样本和 4 天单 GPU 训练时间的限制下,在 Minecraft 中获得钻石,同时可以访问 6000 多万帧的人类示范数据集。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈