收集人类反馈
摘要
OpenAI 发布了 RL-Teacher,这是一个开源工具,可以通过人类反馈而不是手工设计的奖励函数来训练 AI 系统,应用于安全 AI 开发和复杂强化学习问题。
RL-Teacher 是我们的开源实现,用于通过偶尔的人类反馈而不是手工设计的奖励函数来训练 AI。这项底层技术是作为实现安全 AI 系统的一步开发的,但也适用于奖励难以指定的强化学习问题。
查看缓存全文
缓存时间: 2026/04/20 14:56
# 收集人类反馈
来源:https://openai.com/index/gathering-human-feedback/
OpenAI RL-Teacher 是我们接口的开源实现,用于通过偶尔的人类反馈而非手工制作的奖励函数来训练 AI。这项基础技术是在开发安全 AI 系统过程中的一个步骤,但也适用于难以明确指定奖励的强化学习问题。
人类可以通过简单的网页界面(如上所示)提供反馈,该界面可以在本地运行(不推荐)或在单独的机器上运行。完整文档可在项目的 [GitHub 存储库](https://github.com/nottombrown/rl-teacher)(在新窗口中打开)获得。我们很期待看到 AI 研究人员和工程师们如何使用这项技术——请[与我们联系](mailto:[email protected]?Subject=RL_Teacher)分享任何实验结果!
相似文章
从人类偏好中学习
OpenAI 提出了一种使用人类偏好反馈训练 AI 智能体的方法,智能体通过人类对行为轨迹的比较来学习奖励函数,并使用强化学习来优化推断的目标。该方法展示了很强的样本效率,需要少于 1000 比特的人类反馈就能训练智能体完成后翻。
@OpenAI: 我们也有三家第三方AI安全组织对我们的分析提供了反馈:@redwood_ai, @apolloaievals, @M…
OpenAI在强化学习训练中意外允许评分人员看到思考链;Redwood Research审阅其分析后发现,证据在很大程度上消除了对危险影响的担忧,但仍存在轻微风险。
利用人工智能进行教学
OpenAI分享了教育工作者关于将ChatGPT等人工智能工具融入教学的观点,包括利用AI提供语言支持以及教导学生批判性思考AI生成内容的方法。
OpenAI Gym Beta
OpenAI 发布了 OpenAI Gym 公开测试版,这是一个用于开发和比较强化学习算法的工具包,包含不断增长的环境套件和可复现研究的平台。该工具包旨在标准化强化学习基准,并为研究社区提供多样化、易于使用的环境。
@TheTuringPost: 用于 Agent RL 栈的 10 个开源工具 ↓ OpenPipe ART verl-agent Agent Lightning Unsloth OpenRLHF SkyRL NVIDIA’s P…
精心整理的 10 个用于通过强化学习训练 AI Agent 的开源工具,涵盖 OpenPipe ART、verl-agent、Agent Lightning 和 Unsloth 等框架,并介绍了各工具的使用场景和优势。