收集人类反馈

OpenAI Blog 工具

摘要

OpenAI 发布了 RL-Teacher,这是一个开源工具,可以通过人类反馈而不是手工设计的奖励函数来训练 AI 系统,应用于安全 AI 开发和复杂强化学习问题。

RL-Teacher 是我们的开源实现,用于通过偶尔的人类反馈而不是手工设计的奖励函数来训练 AI。这项底层技术是作为实现安全 AI 系统的一步开发的,但也适用于奖励难以指定的强化学习问题。
查看原文
查看缓存全文

缓存时间: 2026/04/20 14:56

# 收集人类反馈 来源:https://openai.com/index/gathering-human-feedback/ OpenAI RL-Teacher 是我们接口的开源实现,用于通过偶尔的人类反馈而非手工制作的奖励函数来训练 AI。这项基础技术是在开发安全 AI 系统过程中的一个步骤,但也适用于难以明确指定奖励的强化学习问题。 人类可以通过简单的网页界面(如上所示)提供反馈,该界面可以在本地运行(不推荐)或在单独的机器上运行。完整文档可在项目的 [GitHub 存储库](https://github.com/nottombrown/rl-teacher)(在新窗口中打开)获得。我们很期待看到 AI 研究人员和工程师们如何使用这项技术——请[与我们联系](mailto:[email protected]?Subject=RL_Teacher)分享任何实验结果!

相似文章

从人类偏好中学习

OpenAI Blog

OpenAI 提出了一种使用人类偏好反馈训练 AI 智能体的方法,智能体通过人类对行为轨迹的比较来学习奖励函数,并使用强化学习来优化推断的目标。该方法展示了很强的样本效率,需要少于 1000 比特的人类反馈就能训练智能体完成后翻。

利用人工智能进行教学

OpenAI Blog

OpenAI分享了教育工作者关于将ChatGPT等人工智能工具融入教学的观点,包括利用AI提供语言支持以及教导学生批判性思考AI生成内容的方法。

OpenAI Gym Beta

OpenAI Blog

OpenAI 发布了 OpenAI Gym 公开测试版,这是一个用于开发和比较强化学习算法的工具包,包含不断增长的环境套件和可复现研究的平台。该工具包旨在标准化强化学习基准,并为研究社区提供多样化、易于使用的环境。