@a_karvonen:Jerry Tworek 讲述了让 RL 在 o1 上工作所需的条件。听起来很像现代的 GRPO 配方:"Everyone already…

X AI KOLs Timeline 新闻

摘要

Jerry Tworek 讨论了将强化学习应用于扩展 AI 模型(如 o1)的技术见解和挑战,强调了简单性和多次运行等技术的重要性。

Jerry Tworek 讲述了让 RL 在 o1 上工作所需的条件。听起来很像现代的 GRPO 配方: "如今,大家从高层次上大致都了解这个公式,也就是说,需要从环境中获得奖励的想法并不是特别新颖。RL 中的奖励机制已经存在很长时间了。 但许多困难在于,例如,对于单个提示进行多次运行以构建基线这个简单想法,实际上非常、非常强大,这很有帮助。 数值稳定性方面有很多要考虑的。为了让算法更好地工作和扩展,必须从 PPO 中移除一些东西。 始终存在这样一种观念:简单性是使扩展成功的关键。你的算法需要简单。所以,你知道,如今用于扩展的算法集实际上在多个方面就是如此简单。 但这正是我能够实现扩展的原因。"
查看原文
查看缓存全文

缓存时间: 2026/09/07 19:11

Jerry Tworek 谈及让强化学习在 o1 上生效所需的要素,这听起来很像现代的 GRPO 配方:

“每个人如今大致上都从高层了解这个公式,也就是说,你需要从环境中获得奖励的想法并不特别新鲜。强化学习中的奖励已经存在很长时间了。

但许多困难在于,比如,这个简单的想法——对单个提示进行多次推演以建立基线——是一个非常、非常强大的方法,这帮助很大。

这涉及大量数值稳定性问题。为了让算法更好运行和扩展,有些内容必须从 PPO 中移除。

人们总认为简洁性才是实现扩展的关键。你的算法必须简单。因此,如今用于扩展的那套算法实际上在多个层面都做到了简洁。

但这就是我能够成功扩展的方法。”

相似文章