@a_karvonen:Jerry Tworek 讲述了让 RL 在 o1 上工作所需的条件。听起来很像现代的 GRPO 配方:"Everyone already…
摘要
Jerry Tworek 讨论了将强化学习应用于扩展 AI 模型(如 o1)的技术见解和挑战,强调了简单性和多次运行等技术的重要性。
查看缓存全文
缓存时间: 2026/09/07 19:11
Jerry Tworek 谈及让强化学习在 o1 上生效所需的要素,这听起来很像现代的 GRPO 配方:
“每个人如今大致上都从高层了解这个公式,也就是说,你需要从环境中获得奖励的想法并不特别新鲜。强化学习中的奖励已经存在很长时间了。
但许多困难在于,比如,这个简单的想法——对单个提示进行多次推演以建立基线——是一个非常、非常强大的方法,这帮助很大。
这涉及大量数值稳定性问题。为了让算法更好运行和扩展,有些内容必须从 PPO 中移除。
人们总认为简洁性才是实现扩展的关键。你的算法必须简单。因此,如今用于扩展的那套算法实际上在多个层面都做到了简洁。
但这就是我能够成功扩展的方法。”
相似文章
@eliebakouch: 在GLM-5上进行强化学习所需了解的所有基础设施内容 https://primeintellect.ai/blog/rl-at-1t-scale…
Prime Intellect发布了prime-rl v0.6.0,支持在万亿参数规模的大型Mixture-of-Experts模型上进行高效强化学习,实现低于5分钟的步骤时间,并对异步强化学习进行了优化。
@cwolferesearch: 智能体强化学习需要新的算法改进。在GRPO中,用于训练的“群体”开始发生变化……
本线程讨论了针对智能体强化学习对GRPO的改进,重点介绍了不同层级的优势归一化(提示层级、任务层级、环境层级),以应对多任务、多轮次环境中的高奖励方差。
@QGallouedec: 多轮强化学习中的“tito”问题反复出现。我们研究了一段时间,得出的结论是……
一位开发者分享说,解决多轮强化学习中的“tito”问题比普遍认为的要简单,只需要一个实现规则和一个所有模型已经支持的聊天模板属性。
@lu__jasper: 如果你正开始从SFT转向RL风格的后训练,这些是非常好的实用学习资源,包括…
这条推文推荐了两个资源,用于学习实用的RL后训练技术,重点介绍GRPO++技巧,以增强大语言模型中的强化学习。
@TheTuringPost: 开源代理强化训练器(ART)——将GRPO嵌入任何Python应用 → 您的应用定义任务和奖励…
代理强化训练器(ART)是一个开源框架,将基于GRPO的强化学习嵌入任何Python应用,使代理能够通过环境交互学习,利用轨迹评分和LoRA更新,据称使用Qwen 2.5 14B模型在邮件检索任务上超越OpenAI的o3。