@akshay_pachaar: Karpathy关于强化学习的预测正在成真!他指出奖励函数不可靠,并认为单一的奖励…
摘要
Karpathy对强化学习中奖励函数的批评被OpenPipe的ART框架通过RULER解决,该框架允许使用自然语言定义奖励并由LLM评估,取代了手动奖励工程。
Karpathy关于强化学习的预测正在成真!
他指出奖励函数不可靠,并认为对于复杂任务,单一的奖励数值维度太低,无法教会智能体什么是“好”。要解决这个问题,智能体需要知识引导的审查作为更高维度的反馈通道。
如今,每个主要AI实验室都在用强化学习训练模型(OpenAI、Anthropic、DeepSeek)。
而它们的关键瓶颈始终是奖励函数。
DeepSeek的GRPO在数学和代码任务上表现良好,因为环境提供了二元信号。
但对于真实的智能体任务,仍然需要有人手动编写评分函数。这需要数天时间,并且每次流程变更时都要重写。
RULER(实现在OpenPipe ART中,10k星)正是解决了Karpathy指出的问题。
奖励标准用自然语言定义,然后LLM根据该描述评估每个轨迹,为训练提供反馈。
我使用GRPO和这个工作流训练了一个Qwen3 1.4B智能体来玩2048游戏。
在这个例子中,智能体观察棋盘,选择一个方向,RULER评估结果——全部基于这个自然语言定义。
你可以在GitHub上看到完整实现,并亲自尝试。
这是ART仓库:http://github.com/OpenPipe/ART
(别忘了给它点个星哦 )
就像RLHF取代了手动排序、GRPO取代了评论家模型一样,自然语言奖励正在取代手动编码的评分函数。
强化学习奖励工程现在变成了提示工程。
我写了一篇关于OpenPipe ART的完整教程,这是一个基于GRPO的智能体强化学习训练器,包括RULER如何用自动的LLM评分奖励取代手动奖励工程。
文章引用如下。
查看缓存全文
缓存时间: 2026/06/20 14:36
Agent Reinforcement Trainer
使用GRPO训练面向真实任务的多步骤智能体。
相似文章
@adithya_s_k: https://x.com/adithya_s_k/status/2054961319179420035
分析为什么强化学习在编程任务中因可验证奖励而受到青睐,以及新兴框架Harbor如何解决RL训练中环境复杂度的瓶颈。
@tanayj: https://x.com/tanayj/status/2072766211256119475
本文探讨了将强化学习应用于缺乏明确可验证性任务的挑战,引用了Dario Amodei关于实现“数据中心中的天才之国”的预测,并讨论了RLVR、RLHF、Constitutional AI以及Scale AI的基于规则的奖励等技术。
野外中的错误奖励函数
OpenAI 讨论了强化学习中错误奖励函数的问题,其中智能体会利用奖励规范中的漏洞,而不是实现预期目标。本文通过赛车游戏示例探索了这一问题,并提出了包括从演示学习、人类反馈和迁移学习等研究方向,以减轻此类问题。
@bojie_li: 介绍RLVP,Penalize the Path, Reward the Outcome:一篇我与华盛顿大学Noah Shi合作完成的论文…
本文介绍了RLVP(Reward the Outcome, Penalize the Path),一种强化学习方法,它使用可验证的路径违规惩罚和结果奖励,在实现高任务成功率的同时达到接近零的约束违规,提升了实际代理环境中的样本效率。
@dair_ai:MIT推荐的关于可验证奖励强化学习部分的热门文章,大家一直在讨论。RLVR只优化…
这篇来自MIT的论文提出了一种对抗式生成器-判别器框架,将可验证奖励与从人类示范中学习到的信号相结合,以解决语言模型RLVR训练中的多样性崩溃、不自然响应和奖励黑客等问题。