@akshay_pachaar: Karpathy关于强化学习的预测正在成真!他指出奖励函数不可靠,并认为单一的奖励…

X AI KOLs Following 工具

摘要

Karpathy对强化学习中奖励函数的批评被OpenPipe的ART框架通过RULER解决,该框架允许使用自然语言定义奖励并由LLM评估,取代了手动奖励工程。

Karpathy关于强化学习的预测正在成真! 他指出奖励函数不可靠,并认为对于复杂任务,单一的奖励数值维度太低,无法教会智能体什么是“好”。要解决这个问题,智能体需要知识引导的审查作为更高维度的反馈通道。 如今,每个主要AI实验室都在用强化学习训练模型(OpenAI、Anthropic、DeepSeek)。 而它们的关键瓶颈始终是奖励函数。 DeepSeek的GRPO在数学和代码任务上表现良好,因为环境提供了二元信号。 但对于真实的智能体任务,仍然需要有人手动编写评分函数。这需要数天时间,并且每次流程变更时都要重写。 RULER(实现在OpenPipe ART中,10k星)正是解决了Karpathy指出的问题。 奖励标准用自然语言定义,然后LLM根据该描述评估每个轨迹,为训练提供反馈。 我使用GRPO和这个工作流训练了一个Qwen3 1.4B智能体来玩2048游戏。 在这个例子中,智能体观察棋盘,选择一个方向,RULER评估结果——全部基于这个自然语言定义。 你可以在GitHub上看到完整实现,并亲自尝试。 这是ART仓库:http://github.com/OpenPipe/ART (别忘了给它点个星哦 ) 就像RLHF取代了手动排序、GRPO取代了评论家模型一样,自然语言奖励正在取代手动编码的评分函数。 强化学习奖励工程现在变成了提示工程。 我写了一篇关于OpenPipe ART的完整教程,这是一个基于GRPO的智能体强化学习训练器,包括RULER如何用自动的LLM评分奖励取代手动奖励工程。 文章引用如下。
查看原文
查看缓存全文

缓存时间: 2026/06/20 14:36

Agent Reinforcement Trainer

使用GRPO训练面向真实任务的多步骤智能体。

相似文章

@tanayj: https://x.com/tanayj/status/2072766211256119475

X AI KOLs Timeline

本文探讨了将强化学习应用于缺乏明确可验证性任务的挑战,引用了Dario Amodei关于实现“数据中心中的天才之国”的预测,并讨论了RLVR、RLHF、Constitutional AI以及Scale AI的基于规则的奖励等技术。

野外中的错误奖励函数

OpenAI Blog

OpenAI 讨论了强化学习中错误奖励函数的问题,其中智能体会利用奖励规范中的漏洞,而不是实现预期目标。本文通过赛车游戏示例探索了这一问题,并提出了包括从演示学习、人类反馈和迁移学习等研究方向,以减轻此类问题。