@TheTuringPost: 用于 Agent RL 栈的 10 个开源工具 ↓ OpenPipe ART verl-agent Agent Lightning Unsloth OpenRLHF SkyRL NVIDIA’s P…

X AI KOLs Timeline 新闻

摘要

精心整理的 10 个用于通过强化学习训练 AI Agent 的开源工具,涵盖 OpenPipe ART、verl-agent、Agent Lightning 和 Unsloth 等框架,并介绍了各工具的使用场景和优势。

用于 Agent RL 栈的 10 个开源工具 ↓ OpenPipe ART verl-agent Agent Lightning Unsloth OpenRLHF SkyRL NVIDIA’s Polar Agent-R1 RAGEN Marti 收藏此列表,并查看以下链接、使用场景以及每个工具在 Agent RL 栈中的位置 → https://turingpost.com/p/agent-rl-training-tools…
查看原文
查看缓存全文

缓存时间: 2026/06/22 03:36

以下是10个用于Agent强化学习栈的开源工具 ↓

OpenPipe ART verl-agent Agent Lightning Unsloth OpenRLHF SkyRL NVIDIA Polar Agent-R1 RAGEN Marti

请收藏本列表,查看链接、用例及每个工具在Agent RL栈中的位置 → https://turingpost.com/p/agent-rl-training-tools…


Agent RL训练框架:10个必知的开源工具

来源:https://www.turingpost.com/p/agent-rl-training-tools 本周,面向AI智能体的强化学习(RL)(https://www.turingpost.com/p/rlguide) 再次掀起热潮,尤其是 GRPO(https://www.turingpost.com/p/grpo)。因此,我们觉得有必要整理出最相关的开源工具,方便大家用于构建、训练和优化自己的智能体。

TL;DR:****Agent RL训练框架通过轨迹、奖励、工具使用和环境交互来提升AI智能体。有些专注于GRPO和RLHF,有些则专注于可扩展的 rollout、多轮智能体、长周期任务或多智能体工作流。具体选择取决于你的智能体栈。

框架

最佳适用场景

主要优势

OpenPipe ART

面向智能体的GRPO训练

为多步智能体提供符合人体工程学的RL循环

verl-agent

可扩展的长周期智能体

基于veRL构建,支持PPO、GRPO、DAPO、RLOO、REINFORCE++

Agent Lightning

现有智能体栈

无需重写智能体即可添加RL

Unsloth

本地微调和GRPO

消费级GPU友好的训练和导出

OpenRLHF

分布式RLHF和智能体RL

Ray、vLLM、DeepSpeed、PPO、GRPO、RLOO

SkyRL

端到端智能体RL栈

训练、推理、环境和评估

NVIDIA Polar

Rollout编排

让现有智能体框架具备RL能力

Agent-R1

步骤级MDP智能体训练

显式的观察-行动-奖励转换

RAGEN

轨迹级智能体RL

奖励质量和推理崩溃的诊断

Marti

多智能体RL工作流

辩论、智能体链、智能体混合

1. OpenPipe ART(智能体强化训练器)

一个通过GRPO让智能体在经验与环境交互中学习多步操作的强化训练器。你的应用定义任务和奖励,ART负责处理RL循环:推理、轨迹评分、GRPO优化、检查点和LoRA更新。

  • 何时使用: 如果你需要一个人体工学设计的、面向智能体的GRPO框架,而非通用RLHF栈,这是个好选择。适用于多步任务,如工具使用、邮件搜索、MCP、游戏和推理工作流。

2. verl-agent

一个智能体RL框架,是字节跳动veRL(火山引擎RL)的扩展——veRL是用于后训练LLM的RL训练库,支持PPO、GRPO、DAPO、RLOO和REINFORCE++算法。而verl-agent专门用于训练多步LLM智能体,采用逐步智能体-环境交互,带有可定制记忆和每步输入。

  • 何时使用: 当训练需要执行大量动作的智能体时(如网页浏览、工具使用、搜索、GUI自动化或具身任务),且需要高度可扩展的长周期训练和优化时,选择此框架。

3. Agent Lightning

无需重写智能体即可通过RL训练AI智能体。微软的这个工具可与主流智能体框架(如LangChain、OpenAI Agents SDK、AutoGen、CrewAI和Microsoft Agent Framework)配合使用,通过RL、SFT等方法收集轨迹并优化提示或策略。

  • 何时使用: 如果你想用RL改进现有智能体而无需重建栈,这是一个不错的选择。适用于单智能体和多智能体系统。

4. Unsloth

一个本地UI,用于运行、微调和RL训练LLM、VLM、音频和嵌入模型。它将推理、数据集创建、微调、基于GRPO的强化学习、模型导出和监控整合在一个界面中,并通过自定义内核和优化减少训练内存需求。

Unsloth主要是一个模型训练工具包,但也可以使用GRPO等RL算法训练智能体模型,并支持工具调用、长上下文RL和多模态智能体。

  • 何时使用: 特别适用于LoRA微调、GRPO/RL训练、数据集准备以及在消费级GPU或Apple Silicon上进行模型实验。如果你希望以简单方式运行和训练开放模型,这是个好选择。

5. OpenRLHF

一个基于Ray、vLLM和DeepSpeed的高性能RLHF框架。支持PPO、GRPO、REINFORCE++、RLOO、奖励建模,并通过统一的基于智能体的执行流水线支持单轮和多轮智能体训练。

  • 何时使用: 如果你需要大规模模型的可扩展RLHF或智能体训练栈,这个框架很好用。特别适用于分布式RL训练、自定义奖励函数、多轮智能体以及使用Ray和vLLM的生产级工作负载。

6. SkyRL

一个模块化的全栈LLM RL框架,将训练、推理、智能体训练和RL环境整合在同一生态系统中。包含RL训练(SkyRL)、长周期智能体优化(SkyRL-Agent)和基于Gymnasium的环境(SkyRL-Gym)等组件。

  • 何时使用: 如果你想获得一个端到端栈来训练和评估使用工具的智能体,尤其适用于长周期智能体RL、多轮工作流、SWE-Bench风格任务以及用Gymnasium构建自定义环境。

7. NVIDIA Polar

严格来说,这是一个rollout系统,但它出现在这个列表中很有意思,因为它能将现有智能体框架转变为RL就绪的环境,无需修改代码。它通过服务器架构提供rollout编排、轨迹构建、评估和可扩展的分布式执行。

  • 何时使用: 如果你已有智能体系统,需要为RL训练提供可扩展的rollout,特别是多步任务以及与Slime、verl或NeMoRL等训练器的集成,那么Polar非常有用。

8. Agent-R1

训练多步LLM智能体,将每个智能体动作视为步骤级MDP转换。它显式建模观察、动作、工具反馈、奖励和环境状态,而不是优化单个不断增长的提示。

  • 何时使用: 适用于训练使用工具或与环境交互且需要多步推理的智能体。

9. RAGEN

基于StarPO算法,优化完整的推理和行动轨迹。它内置环境(WebShop、SearchQA、DeepCoder、Lean、数独、推箱子)以及用于分析智能体RL失败模式(如推理崩溃和奖励质量差)的诊断工具。

  • 何时使用: 当你想理解RL训练成功或失败的原因,并且需要多轮智能体训练和轨迹级优化时使用。

10. Marti

一个多智能体RL训练框架,支持基于图的智能体工作流——辩论、智能体链、智能体混合,结合了集中式协调和跨多个智能体的分布式策略训练。

  • 何时使用: 适用于基于树搜索的RL、智能体推理、代码生成、辩论式工作流以及异构智能体团队。

如果你觉得这份列表有用,欢迎免费订阅我们的通讯。

别忘了查看我们关于强化学习和GRPO的深度指南,了解基础知识和高级方法。希望对你有所帮助!

FAQ

什么是智能体RL训练框架?

智能体RL训练框架是一种使用强化学习改进AI智能体的工具。它通常收集轨迹,用奖励对动作或结果进行评分,并根据任务表现更新模型、策略、提示、LoRA适配器或智能体行为。

何时应该使用智能体RL而不是监督微调?

当任务依赖于多步行为、工具调用、环境反馈或最终结果(这些更容易通过奖励来优化而非模仿)时,使用智能体RL。如果你已经有高质量的目标行为示例,则监督微调更合适。

RLHF和智能体RL有什么区别?

RLHF通常使模型响应与人类偏好对齐,往往在单轮或对话场景中。智能体RL则训练跨多步轨迹的行为,模型可能会调用工具、观察结果、更新记忆、重试动作,并随时间优化任务成功率。

应该选择哪个智能体RL框架?

对于易于上手的GRPO风格实验,选择ART或Unsloth;对于可扩展训练,选择verl-agent或OpenRLHF;如果已在使用智能体框架,选择Agent Lightning;对于rollout选择Polar;对于诊断选择RAGEN;对于全栈环境选择SkyRL;对于多智能体工作流选择Marti。

为什么智能体RL框架很重要?

它们之所以重要,是因为智能体不再只是聊天机器人。它们浏览网页、编写代码、搜索信息、使用工具、控制环境,并与其他智能体协作。训练这些系统需要来自完整轨迹的反馈,而不仅仅是孤立的提示-响应对。

相似文章

保持 Token 流动:16 个开源 RL 库的经验教训

Hugging Face Blog

Hugging Face 发布了对 16 个开源强化学习库的全面分析,研究异步 RL 训练的架构模式,并为 TRL 的异步训练器设计经验教训,以解决生成瓶颈和权重同步挑战。