@TheTuringPost: 用于 Agent RL 栈的 10 个开源工具 ↓ OpenPipe ART verl-agent Agent Lightning Unsloth OpenRLHF SkyRL NVIDIA’s P…
摘要
精心整理的 10 个用于通过强化学习训练 AI Agent 的开源工具,涵盖 OpenPipe ART、verl-agent、Agent Lightning 和 Unsloth 等框架,并介绍了各工具的使用场景和优势。
查看缓存全文
缓存时间: 2026/06/22 03:36
以下是10个用于Agent强化学习栈的开源工具 ↓
OpenPipe ART verl-agent Agent Lightning Unsloth OpenRLHF SkyRL NVIDIA Polar Agent-R1 RAGEN Marti
请收藏本列表,查看链接、用例及每个工具在Agent RL栈中的位置 → https://turingpost.com/p/agent-rl-training-tools…
Agent RL训练框架:10个必知的开源工具
来源:https://www.turingpost.com/p/agent-rl-training-tools 本周,面向AI智能体的强化学习(RL)(https://www.turingpost.com/p/rlguide) 再次掀起热潮,尤其是 GRPO(https://www.turingpost.com/p/grpo)。因此,我们觉得有必要整理出最相关的开源工具,方便大家用于构建、训练和优化自己的智能体。
TL;DR:****Agent RL训练框架通过轨迹、奖励、工具使用和环境交互来提升AI智能体。有些专注于GRPO和RLHF,有些则专注于可扩展的 rollout、多轮智能体、长周期任务或多智能体工作流。具体选择取决于你的智能体栈。→
框架
最佳适用场景
主要优势
OpenPipe ART
面向智能体的GRPO训练
为多步智能体提供符合人体工程学的RL循环
verl-agent
可扩展的长周期智能体
基于veRL构建,支持PPO、GRPO、DAPO、RLOO、REINFORCE++
Agent Lightning
现有智能体栈
无需重写智能体即可添加RL
Unsloth
本地微调和GRPO
消费级GPU友好的训练和导出
OpenRLHF
分布式RLHF和智能体RL
Ray、vLLM、DeepSpeed、PPO、GRPO、RLOO
SkyRL
端到端智能体RL栈
训练、推理、环境和评估
NVIDIA Polar
Rollout编排
让现有智能体框架具备RL能力
Agent-R1
步骤级MDP智能体训练
显式的观察-行动-奖励转换
RAGEN
轨迹级智能体RL
奖励质量和推理崩溃的诊断
Marti
多智能体RL工作流
辩论、智能体链、智能体混合
1. OpenPipe ART(智能体强化训练器)
一个通过GRPO让智能体在经验与环境交互中学习多步操作的强化训练器。你的应用定义任务和奖励,ART负责处理RL循环:推理、轨迹评分、GRPO优化、检查点和LoRA更新。
- 何时使用: 如果你需要一个人体工学设计的、面向智能体的GRPO框架,而非通用RLHF栈,这是个好选择。适用于多步任务,如工具使用、邮件搜索、MCP、游戏和推理工作流。
2. verl-agent
一个智能体RL框架,是字节跳动veRL(火山引擎RL)的扩展——veRL是用于后训练LLM的RL训练库,支持PPO、GRPO、DAPO、RLOO和REINFORCE++算法。而verl-agent专门用于训练多步LLM智能体,采用逐步智能体-环境交互,带有可定制记忆和每步输入。
- 何时使用: 当训练需要执行大量动作的智能体时(如网页浏览、工具使用、搜索、GUI自动化或具身任务),且需要高度可扩展的长周期训练和优化时,选择此框架。
3. Agent Lightning
无需重写智能体即可通过RL训练AI智能体。微软的这个工具可与主流智能体框架(如LangChain、OpenAI Agents SDK、AutoGen、CrewAI和Microsoft Agent Framework)配合使用,通过RL、SFT等方法收集轨迹并优化提示或策略。
- 何时使用: 如果你想用RL改进现有智能体而无需重建栈,这是一个不错的选择。适用于单智能体和多智能体系统。
4. Unsloth
一个本地UI,用于运行、微调和RL训练LLM、VLM、音频和嵌入模型。它将推理、数据集创建、微调、基于GRPO的强化学习、模型导出和监控整合在一个界面中,并通过自定义内核和优化减少训练内存需求。
Unsloth主要是一个模型训练工具包,但也可以使用GRPO等RL算法训练智能体模型,并支持工具调用、长上下文RL和多模态智能体。
- 何时使用: 特别适用于LoRA微调、GRPO/RL训练、数据集准备以及在消费级GPU或Apple Silicon上进行模型实验。如果你希望以简单方式运行和训练开放模型,这是个好选择。
5. OpenRLHF
一个基于Ray、vLLM和DeepSpeed的高性能RLHF框架。支持PPO、GRPO、REINFORCE++、RLOO、奖励建模,并通过统一的基于智能体的执行流水线支持单轮和多轮智能体训练。
- 何时使用: 如果你需要大规模模型的可扩展RLHF或智能体训练栈,这个框架很好用。特别适用于分布式RL训练、自定义奖励函数、多轮智能体以及使用Ray和vLLM的生产级工作负载。
6. SkyRL
一个模块化的全栈LLM RL框架,将训练、推理、智能体训练和RL环境整合在同一生态系统中。包含RL训练(SkyRL)、长周期智能体优化(SkyRL-Agent)和基于Gymnasium的环境(SkyRL-Gym)等组件。
- 何时使用: 如果你想获得一个端到端栈来训练和评估使用工具的智能体,尤其适用于长周期智能体RL、多轮工作流、SWE-Bench风格任务以及用Gymnasium构建自定义环境。
7. NVIDIA Polar
严格来说,这是一个rollout系统,但它出现在这个列表中很有意思,因为它能将现有智能体框架转变为RL就绪的环境,无需修改代码。它通过服务器架构提供rollout编排、轨迹构建、评估和可扩展的分布式执行。
- 何时使用: 如果你已有智能体系统,需要为RL训练提供可扩展的rollout,特别是多步任务以及与Slime、verl或NeMoRL等训练器的集成,那么Polar非常有用。
8. Agent-R1
训练多步LLM智能体,将每个智能体动作视为步骤级MDP转换。它显式建模观察、动作、工具反馈、奖励和环境状态,而不是优化单个不断增长的提示。
- 何时使用: 适用于训练使用工具或与环境交互且需要多步推理的智能体。
9. RAGEN
基于StarPO算法,优化完整的推理和行动轨迹。它内置环境(WebShop、SearchQA、DeepCoder、Lean、数独、推箱子)以及用于分析智能体RL失败模式(如推理崩溃和奖励质量差)的诊断工具。
- 何时使用: 当你想理解RL训练成功或失败的原因,并且需要多轮智能体训练和轨迹级优化时使用。
10. Marti
一个多智能体RL训练框架,支持基于图的智能体工作流——辩论、智能体链、智能体混合,结合了集中式协调和跨多个智能体的分布式策略训练。
- 何时使用: 适用于基于树搜索的RL、智能体推理、代码生成、辩论式工作流以及异构智能体团队。
❝
如果你觉得这份列表有用,欢迎免费订阅我们的通讯。
别忘了查看我们关于强化学习和GRPO的深度指南,了解基础知识和高级方法。希望对你有所帮助!
FAQ
什么是智能体RL训练框架?
智能体RL训练框架是一种使用强化学习改进AI智能体的工具。它通常收集轨迹,用奖励对动作或结果进行评分,并根据任务表现更新模型、策略、提示、LoRA适配器或智能体行为。
何时应该使用智能体RL而不是监督微调?
当任务依赖于多步行为、工具调用、环境反馈或最终结果(这些更容易通过奖励来优化而非模仿)时,使用智能体RL。如果你已经有高质量的目标行为示例,则监督微调更合适。
RLHF和智能体RL有什么区别?
RLHF通常使模型响应与人类偏好对齐,往往在单轮或对话场景中。智能体RL则训练跨多步轨迹的行为,模型可能会调用工具、观察结果、更新记忆、重试动作,并随时间优化任务成功率。
应该选择哪个智能体RL框架?
对于易于上手的GRPO风格实验,选择ART或Unsloth;对于可扩展训练,选择verl-agent或OpenRLHF;如果已在使用智能体框架,选择Agent Lightning;对于rollout选择Polar;对于诊断选择RAGEN;对于全栈环境选择SkyRL;对于多智能体工作流选择Marti。
为什么智能体RL框架很重要?
它们之所以重要,是因为智能体不再只是聊天机器人。它们浏览网页、编写代码、搜索信息、使用工具、控制环境,并与其他智能体协作。训练这些系统需要来自完整轨迹的反馈,而不仅仅是孤立的提示-响应对。
相似文章
@TheTuringPost: 2026年AI Agent堆栈 OpenClaw → 本地代理作为个人控制平面 Hermes Agent → 具备自我改进能力的本地代理…
本文总结了2026年AI Agent的格局,重点介绍了像OpenClaw和Hermes这样的本地代理、自我改进循环、用于物理AI的VLA模型,以及可信代理系统基础设施日益增长的重要性。
保持 Token 流动:16 个开源 RL 库的经验教训
Hugging Face 发布了对 16 个开源强化学习库的全面分析,研究异步 RL 训练的架构模式,并为 TRL 的异步训练器设计经验教训,以解决生成瓶颈和权重同步挑战。
Show HN:我通过强化学习训练了一个智能体,它再用强化学习训练模型(花费 –$1.3k)
一位开发者构建了一个管道,其中经过强化学习训练的AI智能体创建并提交针对小模型的强化学习训练任务,并根据智能体的表现给予奖励。该项目完全开源,并展示了向保留任务的迁移能力。
@loganthorneloe: https://x.com/loganthorneloe/status/2075684831233757275
本周精选五篇值得关注的AI文章,涵盖自我改进代理、Bun向Rust迁移、vLLM架构、编码评估基准以及代理自主性等级。
@tom_doerr: 使用强化学习构建自定义AI代理 https://github.com/agentica-project/rllm…
rLLM 是一个开源框架,通过强化学习对语言代理进行后训练,其发布的重要模型如 DeepSWE-Preview 和 DeepCoder-14B-Preview 取得了最先进的结果。