OpenForgeRL:在任何环境中训练基于框架的原生智能体

Hugging Face Daily Papers 论文

摘要

OpenForgeRL 是一个开源框架,用于在各种环境中端到端训练基于框架的AI智能体。它通过轻量级代理和Kubernetes编排器,实现了在任何框架上大规模进行强化学习。该框架在智能体基准测试中取得了优异的结果,并表明强化学习能提高智能体的可靠性。

现代AI智能体依赖于复杂的推理框架,如Claude Code、Codex和OpenClaw,以驱动多轮推理、工具使用和对外部系统的访问。尽管功能强大,但这些复杂的框架也使得在开放基础设施上端到端训练智能体变得困难,因为开放基础设施的SFT/RL栈无法原生表达有状态、多进程的框架推理。为解决这一问题,我们提出了OpenForgeRL,这是一个开源框架,用于在各种环境中端到端训练基于框架的智能体。OpenForgeRL通过一个轻量级代理来实现这一点,该代理提供框架的模型调用,同时将其记录为标准RL代码库(例如veRL)的训练数据;此外,一个Kubernetes编排器将每次展开运行在其自己的远程容器中,从而能够在大规模下在任何框架、任何环境中进行训练。通过解耦训练与推理,OpenForgeRL使研究人员能够直接在部署智能体的真实框架和环境中轻松训练、研究和改进智能体。我们在多样、复杂的框架和环境中验证了我们的框架,涵盖基于工具/Claw的智能体和多模态GUI浏览器与计算机使用智能体。仅使用数百到数千个任务,OpenForgeClaw在ClawEval上达到了31.7 pass^3和55.9 pass@3,在QwenClawBench上达到了33.7。OpenForgeGUI在OSWorld-Verified上达到了37.7,在Online-Mind2Web上达到了63.0,在WebVoyager上达到了72.3。在几乎所有基准测试中,两者均优于类似规模的开源基线,在GUI设置中甚至匹配或超越了数倍大小的模型。除了基准测试,我们还分析了框架选择(例如ZeroClaw、OpenClaw、Codex)和RL如何塑造智能体行为。我们发现,某些框架比其他框架更难学习,并且RL提高了智能体的可靠性,例如自我验证、工具覆盖率和完成多步计划,但关键能力(如错误恢复)仍然薄弱。
查看原文
查看缓存全文

缓存时间: 2026/07/25 01:59

论文页面 - OpenForgeRL:在任何环境中训练原生适配推理框架的智能体

来源:https://huggingface.co/papers/2607.21557

摘要

现代AI智能体依赖精密的推理框架(如Claude Code、Codex和OpenClaw)来驱动多轮推理、工具使用以及对外部系统的访问。虽然强大,但这些复杂的框架也使得智能体难以在开放基础设施上进行端到端训练,因为当前的SFT/RL栈无法原生表达有状态的、多进程的框架推理。为解决这一问题,我们提出了OpenForgeRL,一个开源框架,用于在不同环境中端到端训练基于框架的智能体。OpenForgeRL通过一个轻量级代理来实现这一点,该代理服务于框架的模型调用,同时将其记录为标准RL代码库(例如veRL)的训练数据,并配合一个Kubernetes编排器,将每次 rollout 放在自己的远程容器中运行,从而能够在任何环境中大规模地对任何框架进行训练。通过解耦训练和推理,OpenForgeRL使研究人员能够直接在他们部署的实际框架和环境中轻松地训练、研究和改进智能体。我们在多种复杂框架和环境中验证了我们的框架,涵盖了基于工具/爪子的智能体以及多模态GUI浏览器和计算机使用智能体。仅使用数百到数千个任务,OpenForgeClaw 在 ClawEval 上达到了 31.7 pass^3 和 55.9 pass@3,在 QwenClaw Bench 上达到了 33.7。OpenForgeGUI 在 OSWorld-Verified 上达到了 37.7,在 Online-Mind2Web 上达到了 63.0,在 WebVoyager 上达到了 72.3。在几乎所有基准测试中,这两者都优于相似规模的开源基线,并且在GUI设置中达到或超过了数倍于自身规模的模型。除了基准测试,我们还分析了框架选择(例如 ZeroClaw、OpenClaw、Codex)和RL如何塑造智能体行为。我们发现,某些框架比其他框架更难学习,并且RL提高了智能体的可靠性,例如自我验证、工具覆盖率和完成多步计划的能力,但错误恢复等关键能力仍然薄弱。

查看 arXiv 页面 (https://arxiv.org/abs/2607.21557) 查看 PDF (https://arxiv.org/pdf/2607.21557) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.21557)

在你的智能体中获取这篇论文:

hf papers read 2607.21557

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

没有模型链接到此论文

在模型 README.md 中引用 arxiv.org/abs/2607.21557 即可从本页链接。

引用此论文的数据集 0

没有数据集链接到此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.21557 即可从本页链接。

引用此论文的Space 0

没有Space链接到此论文

在 Space README.md 中引用 arxiv.org/abs/2607.21557 即可从本页链接。

包含此论文的收藏 0

没有收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 即可从本页链接。

相似文章

ClawGym II:基于代理工具的黑箱强化学习探索

Hugging Face Daily Papers

本文提出了一种统一的黑箱强化学习框架,通过沙箱执行与轨迹重建,实现了代理在复杂工具链中稳定、可扩展的优化,并在ClawGym-Bench等基准测试中取得了性能提升。

EvoHarness-RL:为长时程LLM智能体学习自进化运行时框架

arXiv cs.LG

介绍了EvoHarness-RL,一个为长时程LLM智能体学习运行时框架策略的框架,使其能够在任务执行过程中构建和更新外部状态(信念、进度、经验)。在ALFWorld上使用Qwen3-8B,它达到了96.9%的成功率,并揭示了框架退火和进化动态。