OpenForgeRL:在任何环境中训练基于框架的原生智能体
摘要
OpenForgeRL 是一个开源框架,用于在各种环境中端到端训练基于框架的AI智能体。它通过轻量级代理和Kubernetes编排器,实现了在任何框架上大规模进行强化学习。该框架在智能体基准测试中取得了优异的结果,并表明强化学习能提高智能体的可靠性。
查看缓存全文
缓存时间: 2026/07/25 01:59
论文页面 - OpenForgeRL:在任何环境中训练原生适配推理框架的智能体
来源:https://huggingface.co/papers/2607.21557
摘要
现代AI智能体依赖精密的推理框架(如Claude Code、Codex和OpenClaw)来驱动多轮推理、工具使用以及对外部系统的访问。虽然强大,但这些复杂的框架也使得智能体难以在开放基础设施上进行端到端训练,因为当前的SFT/RL栈无法原生表达有状态的、多进程的框架推理。为解决这一问题,我们提出了OpenForgeRL,一个开源框架,用于在不同环境中端到端训练基于框架的智能体。OpenForgeRL通过一个轻量级代理来实现这一点,该代理服务于框架的模型调用,同时将其记录为标准RL代码库(例如veRL)的训练数据,并配合一个Kubernetes编排器,将每次 rollout 放在自己的远程容器中运行,从而能够在任何环境中大规模地对任何框架进行训练。通过解耦训练和推理,OpenForgeRL使研究人员能够直接在他们部署的实际框架和环境中轻松地训练、研究和改进智能体。我们在多种复杂框架和环境中验证了我们的框架,涵盖了基于工具/爪子的智能体以及多模态GUI浏览器和计算机使用智能体。仅使用数百到数千个任务,OpenForgeClaw 在 ClawEval 上达到了 31.7 pass^3 和 55.9 pass@3,在 QwenClaw Bench 上达到了 33.7。OpenForgeGUI 在 OSWorld-Verified 上达到了 37.7,在 Online-Mind2Web 上达到了 63.0,在 WebVoyager 上达到了 72.3。在几乎所有基准测试中,这两者都优于相似规模的开源基线,并且在GUI设置中达到或超过了数倍于自身规模的模型。除了基准测试,我们还分析了框架选择(例如 ZeroClaw、OpenClaw、Codex)和RL如何塑造智能体行为。我们发现,某些框架比其他框架更难学习,并且RL提高了智能体的可靠性,例如自我验证、工具覆盖率和完成多步计划的能力,但错误恢复等关键能力仍然薄弱。
查看 arXiv 页面 (https://arxiv.org/abs/2607.21557) 查看 PDF (https://arxiv.org/pdf/2607.21557) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.21557)
在你的智能体中获取这篇论文:
hf papers read 2607.21557
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
没有模型链接到此论文
在模型 README.md 中引用 arxiv.org/abs/2607.21557 即可从本页链接。
引用此论文的数据集 0
没有数据集链接到此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.21557 即可从本页链接。
引用此论文的Space 0
没有Space链接到此论文
在 Space README.md 中引用 arxiv.org/abs/2607.21557 即可从本页链接。
包含此论文的收藏 0
没有收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 即可从本页链接。
相似文章
@DirhousssiAmine:TRL 现在通过我们的 OpenEnv 集成,开箱即用地支持在 agent harness 上进行训练。你现在可以使用 harn…
TRL 现在通过 OpenEnv 集成开箱即用地支持在 agent harness 上进行训练,支持使用 opencode 等 harness 进行训练。
@SergioPaniego:前沿智能体之所以如此出色,部分原因是模型在与其一同交付的同一框架内进行了训练。很高兴看到这…
Sergio Paniego 强调,前沿智能体的性能得益于模型在其部署框架内进行训练。NVIDIA AI 的新工作“Polar: Agentic RL on Any Harness at Scale”能够将 Codex、Claude Code、Qwen Code 或 Pi 等框架转化为强化学习训练环境,而无需修改其内部结构。
远程代理管理器
用于远程管理和控制AI代理的工具
ClawGym II:基于代理工具的黑箱强化学习探索
本文提出了一种统一的黑箱强化学习框架,通过沙箱执行与轨迹重建,实现了代理在复杂工具链中稳定、可扩展的优化,并在ClawGym-Bench等基准测试中取得了性能提升。
EvoHarness-RL:为长时程LLM智能体学习自进化运行时框架
介绍了EvoHarness-RL,一个为长时程LLM智能体学习运行时框架策略的框架,使其能够在任务执行过程中构建和更新外部状态(信念、进度、经验)。在ALFWorld上使用Qwen3-8B,它达到了96.9%的成功率,并揭示了框架退火和进化动态。