ClawGym II:基于代理工具的黑箱强化学习探索

Hugging Face Daily Papers 论文

摘要

本文提出了一种统一的黑箱强化学习框架,通过沙箱执行与轨迹重建,实现了代理在复杂工具链中稳定、可扩展的优化,并在ClawGym-Bench等基准测试中取得了性能提升。

代理工具链通过协调代理与环境的交互,显著提升了长周期任务的表现。然而,通过复杂工具链进行强化学习的研究仍较为缺乏,因其扩展到长周期任务时存在根本性挑战。本研究提出了一种统一的黑箱强化学习框架,用于实现通用代理在复杂工具链中稳定、可扩展的优化。具体而言,我们首先构建了基于沙箱的执行基础设施,将任务环境与工具链隔离在临时沙箱中,支持大规模并发rollout。接着,我们解耦策略优化与不透明工具链执行,在模型边界部署服务代理以捕获模型调用。为重构多轮轨迹并提升训练效率,我们将捕获的调用组织为前缀树,并适配基于评论家的PPO与无评论家的GRPO算法,在树结构上进行优化。同时,我们确保优化过程中训练与推理的一致性。最后,我们引入混合工具链训练机制,使单一模型可被异构工具链联合优化。基于Qwen3-30A3B,黑箱强化学习通过OpenClaw和Claude Code分别在ClawGym-Bench上将Pass@1提升了9.98和14.81个点,并在200-400个优化步骤内保持稳定。此外,该框架在JobBench和OfficeQA等更具挑战性的任务上也取得了一致收益。总体而言,我们的框架实现了通用代理在黑箱工具链中高效、稳定、可扩展的优化,支持跨异构执行系统的统一训练。
查看原文
查看缓存全文

缓存时间: 2026/08/18 03:52

论文页面 - ClawGym II:探索代理工具链上的黑箱强化学习

来源:https://huggingface.co/papers/2608.16798 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

一个统一的黑箱强化学习框架,通过沙箱执行、轨迹重建和混合工具链训练,实现了对通用代理在复杂工具链中稳定且可扩展的优化。

代理工具链通过协调代理与环境的交互,显著提升了长期任务的性能。然而,通过复杂工具链进行强化学习(https://huggingface.co/papers?q=reinforcement%20learning)在很大程度上仍未被探索,因为将此类训练扩展到长期代理任务会带来根本性的挑战。在这项工作中,我们提出了一个统一的黑箱RL(https://huggingface.co/papers?q=black-box%20RL)框架,用于通过复杂工具链对通用代理进行稳定且可扩展的优化。具体而言,我们首先构建了一个基于沙箱的执行(https://huggingface.co/papers?q=sandbox-based%20execution)基础设施,将任务环境和工具链隔离在临时沙箱中,以实现大规模并发试验。然后,我们将策略优化与不透明的工具链执行解耦,并在模型边界放置一个服务代理(https://huggingface.co/papers?q=serving%20proxy)来捕获模型调用。为了重构多轮轨迹(https://huggingface.co/papers?q=multi-turn%20trajectories)并提高训练效率,我们将捕获的调用组织成前缀树(https://huggingface.co/papers?q=prefix%20trees),并进一步调整了基于评论器的PPO(https://huggingface.co/papers?q=PPO)和无需评论器的GRPO(https://huggingface.co/papers?q=GRPO)以优化恢复的树结构。同时,我们在整个优化过程中保持训练与推理的一致性。最后,我们引入了混合工具链训练(https://huggingface.co/papers?q=mix-harness%20training),允许单一模型通过异构工具链联合优化。使用Qwen3-30A3B,黑箱RL(https://huggingface.co/papers?q=black-box%20RL)分别通过OpenClaw和Claude Code在ClawGym-Bench上将Pass@1提升了9.98和14.81分,并在200-400个优化步骤中保持稳定。此外,该框架在更具挑战性的任务(如JobBench和OfficeQA)上也带来了持续的增益。总体而言,我们的框架实现了通过黑箱工具链对通用代理的有效、稳定且可扩展的优化,支持跨异构执行系统的统一训练(https://huggingface.co/papers?q=ppo)。

查看arXiv页面(https://arxiv.org/abs/2608.16798)查看PDF(https://arxiv.org/pdf/2608.16798)项目页面(https://github.com/ClawGym)GitHub33(https://github.com/ClawGym/ClawGym-Agents)添加到收藏集(https://huggingface.co/login?next=%2Fpapers%2F2608.16798)

引用本文的模型0

无模型链接本文

在模型README.md中引用arxiv.org/abs/2608.16798,以从此页面链接它。

引用本文的数据集0

无数据集链接本文

在数据集README.md中引用arxiv.org/abs/2608.16798,以从此页面链接它。

引用本文的空间0

无空间链接本文

在空间README.md中引用arxiv.org/abs/2608.16798,以从此页面链接它。

包含本文的收藏集0

无收藏集包含本文

将本文添加到收藏集(https://huggingface.co/new-collection),以从此页面链接它。

相似文章

EvoHarness-RL:为长时程LLM智能体学习自进化运行时框架

arXiv cs.LG

介绍了EvoHarness-RL,一个为长时程LLM智能体学习运行时框架策略的框架,使其能够在任务执行过程中构建和更新外部状态(信念、进度、经验)。在ALFWorld上使用Qwen3-8B,它达到了96.9%的成功率,并揭示了框架退火和进化动态。

使用离线强化学习控制LLM Agent执行框架

arXiv cs.LG

本文通过一个使用离线强化学习训练的Harness MDP,将LLM Agent周围的执行框架形式化为一个可学习的控制层,展示了在多个领域中的验证行为和最终质量的改进。

OpenForgeRL:在任何环境中训练基于框架的原生智能体

Hugging Face Daily Papers

OpenForgeRL 是一个开源框架,用于在各种环境中端到端训练基于框架的AI智能体。它通过轻量级代理和Kubernetes编排器,实现了在任何框架上大规模进行强化学习。该框架在智能体基准测试中取得了优异的结果,并表明强化学习能提高智能体的可靠性。

Harness-G:面向搜索代理的图结构检索框架

Hugging Face Daily Papers

本文介绍了Harness-G,一种图结构检索框架,它将自由形式的查询生成重构为有限动作选择,以减少基于强化学习的搜索代理中的检索别名化问题。在六个问答基准测试中,Harness-G在1.5B规模下比最强基线Graph-R1高出10.74个百分点,在3B规模下高出3.98个百分点。