EnvCraft: 在Agentic RL中为Claw-like Agent合成可执行环境
摘要
EnvCraft是一个自动化框架,用于合成可执行环境,以解决Agentic RL训练中的稀缺性问题,并在使用Qwen模型的claw-like和通用工具使用基准测试中展示了显著的性能提升。
arXiv:2609.05576v1 Announce Type: new
摘要:LLMs的范式已迅速从被动语言接口转变为能够跨有状态工作区执行长时程任务的自主Claw-like代理。虽然Agentic强化学习(Agentic RL)提供了优化这些代理的一条有希望的路径,但其扩展受到交互式训练环境严重稀缺的严重瓶颈限制。现有的合成环境严格限于工具调用端点,这使得它们不足以满足Claw-like代理的端到端实际需求。为了弥合这一差距,我们引入了EnvCraft,一个用于合成可执行环境和可扩展训练数据的自动化框架。具体而言,EnvCraft采用环境合成引擎构建沙箱隔离的工作区,以及一个拓扑感知的数据生成引擎来产生连贯的任务轨迹。总的来说,我们合成了139个交互式环境,包含约20,000个复杂任务,用于Agentic RL训练。在Qwen3/3.5模型(8B-32B)上的实验表明,我们的方法在Claw风格基准测试中最高可提升+11.9%,在通用工具使用基准测试中提升+8.0%,同时降低了推理token成本。结果证实,合成的可执行环境为训练提供了稳健且可泛化的学习信号。
查看缓存全文
缓存时间: 2026/09/10 08:39
# EnvCraft:面向类爪型智能体的智能体强化学习可执行环境合成 来源:https://arxiv.org/html/2609.05576 作者:沈友,金航锋,玉飞,刘晓,丁††(通讯作者:[email protected]),侯玉泰,丛浩,王宇贤,吴宁,王旭,蔡比波 ## 摘要 大型语言模型的范式已迅速从被动语言接口转向能够在有状态工作空间中执行长期任务的自主类爪型智能体。虽然智能体强化学习为优化这些智能体提供了一条有前景的路径,但其规模化受到交互式训练环境极度稀缺的严重制约。现有合成环境严格限于工具调用端点,不足以满足类爪型智能体端到端的实际需求。为弥补这一差距,我们引入了EnvCraft——一个用于合成可执行环境和可扩展训练数据的自动化框架。具体而言,EnvCraft采用环境合成引擎构建沙箱隔离的工作空间,以及拓扑感知的数据生成引擎来生成连贯的任务轨迹。总体而言,我们为智能体强化学习训练合成了139个包含约2万个复杂任务的交互式环境。在Qwen3/3.5模型(8B–32B)上的实验表明,我们的方法在类爪型基准测试中最高提升+11.9%,在通用工具使用基准测试中提升+8.0%,同时降低了推理令牌成本。结果证实,合成的可执行环境为训练提供了鲁棒且可泛化学习信号。 机构:1哈尔滨工业大学SCIR实验室,2北京大学,3华为技术有限公司,4清华大学 ††该工作在华为实习期间完成。代码:https://github.com/zeng-yirong/EnvCraft 数据集:https://huggingface.co/EnvCraft ## 1 引言 人工智能智能体已从被动对话界面演变为在现实世界系统中运作的自主行为者。这一演进的显著体现是类爪型智能体,它们旨在系统级环境中高效执行任务。这类环境(如OpenClaw(OpenClaw Contributors 2026)、NanoClaw(QwibitAI 2026)和Hermes-Agent(Nous Research 2026))作为持久化数字助手,在操作系统、文件系统、数据库和终端外壳中管理长期任务。与传统对话机器人不同,类爪型智能体具备主动执行能力,可直接修改环境并产生实际后果。 近期研究探索了智能体强化学习,该框架支持智能体迭代优化策略、从执行错误中恢复并泛化至未见场景。如图1所示,智能体强化学习框架本质上依赖于用户、智能体和环境的交互。环境是一个支持工具执行、状态维护和结果反馈的可执行沙箱,而可执行环境是该范式的基础。规模化端到端智能体强化学习训练关键要求环境具备低延迟、高保真和低成本特性。目前,满足这些严格标准的环境仍然稀缺,主要局限于代码解释器和本地检索工具等狭窄领域。这种稀缺性对类爪型智能体尤为严重,因为它们需要有状态工作空间和长期任务循环,其复杂度远超工具使用端点。因此,缺乏可扩展、交互式、可执行的环境成为系统级推进智能体强化学习的关键瓶颈。 为解决这一瓶颈,近期研究探索了通用环境构建的两大范式:模拟环境利用LLM模拟工具响应,但存在幻觉和高成本问题;合成环境自动生成可执行代码沙箱以实现更好的可扩展性。然而,当前合成方法严格限于应用级通用工具使用智能体,专注于孤立的工具使用端点,无法支持系统级类爪型智能体——后者本质上要求跨环境执行、有状态工作空间和异步任务循环。 为弥补这一关键差距,我们提出EnvCraft——一个专为类爪型智能体训练设计的自动化可执行环境合成框架,同时支持通用工具使用智能体。表1总结了对比结果。 | 环境 | 环境数 | 任务数 | 爪型支持 | 环境领域 | 有状态 | 奖励机制 | |------|--------|--------|----------|----------|--------|----------| | AutoForge | 10 | 1,078 | ✗ | 消费者网页 | DB模式 | LLM判断 | | EnvScaler | 19 | 19,000 | ✗ | 通用 | 类属性 | 规则检查 | | ScaleEnv | 16 | 2,560 | ✗ | 通用 | DB模式 | 规则检查 | | AWM | 1,000 | 10,000 | ✗ | 通用 | DB模式 | 代码与LLM | | EnvFactory | 8 | 52,575 | ✗ | 通用 | DB模式 | 代码检查 | | EnvCraft(本文) | 139 | 19,777 | ✓ | 通用 | 工作空间 | 代码检查 | 表1:智能体强化学习合成可执行环境对比。与现有局限于通用工具端点的工作不同,EnvCraft提供有状态工作空间级基础设施,以最大任务规模训练类爪型智能体。 具体而言,EnvCraft通过两个互补引擎运作:环境合成和数据生成。对于环境合成,我们精选了41个通用工具使用场景和42个爪型特定场景,由LLM扩展为详细的环境规范和工具接口定义。在九种交互原型(规定控制流和状态管理模式)的引导下,合成器生成完全可执行、沙箱隔离的环境。 对于数据生成,我们引入拓扑感知采样策略来生成高质量强化学习任务,包括用户意图、初始状态和验证器。我们首先将环境内和跨环境工具依赖构建为双层有向图,通过加权随机游走获得语义连贯且逻辑有效的工具链。基于这些工具链,LLM逆向工程生成逐步暴露信息的多轮用户意图,同时生成确定性验证脚本检查执行后工作空间状态以提供奖励信号。 使用EnvCraft,我们合成了139个交互式环境和19,777个任务,涵盖爪型特定和通用工具使用任务。在Qwen3-8/32B和Qwen3.5-9B骨干网络上的大量实验验证了EnvCraft通过直接强化学习的有效性。在爪型风格基准测试中,爪型特定训练在PinchBench上最高提升+11.9个百分点,在Claw-Eval上提升+11.4,同时将每任务令牌成本降低最高35%,表明推理路径更高效。关键的是,这些性能提升稳健地迁移到不相交的通用工具使用基准测试(BFCL-v3、τ²-bench),证实学习到的策略可泛化至训练分布之外,而非仅仅过拟合于合成环境。 ## 2 预备知识 ### 2.1 问题设置:智能体交互 #### 环境形式化 形式上,我们将可执行智能体环境E定义为连接强化学习抽象与基于LLM交互的解耦四元组: E = ⟨Ddoc, Itool, S, T⟩ (1) 其中各组件结构化定义如下: - **环境文档(Ddoc)**:封装环境全局系统规则、操作约束和安全边界的自然语言描述。 - **工具接口(Itool)**:暴露给智能体的所有工具的名称、参数和描述,定义了智能体-环境交互的接口。 - **环境状态(S)**:持久化、可观测的状态空间,捕捉现实世界副作用:Sₜ = {sdata, sruntime},其中sdata表示基础数据状态(如文件元数据或数据库模式),sruntime表示时间执行会话。 - **沙箱转移函数(T)**:在隔离沙箱内执行智能体动作aₜ ∈ Itool,并确定性地产生下一状态和观察:T: Sₜ × Itool → Sₜ₊₁ × Oₜ₊₁。 #### 数据点形式化 为便于通过智能体强化学习优化,我们将合成环境中生成的每个训练数据点P形式化为结构化元组: P = ⟨Q, S₀, Vscript⟩ (2) 其中Q表示用户查询,Vscript表示自动执行验证脚本,S₀ ∈ S表示在智能体执行前实例化运行时工作空间的具体环境初始状态,Vscript以程序化和动态方式审计环境状态转移S₀ → Sₙ(例如验证结构性文件变更或执行精确元数据检查)。该设计确保推导出确定性、程序化的奖励信号。 ## 3 环境合成引擎 以端到端方式运作,环境合成引擎完全自动化了从自然语言描述到可执行环境的转换过程。 ### 3.1 环境场景收集 为建立稳健且全面的训练基础,我们收集了涵盖通用工具使用任务和爪型特定场景的大量环境领域。这些原始样本精选自OpenClaw社区以及代表性先前工作。经过严格去重和语义过滤,我们保留了12个粗粒度通用工具使用领域和13个爪型特定类别。在更细粒度上,这些类别包含42个爪型特定场景和41个通用工具使用场景,详细规范见补充材料。 随后,我们利用LLM丰富这些领域概况。这一自动扩展过程系统地将简短自然语言描述转化为细粒度的文档级环境规范(Espec)和声明性工具接口规范(Tspec)。这两类规范共同建立了完整契约,精确规定环境必须建模的内容及其应暴露的操作接口。 **(a)爪型特定场景** **(b)通用工具使用场景** 图2:合成环境在粗粒度场景类别中的分布。 图3:EnvCraft中的环境与任务合成流程。给定自然语言描述,环境合成引擎生成可执行沙箱(状态 + 工具 + 文档);数据合成引擎采样工具链并合成强化学习训练任务(意图序列 + 初始状态 + 验证器)。 ### 3.2 环境沙箱合成 为从高层自然语言描述生成可执行且结构标准化的环境沙箱,我们提出原型驱动的合成框架。 #### 交互原型设计与匹配 为适应OpenClaw场景的复杂交互需求,我们将软件交互原型提炼为九种基础原型。每种交互原型作为结构化提示模板,结合抽象设计规范与具体参考实现和架构蓝图。这九种原型涵盖不同的控制流和状态管理范式: (1) 事务性工作空间,(2) 跨工具数据管道,(3) 动态人机交互,(4) 异步事件触发,(5) 约束引导状态机,(6) 多资源时间调度,(7) 多标准双边匹配,(8) 分布式工作流编排,(9) 容错流处理。完整的交互原型规范见补充材料。 每种交互原型作为设计契约,为目标交互范式配对抽象规范和参考实现。为引导LLM生成,该框架通过评估与环境规范(Espec)的关键词重叠度检索相关原型。候选原型随后被排序,最多选择前两个作为上下文架构锚点。 #### 规范引导的环境生成 环境合成引擎接收三个结构化输入: 1. **交互原型规范(Pproto)**:提供具体设计原型、参考实现。 2. **环境规范(Espec)**:定义领域实体类型、状态属性和支配有效状态转移的业务规则。 3. **工具规范(Tspec)**:阐述API接口表面,指定函数模式、带类型参数、返回格式和副作用标志(例如只读 vs. 只写)。 为合成可执行沙箱,LLM处理统一结构化提示,无缝集成Pproto、Espec和Tspec。在这些参考实现和结构化输出规范的引导下,LLM以程序化方式生成完全可执行的环境类。图3展示了代表性合成环境实例。系统提示和执行模式详见补充材料。 #### 爪型特定扩展 为适应爪型特定场景的独特执行需求...
相似文章
EnvFactory:通过可执行环境合成与鲁棒强化学习扩展工具使用智能体
EnvFactory 自动化创建可执行工具环境和自然的多轮轨迹,用于训练具有智能体强化学习能力的大语言模型,在使用比先前工作更少的环境下,在 BFCLv3 和 MCP-Atlas 等基准测试上取得了优异性能。
ClawEnvKit:面向类爪智能体的自动环境生成
# 论文页面 - ClawEnvKit:面向类爪智能体的自动环境生成 来源:[https://huggingface.co/papers/2604.18543](https://huggingface.co/papers/2604.18543) ## 摘要 一个自动化流程能够基于自然语言描述,为类爪智能体生成多样化且经过验证的环境,从而实现大规模基准构建与持续评估。为训练和评估类爪智能体构建环境仍然是一个依赖人工的劳动密集型过程,且
Envs-FORGE:面向智能体强化学习的前沿优化奖励导向环境合成
Envs-FORGE是一种提示策略,用于为强化学习智能体合成训练环境,将验证器奖励转换为每个种子操作,以提高在SWE-bench和Terminal-Bench等基准测试上的性能。
EnvACE:通过世界预演内化环境动态以实现智能体强化学习
EnvACE 引入了世界预演,一种智能体强化学习方法,通过策略在内部预演环境响应来取代外部环境交互,在多个基准上取得了强劲性能。
EnvHarness: 唤醒静态世界以用于智能体学习
EnvHarness 引入了一个可编程层,用于动态重塑静态环境以进行强化学习,通过 EnvRigger 自动针对弱点来提升智能体性能。