ClawEnvKit:面向类爪智能体的自动环境生成
摘要
# 论文页面 - ClawEnvKit:面向类爪智能体的自动环境生成 来源:[https://huggingface.co/papers/2604.18543](https://huggingface.co/papers/2604.18543) ## 摘要 一个自动化流程能够基于自然语言描述,为类爪智能体生成多样化且经过验证的环境,从而实现大规模基准构建与持续评估。为训练和评估类爪智能体构建环境仍然是一个依赖人工的劳动密集型过程,且
查看缓存全文
缓存时间: 2026/04/21 07:20
论文页面 - ClawEnvKit:面向类爪智能体的自动环境生成
来源:https://huggingface.co/papers/2604.18543
摘要
该自动化流程通过自然语言描述为类爪(claw-like)智能体生成多样化且经过验证的环境,支持大规模基准构建与持续评估。
为类爪智能体构建训练与评估环境目前仍是手动、高度依赖人力且难以扩展的过程。我们认为,真正需要的不仅是一个数据集,而是一个能够按需生成多样化且经过验证的环境的自动化流程(https://huggingface.co/papers?q=automated%20pipeline)。为此,我们提出了 ClawEnvKit,一个自主生成流程,它能够根据自然语言描述(https://huggingface.co/papers?q=natural%20language%20descriptions)实例化这一形式化方法。该流程包含三个模块:(1)解析器,从自然语言输入中提取结构化的生成参数;(2)生成器,负责任务规格(https://huggingface.co/papers?q=task%20specification)、工具接口(https://huggingface.co/papers?q=tool%20interface)和评分配置(https://huggingface.co/papers?q=scoring%20configuration)的生成;(3)验证器,确保所生成环境在可行性、多样性、结构有效性和内部一致性方面达标。借助 ClawEnvKit,我们构建了 Auto-ClawEval,这是首个面向类爪智能体的大规模基准,涵盖 24 个类别共 1,040 个环境。经验表明,Auto-ClawEval 在连贯性与清晰度上达到或超过了人工精选环境,而成本仅为其 1/13,800。在 4 个模型家族和 8 个智能体 harness 框架上的评估显示,harness 工程相比裸 ReAct 基线可提升多达 15.7 个百分点的性能;完成率仍是主要的差异维度,尚无模型在该基准上达到饱和;而自动化生成使得以往不可行的大规模评估成为可能。除静态基准测试外,ClawEnvKit 还支持实时评估:用户用自然语言描述所需能力,即可按需获得经过验证的环境,将评估转变为一个持续、由用户驱动的过程。同一机制还可作为按需训练环境生成器,产出的任务分布能够根据智能体当前的弱点自适应调整,而非受限于现有用户日志。
查看 arXiv 页面 (https://arxiv.org/abs/2604.18543)查看 PDF (https://arxiv.org/pdf/2604.18543)GitHub (https://github.com/xirui-li/ClawEnvKit)添加到合集 (https://huggingface.co/login?next=%2Fpapers%2F2604.18543)
在您的智能体中获取这篇论文:
hf papers read 2604.18543
还没有安装最新版 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型 0
暂无模型关联该论文
在模型 README.md 中引用 arxiv.org/abs/2604.18543,即可从此页面建立关联。
引用该论文的数据集 0
暂无数据集关联该论文
在数据集 README.md 中引用 arxiv.org/abs/2604.18543,即可从此页面建立关联。
引用该论文的 Spaces 0
暂无 Space 关联该论文
在 Space README.md 中引用 arxiv.org/abs/2604.18543,即可从此页面建立关联。
包含该论文的合集 0
暂无合集包含该论文
将该论文添加到一个合集 (https://huggingface.co/new-collection),即可从此页面建立关联。
相似文章
EnvFactory:通过可执行环境合成与鲁棒强化学习扩展工具使用智能体
EnvFactory 自动化创建可执行工具环境和自然的多轮轨迹,用于训练具有智能体强化学习能力的大语言模型,在使用比先前工作更少的环境下,在 BFCLv3 和 MCP-Atlas 等基准测试上取得了优异性能。
VisualClaw: 面向物理世界的实时个性化智能体
VisualClaw是一种自我进化的多模态智能体,通过混合编码和技能进化降低部署成本,同时在多个基准测试中提高了视频问答的准确性。
EnvScaler:通过程序综合为LLM智能体扩展工具交互环境
EnvScaler是一个自动化框架,通过程序综合为LLM智能体扩展工具交互环境,创建了191个多样化环境和7K个场景,以提升智能体在多轮、多工具交互任务上的性能。
@Vtrivedy10:基于人类反馈的合成环境生成——智能体作为一次性评估/环境生成器表现不佳,因为它们……
一条推文,介绍来自 langchain-ai/langchain-skills 的 eval-engineering 技能,该技能利用人类反馈为智能体评估生成对齐的环境、测试框架(harness)和任务。它解释了工作流程,并提供了该开源工具的安装说明。
WeClawArena: An Auditable Sandbox and Benchmark for Cross-User Agents Collaboration and Security in Human-Centered Agent Networks
WeClawArena is an auditable benchmark and runtime sandbox for evaluating multi-party cross-user agent collaboration and security in human-centered agent networks, measuring task utility and attack success rates across personal workspace tasks.