EvoClawBench:智能体能否从自身运行中学习可复用技能?
摘要
本文介绍了EvoClawBench,一个旨在测试AI智能体能否从自身执行运行中学习可复用技能的基准测试。多个智能体运行时的实验表明,技能学习具有选择性和成本敏感性,并非自动受益。
arXiv:2607.09711v1 公告类型:新
摘要:现有智能体基准测试主要测试任务完成、工具使用或技能效用,但未能隔离运行时能否将其自身运行中的证据转化为可复用技能,从而在编写开销后改进新执行。我们提出EvoClawBench,一个针对重复的、基于固定任务场景的闭环技能学习问题的基准。EvoClawBench比较了三种模式:直接执行(无技能)、执行前的PreSkill编写,以及基于首轮运行证据的PostSkill总结后接着执行第二轮。该套件包含100个任务和502个子问题,覆盖编程、数据、办公、安全、运维和领域文档工作流,并支持多种智能体运行时。在本地执行下对OpenClaw和nanobot的实验表明,直接基线性能强烈依赖于运行时:OpenClaw在各模型下均低于20%,而nanobot则在56.45%到96.13%之间。自编写技能的效果各异:nanobot GPT-5.4在所有模式下均保持96%以上,MiniMax-M2.7在PostSkill下从90.97%提升至94.50%,但nanobot DeepSeek-V4-Pro在PreSkill下降至4.80%,PostSkill下降至0.99%(原为77.77%)。OpenClaw也表现出类似的非单调行为,部分技能运行接近基线,另一些则崩溃。这些结果表明,从智能体自身运行中学习可复用技能具有选择性和成本敏感性,而并非在智能体循环中添加技能编写就能自动带来收益。
查看缓存全文
缓存时间: 2026/07/14 04:13
# EvoClawBench:智能体能否从自身运行中学习可复用技能?
来源:https://arxiv.org/html/2607.09711
Zhiyuan Peng¹,Xin Yin²,Chenhao Ying¹,Zhe Cui³,Zixiang Ding³,Zhenhua Liu³,Jiang Wu³,Yuan Luo¹
¹上海交通大学,²浙江大学,³恒生研究院
{pzy2000, yingchenhao, yuanluo}@sjtu\.edu\.cn
xyin@zju\.edu\.cn
{cuizhe, dingzixiang, liuzhenhua, wujiang2}@myhexin\.com
###### 摘要
现有智能体基准主要测试任务完成度、工具使用或技能效用,但并未单独评估运行时能否将自身运行中的证据转化为可复用技能,从而在扣除作者开销后改善新的执行。我们提出EvoClawBench,一个针对重复性、基于文件夹具的任务的闭环技能学习问题的基准。EvoClawBench比较了直接执行(无技能)、PreSkill(执行前预编写技能)以及PostSkill(从首次运行证据中总结技能后重新执行第二次)三种方式。该基准包含100个任务和502个子问题,涵盖编码、数据、办公、安全、运营及领域文档工作流,并支持多种智能体运行时。在本地执行环境下,使用OpenClaw和nanobot进行的实验表明,直接Baseline性能强烈依赖于运行时:OpenClaw在所有模型上均低于20%,而nanobot的范围为56.45%到96.13%。自编写技能的效果好坏参半。nanobotGPT-5.4在所有模式下均保持96%以上,MiniMax-M2.7在PostSkill下从90.97%提升至94.50%,但nanobotDeepSeek-V4-Pro在PreSkill下从77.77%降至4.80%,在PostSkill下降至0.99%。OpenClaw也表现出类似的非单调行为,有些技能运行接近基线,另一些则完全崩溃。这些结果表明,从智能体自身运行中学习可复用技能是有选择性的且对成本敏感,而非在智能体循环中添加技能编写就能自动获益。
EvoClawBench:智能体能否从自身运行中学习可复用技能?
表1:EvoClawBench与现有基准的比较。“Skill Cond.”表示基准是否包含智能体技能。“Det. Verifier”表示是否包含确定性(非LLM)验证。“Closed Loop”表示同一运行时是否在新运行中创建并重用技能。
## 1 引言
大型语言模型智能体越来越多地被用于将基础模型转化为交互式工作者。最近的评估将智能体置于代码仓库、终端、浏览器、图形界面、工具API和可执行环境中(Fourney et al., 2024 (https://arxiv.org/html/2607.09711#bib.bib26); Wang et al., 2025 (https://arxiv.org/html/2607.09711#bib.bib24); Xu et al., 2025 (https://arxiv.org/html/2607.09711#bib.bib25); Agashe et al., 2025 (https://arxiv.org/html/2607.09711#bib.bib27); Research et al., 2026 (https://arxiv.org/html/2607.09711#bib.bib23))。因此,基准生态系统迅速扩展。SWE-Bench和SWE-agent风格的评估强调仓库级别的软件工程(Jimenez et al., 2024 (https://arxiv.org/html/2607.09711#bib.bib1); Yang et al., 2024 (https://arxiv.org/html/2607.09711#bib.bib5));Terminal-Bench、AppWorld、WebArena和OSWorld衡量命令行、应用世界、浏览器和桌面交互(Zhou et al., 2024 (https://arxiv.org/html/2607.09711#bib.bib10); Trivedi et al., 2024 (https://arxiv.org/html/2607.09711#bib.bib6); Xie et al., 2024 (https://arxiv.org/html/2607.09711#bib.bib13); Merrill et al., 2026 (https://arxiv.org/html/2607.09711#bib.bib3));而SkillsBench将技能作为一等构件在多样任务中进行评估(Li et al., 2026 (https://arxiv.org/html/2607.09711#bib.bib2))。这些基准使智能体能力更可衡量,但它们留下了一个定义不明确的闭环学习问题。它们主要测试任务完成、工具使用、环境交互或精心策划与自生成技能的效用。它们没有单独分离出同一智能体运行时创建技能、总结自身已完成运行的证据、在全新执行中重用该技能,并承担全部令牌、成本和时间开销的过程。这留下了一个聚焦的评估问题:
*LLM智能体能否从自身运行中学习可复用技能?*
为了回答这个问题,我们提出了EvoClawBench,一个围绕此问题设计的基准。EvoClawBench在包含多个相关子问题的重复性结构化任务上评估智能体。这种设计为智能体创造了识别共享模式的机会,并在自身运行条件下,将首次运行证据转化为可复用技能。该基准聚焦于可复用技能,因为它们正成为专门化LLM智能体处理重复性工具使用任务的实用方式。SkillsBench报告在136天内收集了84,192个技能(Li et al., 2026 (https://arxiv.org/html/2607.09711#bib.bib2)),这表明从单个用户的提示工程向可复用程序记忆市场的转变。除了更强的基座模型和更丰富的框架,互补的工作线将程序性工件视为外部技能或学习到的程序,这些可以从智能体经验中推导、改进、重用或移入紧凑的任务族状态(Yang et al., 2026b (https://arxiv.org/html/2607.09711#bib.bib28); Ni et al., 2026 (https://arxiv.org/html/2607.09711#bib.bib29); Wang et al., 2026 (https://arxiv.org/html/2607.09711#bib.bib30); Yang et al., 2026a (https://arxiv.org/html/2607.09711#bib.bib31); Xie et al., 2026 (https://arxiv.org/html/2607.09711#bib.bib32))。在本文中,我们使用“技能”指代轻量级、可检查的程序性文档,并附带可选的脚本、模板和引用,因为此类工件可以安装、编辑并注入智能体的上下文,而无需重新训练模型。
对于每个任务,我们比较三种策略。在Baseline中,智能体直接解决问题,且禁止创建或编辑技能。在PreSkill中,同一模型和运行时首先创建一个或多个任务特定技能,然后一个全新的执行工作区仅使用这些生成的技能来解决问题。在PostSkill中,智能体首先无技能地解决问题,收到一个包含提示、评分摘要、输出预览和对话记录摘要的紧凑首次运行上下文,然后编写可复用技能,这些技能被复制到全新的第二次执行中。这种协议分离了两种相关但不同的自编写技能构建形式。PreSkill是一种执行前控制,衡量智能体在解决问题前是否能推断出有用的可复用程序。PostSkill最直接地测试标题问题:智能体是否能从自身完成的运行中提炼出可重用的程序记忆。两者都与Baseline在仅执行和端到端指标上进行比较,因此技能工作流不仅要提高任务分数,还要证明其额外的令牌、成本和时间开销是合理的。
(参见图注)图1:EvoClawBench概览。任务套件面板总结了官方套件中的100个非健全性任务;图2 (https://arxiv.org/html/2607.09711#S3.F2) 细化了它们的族和夹具格式。流水线通过运行时无关的智能体接口路由任务,在新工作区中比较Baseline、PreSkill和PostSkill,并报告基于评分器质量、资源、技能和变异完整性指标。
本文做出以下贡献:
- • **基准。** 我们构建了EvoClawBench,一个用于评估LLM智能体能否从受控的自编写技能工作流和自身首次运行证据中学习可复用技能的基准。它涵盖100个任务,包含重复的子问题、夹具、自动或混合评分器,以及运行时适配器支持。
- • **三模式评估协议。** 我们形式化了Baseline、PreSkill和PostSkill条件,将仅执行性能与端到端工作流成本分离,并在重用期间检测技能变异违规。
- • **实证发现。** 我们提供了当前的跨运行时结果表,显示运行时框架显著影响绝对分数,且自编写技能不产生单调增益。聚焦子集检查使成本权衡、技能内容控制和混合评判稳健性明确。
- •
## 2 相关工作
#### 智能体和软件工程基准。
仓库级别基准评估智能体是否能够修改真实代码库并满足可执行检查。SWE-Bench评估真实GitHub问题解决(Jimenez et al., 2024 (https://arxiv.org/html/2607.09711#bib.bib1)),而SWE-agent研究用于自动化软件工程的智能体-计算机接口(Yang et al., 2024 (https://arxiv.org/html/2607.09711#bib.bib5))。Terminal-Bench专注于隔离环境中的真实命令行任务(Merrill et al., 2026 (https://arxiv.org/html/2607.09711#bib.bib3))。MLE-bench将此线扩展到Kaggle竞赛中的端到端机器学习工程(Chan et al., 2025 (https://arxiv.org/html/2607.09711#bib.bib15))。AgentBench和GAIA评估更广泛的智能体推理、工具使用和多步骤问题解决,跨越异构环境或问题(Liu et al., 2024 (https://arxiv.org/html/2607.09711#bib.bib8); Mialon et al., 2024 (https://arxiv.org/html/2607.09711#bib.bib9))。这些基准对于测量任务完成度有用,但它们没有分离出智能体是否能在运行时编写可复用技能并从中受益。
#### 网络、GUI和工具使用基准。
几个基准专注于通过浏览器、操作系统、应用程序或API行动的智能体。WebArena为长周期浏览器任务构建了真实的Web环境(Zhou et al., 2024 (https://arxiv.org/html/2607.09711#bib.bib10)),Mind2Web提供了从真实网站收集的开放式Web任务(Deng et al., 2023 (https://arxiv.org/html/2607.09711#bib.bib11))。WorkArena++ 针对ServiceNow中的组合知识工作工作流(Boisvert et al., 2024 (https://arxiv.org/html/2607.09711#bib.bib12)),而OSWorld评估多模态智能体在真实桌面计算机任务上的表现(Xie et al., 2024 (https://arxiv.org/html/2607.09711#bib.bib13))。ToolLLM和ToolBench在大规模上评估API使用能力(Qin et al., 2023 (https://arxiv.org/html/2607.09711#bib.bib14))。AppWorld和τ\\tau-Bench将范围扩展到可控的应用程序世界和工具-智能体-用户交互设置(Trivedi et al., 2024 (https://arxiv.org/html/2607.09711#bib.bib6); Yao et al., 2024 (https://arxiv.org/html/2607.09711#bib.bib7))。这些环境强调规划和工具执行,但它们的评估条件并不以智能体编写的、在全新运行中重用的工件为中心。
#### 技能和程序记忆评估。
技能可以被视为智能体的外部程序记忆,与智能体技能、反思、经验积累、程序记忆和开放式技能获取的工作相关(Zhang et al., 2025 (https://arxiv.org/html/2607.09711#bib.bib4); Yao et al., 2023 (https://arxiv.org/html/2607.09711#bib.bib16); Shinn et al., 2023 (https://arxiv.org/html/2607.09711#bib.bib17); Zhao et al., 2024 (https://arxiv.org/html/2607.09711#bib.bib18); Fang et al., 2026 (https://arxiv.org/html/2607.09711#bib.bib21); Wang et al., 2023 (https://arxiv.org/html/2607.09711#bib.bib22); Xu and Yan, 2026 (https://arxiv.org/html/2607.09711#bib.bib19); Wu and Zhang, 2026 (https://arxiv.org/html/2607.09711#bib.bib20))。SkillsBench与我们的设置最接近,因为它将技能作为一等构件进行评估,包括精心策划和自生成技能的条件(Li et al., 2026 (https://arxiv.org/html/2607.09711#bib.bib2))。与SkillsBench评估精心策划技能和解题前自生成技能条件不同,我们的基准将执行前技能编写与运行后技能学习分开。特别是,PreSkill控制在任务执行前编写的技能,而PostSkill直接测试智能体是否能将自身先前运行的证据转化为可复用的技能以供后续执行使用。
综上所述,这些工作线推动了任务和工具使用评估,而EvoClawBench将技能生命周期本身作为评估对象:编写、自身运行提炼、重用、变异检查和端到端成本。表1 (https://arxiv.org/html/2607.09711#S0.T1) 从高层次总结了基准定位。EvoClawBench旨在揭示智能体编写和自身运行派生的技能在计算创建和重用技能的全部成本后,是否提高了任务成功率。
## 3 EvoClawBench构建
EvoClawBench旨在测试智能体是否能识别子问题中的重复结构,并将该结构编码为可复用技能。基准实现围绕任务定义、工作区夹具、运行时适配器、评分器和指标聚合进行组织。
### 3.1 任务套件
任务以Markdown文件形式指定,包含YAML前置元数据、自然语言提示、预期行为、子问题描述、评分标准以及自动或混合评分逻辑。每个任务通常包含五到十个结构相关的子问题,创造了重复的情况,使智能体可以从记录通用程序而不是独立解决每个实例中受益。代码库还包含一个由加载器使用的健全性任务,但我们将其从官方套件计数中排除。排除之后,套件包含100个任务和502个子问题。它涵盖了重复性工作流,如数据转换、日志分析、API脚手架、测试生成、配置迁移、安全审查、文档提取、数据库操作、Excel分析、网页提取、文档生成、数据流水线、电子邮件和发票处理、Shell自动化、CI生成、依赖审计、环境配置以及指标异常检测。完整的套件将这些表面扩展到更难仓库本地族,包括金融、法律、医疗、采购、人力资源、支持、DevOps/SRE、隐私、本地化、商务、设施、公共部门审计、CRM以及旅行/办公协调。许多困难模式夹具是合成的仓库本地案例,包含竞争性证据包、过时修订和诱饵记录。这种设计降低了隐私风险,同时保留了重复性、产生工件的工作流。图2 (https://arxiv.org/html/2607.09711#S3.F2) 从任务元数据(而非模型结果)总结了官方套件的覆盖范围:套件结合了种子工作流、生成的困难模式族以及多种文件格式的仓库本地夹具。
(参见图注)图2:EvoClawBench中官方套件任务和夹具分布。(a) 面板按种子或生成族统计100个非健全性任务。(b) 面板按分组文件格式统计仓库本地工作区夹具文件。这些元数据计数描述基准覆盖范围,而非模型性能。
### 3.2 工作区和夹具
每个任务运行在隔离的工作区中执行。基准从夹具目录中将输入资产复制到该工作区,智能体必须将评分器可见的输出写入预期路径。这种设计避免了仅依赖对话式回答,而是需要具体的工件,包括JSON文件、脚本、报告、Dockerfile、CI文件以及结构化提取输出。任务定义指示智能体不要修改输入夹具,而评分器检查输出工件,而非信任智能体的最终自然语言答案。基准支持本地子进程执行和基于Docker的执行。对于报告的实验,我们使用OpenClaw和nanobot运行时进行本地子进程执行,设置`--environment local`,运行32个工作进程,并对每个任务和模式执行一次基准运行。由于这些运行不使用Docker沙箱,相似文章
SkillEvolBench:从情景经验到程序技能的进化基准测试
SkillEvolBench 是一个诊断性基准,用于评估大语言模型代理是否能够将情景经验提炼为可重用的程序技能。它包含六个环境中的180个任务,并发现当前代理通常难以形成稳健的可重用技能,原始轨迹重用往往优于提炼后的技能。
SkillLearnBench:面向真实任务代理技能生成的持续学习方法基准
SkillLearnBench 推出首个评估 LLM 代理持续技能学习的基准,覆盖 20 项真实任务,结果显示尚无方法全面领先,单纯扩大模型规模也无法保证技能提升。
SkillFlow:自主智能体终身技能发现与演化基准测试
SkillFlow 推出了一个涵盖20个任务家族共166项任务的基准测试,用于评估自主智能体在终身学习协议下,随时间推移发现、修复并维护技能的能力。实验揭示了主流模型之间存在显著的能力差距:Claude Opus 4.6 通过技能演化获得了显著提升,而其他模型的收益有限甚至为负。
ContinualSkillBench:LLM智能体能否真正进化其能力?
介绍了ContinualSkillBench,一个用于LLM智能体上下文内持续技能学习的动态评估框架,表明虽然顺序执行能提升性能,但当前方法难以将经验巩固为稳健、可迁移的技能。
Embodied-BenchClaw:一种用于具身空间智能基准构建的自主多智能体系统
本文提出Embodied-BenchClaw,一种自主多智能体系统,能够通过包含过程质量控制与可扩展技能库的五阶段流水线,根据用户意图自动构建具身空间智能基准。