SKILL.nb: 选择性形式化与门控执行用于持久化智能体工作流

arXiv cs.AI 论文

摘要

介绍了SKILL.nb,一个通过证据校准的生命周期策略来管理可复用智能体工作流的框架,具有选择性形式化和门控条件执行等特点。在网页自动化基准测试中取得了显著改进,并展示了对环境漂移的鲁棒性。

arXiv:2606.08049v1 公告类型:新 摘要:AI智能体日益将过往经验转化为可复用的制品,如代码、工作流和程序记忆。复用可提升效率,但也带来生命周期可靠性问题:曾经成功的制品可能在环境漂移、任务定义不明确或任务分布变化时失效,尤其在网页自动化领域。我们提出SKILL.nb,一个通过证据校准的生命周期策略来管理可复用智能体工作流的框架。SKILL.nb采用选择性形式化:执行证据决定哪些工作流步骤应成为可执行代码,哪些应保留自然语言引导,以及何时应修订这些选择。工作流存储为可审计、带版本号的笔记本,其中交织包含自然语言引导、多语言可执行单元格、验证门控、回退路径以及多模态证据(如输出、截图和错误轨迹)。在运行时,门控条件执行允许每个步骤在门控验证通过时运行代码,或在漂移使可执行实现失效时本地回退。在WebArena-Verified上,SKILL.nb单轮成功率达53.7%,比最强基线高出3.9个百分点。在三次重新执行中,它保留了初始成功任务的91.7%,比次优方法高出15.5个百分点。在有限修复下,它恢复了后续失败的72.9%,同时将修复后回归限制在4.2%,而持久化基线则为15.0%至17.0%。在Mind2Web跨网站和跨域分割中也处于领先地位。在GitLab迁移测试中,SKILL.nb在复用基于GitLab 15.7学习的冻结状态时保持了性能,冻结版本与目标新鲜版本之间的差距在GitLab 16.11上为-1.7个百分点,在GitLab 18.9上为+0.6个百分点。这些结果表明生命周期治理和门控条件执行是超越一次性任务成功之外的可靠性维度。
查看原文
查看缓存全文

缓存时间: 2026/06/09 08:54

# 用于持久化智能体工作流的选择性形式化与门控执行

**来源:** [https://arxiv.org/html/2606.08049](https://arxiv.org/html/2606.08049)

**作者:** Amine El Hattami¹,²,³, Nicolas Chapados¹, Christopher Pal¹,²,³,⁴  
¹ServiceNow Research, ²Mila, ³Polytechnique Montréal, ⁴加拿大CIFAR AI主席

###### 摘要

AI智能体越来越多地将过往经验转化为可复用的制品,例如代码、工作流和过程性记忆。复用提高了效率,但也带来了生命周期可靠性问题:曾经成功的制品可能会因环境漂移、任务说明不充分或任务分布变化而失效,尤其是在Web自动化场景中。我们提出了**SKILL.nb**,一个通过证据校准生命周期策略来治理可复用智能体工作流的框架。其核心机制是*选择性形式化*:执行证据决定哪些工作流步骤应转化为可执行代码,哪些应保留为自然语言引导,以及何时应修订这些选择。SKILL.nb将工作流存储为可审计、可版本化的笔记本,其中交织了自然语言引导、多语言可执行单元格、验证门控、回退路径以及多模态证据(如输出、截图和错误追踪)。在运行时,SKILL.nb执行*门控条件执行*:与全有或全无的脚本不同,每个步骤可以在其门控验证通过时执行代码,或者在漂移使可执行实现失效时回退到本地自然语言过程或步骤意图。对尝试过的实现、门控结果、输出、截图和回退的单元格级记录,使得工作流更新和执行均可审计。在WebArena-Verified上,SKILL.nb实现了53.7%的单轮成功率,比最强基线方法高出3.9个百分点。在三次重新执行中,它保留了91.7%的初始成功任务,比次优方法高出15.5个百分点。在有限修复条件下,它恢复了72.9%的后续失败,同时将修复后的回归率限制在4.2%,而持久性基线的回归率为15.0%–17.0%。在Mind2Web的跨网站和跨领域拆分中,它也在比较方法中领先。在一次真实的GitLab迁移测试中,SKILL.nb在复用在GitLab 15.7上学习到的冻结状态时保持了性能,冻结版本与目标版本之间的差距在GitLab 16.11上仅为-1.7个百分点,在GitLab 18.9上为+0.6个百分点;而退化最少的持久性基线则下降了10.6–11.1个百分点。这些结果将生命周期治理和门控条件执行确定为超越一次性任务成功的可靠性维度。代码、数据和评估脚本可在[https://github.com/Am1n3e/skill-nb.git](https://github.com/Am1n3e/skill-nb.git)获取。

## 1 引言

AI智能体越来越多地生成并依赖持久化的外部制品,如代码、工作流和过程性记忆[22, 43, 41, 27]。随着这些制品被复用,核心问题从一次性的任务完成转变为:当条件变化时,例如Web智能体的目标站点改变了用户界面或数据布局,制品是否仍然有效[19]。近期的记忆和工作流系统将智能体经验视为可复用[50, 48, 7, 41, 27],但重复使用引入了软件维护的生命周期问题[31]:制品需要版本控制、验证、修复、回归控制,以及在假设失效时退役。现有的以记忆为中心的系统通常将经验作为提示上下文复用,而工作流和制品系统则提供了执行、验证、版本控制或状态管理原语[41, 27, 23, 10, 20, 26]。这些机制通常被分开研究,而非作为联合的生命周期策略。对于持续自动化而言,问题不仅仅是如何回忆过往经验,而是累积的执行证据应如何治理可复用工作流:何时提升一个候选方案,何时形式化一个步骤,何时修复或降级脆弱的实现,以及何时退役一个假设不再成立的工作流。

我们在Web环境中研究这个生命周期问题,因为Web环境为评估学习到的制品提供了高漂移场景。站点的变化超出了自动化系统的控制:与通常可以固定版本的桌面应用程序或通常暴露明确契约并宣布破坏性变更的API不同,Web界面可能会在没有保留自动化锚点(如选择器或布局)的情况下发生漂移。尽管API通常是首选的自动化接口,但许多真实工作流仍依赖于UI层面的交互[47]。因此,自动化Web工作流强制了形式化的选择:哪些步骤应硬化成代码,哪些应保留为自然语言引导(NL引导),当界面漂移使重复修复成本过高时该如何选择。作为一个极端情况,数学自动形式化说明了完全形式化的终点:将非正式论证翻译成证明助手制品(如*Lean*)会得到由定义良好的逻辑内核检查的项[3, 42, 14]。持久化的智能体工作流则处于这个谱系的中间点。将步骤保留为NL引导保持了灵活性,但削弱了制品层面的控制;而将其硬化成代码则使复用更可控,但在漂移下可能变得脆弱。因此,其有效性既取决于任务层面的过程,也取决于依赖环境且其假设可能被打破的实现方式。因此,对于持久化工作流,形式化是由生命周期治理的。系统必须决定何时创建或退役一个工作流,哪些步骤应保留为NL过程而不是可执行代码,以及当界面漂移时,执行证据何时应促使修订这些选择。

我们提出**SKILL.nb**,一个为可复用智能体工作流学习基于证据的生命周期策略的框架。其核心机制是*选择性形式化*:利用执行证据决定哪些步骤保留为NL引导,哪些成为可执行代码,以及何时应修订这些选择。SKILL.nb将此与*门控条件执行*相结合:运行时门控决定是执行代码还是回退到NL过程。每个工作流被表示为一个可审计、可版本化的笔记本,其中交织了NL引导、可执行代码、验证门控、回退路径和单元格级证据。附录A.1展示了一个临时任务笔记本如何被提升为已发布的工作流。离线生命周期学习将轨迹聚合成用于工作流创建和步骤形式化的证据计数,以及接受修复信号(包括修复次数和以令牌加权的修复负担作为步骤降级和工作流退役的不稳定性代理)。通过回放候选生命周期策略在历史工作流上的表现来校准阈值,选择那些验证失败率保持在预算内的低维护策略。这种校准使用累积的执行证据而非隐藏的评估器标签,并且仍然是相对于回放的,而非对未来界面变化的保证。

由于Web漂移使得硬化代码有用但易碎,表示形式必须保留执行证据,而不仅仅是指令。否则,维护无法判断代码是仅仅被建议过还是实际运行过,哪些门控验证了它,它产生了什么证据,或者执行何时回退。这就提出了一个自然的问题:为什么不使用传统的`SKILL.md`文件包含指令和代码片段?Markdown可以描述代码,但它本身并不记录执行边界、门控结果、回退或单元格局部证据。SKILL.nb通过将这些对象存储为版本化笔记本,使代码执行成为一等公民且可审计。附录A.3沿着四个轴比较了这两种表示形式:可执行工作流状态、验证反馈、证据保留和失败定位。

实验上,SKILL.nb提高了单次任务性能和受控重复使用的可靠性。在WebArena-Verified[5]上,它在比较方法(CodeAct[39]、AWMonline[41]和ReasoningBank[27])中实现了最高的单轮成功率53.7%,优于次优方法3.9个百分点(配对McNemar检验,p=0.029)。在受控重复执行中,SKILL.nb在三次重新执行中保留了91.7%的初始成功任务,比次优方法高出15.5个百分点。在有限修复条件下,它恢复了72.9%的后续失败,同时将修复后的回归率限制在4.2%,而持久性基线在其原生更新路径下的回归率为15.0%–17.0%。作为在Mind2Web[4]上的二次迁移评估,SKILL.nb在跨网站和跨领域拆分的所有四个指标上均领先,步骤成功率分别达到38.1%和39.7%。在一次受控的GitLab迁移测试中,SKILL.nb在复用在GitLab 15.7上学习的冻结状态时保持了目标版本性能,而持久性记忆基线下降了10.6–14.4个百分点。这些结果表明,治理过的工作流制品在这些评估协议下改进了任务完成、复用、修复和回归控制。

我们的主要贡献总结如下:

- • 将持久化Web智能体自动化形式化为*选择性形式化*和生命周期治理,用于可复用、可执行的制品,这些制品必须在假设失效时被形式化、验证、修复和退役。
- • 提出SKILL.nb,一个笔记本原生框架,将选择性形式化与门控条件执行相结合,实现可版本化的工作流,混合了NL引导、可执行单元格、验证门控、回退和可审计的多模态执行证据。
- • 在WebArena-Verified和Mind2Web上评估SKILL.nb,展示了在比较方法中最高的单轮性能以及重复WebArena-Verified执行中改进的保留率、修复恢复和回归控制,并包含一个受控的GitLab版本漂移协议,比较应用迁移后新鲜运行与旧状态复用的表现。

## 2 相关工作

**智能体经验记忆。** 记忆是智能体的重要模块[46],其表示形式从虚拟分页[28]和结构化图[1, 44]到分层工作记忆与巩固机制[12, 34, 51]不等。另一条互补的工作线侧重于复用过往经验用于未来任务。例如,Synapse检索原始轨迹作为上下文示例[50],而ExPeL和MemP则将经验提炼为过程性见解和记忆[48, 7]。在此基础上,Agent Workflow Memory (AWM)和ReasoningBank将执行轨迹抽象为可复用工作流和推理策略[41, 27]。关键在于,所有这些系统中,检索到的经验仍然是*建议性*的提示上下文:它指导生成,但本身并不被原生执行、验证或版本控制。SKILL.nb通过将内存操作化为受治理、可执行的工作流制品,并由确定性接受检查(而非随机性LLM判断)验证,弥合了这一差距。

**自进化智能体。** 持续适应是自主智能体的核心需求[8, 21]。为了实现跨任务进化,系统维护精炼的因果抽象(CLIN[25])、构建训练课程[33]或整合可迁移的推理策略(ICE[30]、ChemAgent[35]、Contextual Replay[24])。与我们的方法更接近的是Voyager和TroVE,它们通过探索构建可执行代码的开放式技能库[38, 40]。然而,由于这些方法通常将提炼出的教训或技能追加到记忆中而没有严格的生命周期门控,单个错误更新可能悄无声息地破坏智能体未来的行为。SKILL.nb通过强制受治理的进化来缓解这一风险:候选更新仅在线下验证和确定性门控检查之后才能进入存储库,从而在发生回归时实现安全回滚。

**持久化智能体制品。** 随着智能体产生持久化输出,治理其创建、验证和维护变得至关重要。系统通常通过版本化执行日志和局部修复(ALAS[10])、类似Git的状态检查点(AgentGit[20])或迭代式笔记本精炼[45, 6]来管理这种进化。在运行时层面,Atomix对工具调用强制执行严格的事务语义[26],而ReUseIt则从重复尝试中合成带门控的工作流[23]。然而,ReUseIt通过随机性的LLM截图分析验证这些门控,其他互补系统在失败时严重依赖人在回路中的监督[29, 13]或外部技能归纳[36, 49]。SKILL.nb区别于这些方法之处在于,它完全离线治理制品生命周期,用确定性门控检查和轨迹回放校准取代随机运行时验证和人工监督。

综上所述,前期工作提供了记忆、工作流归纳和制品治理方面的孤立原语。SKILL.nb将这些线索整合成一个统一的生命周期,补充了记忆复用框架、技能归纳系统和制品管理器。

## 3 SKILL.nb

我们提出SKILL.nb,一个在线-离线框架,用于治理可复用工作流制品,采用受RLVR启发的、偏爱执行基础证据的策略。

相似文章

Formal Skill: 面向高效精准LLM智能体的可编程运行时技能

arXiv cs.AI

本文介绍了Formal Skill,这是一种面向LLM智能体的运行时原生抽象,它将可重用流程编码为可执行状态机,配有JSON元数据、Python执行器和钩子控制的逻辑。还介绍了一个名为FairyClaw的开源实现,在Harness-Bench上展示了具有竞争力的性能,且减少了token使用量。

SkillGen:经过验证的推理时代理技能合成

arXiv cs.LG

本文介绍了 SkillGen,这是一个多智能体框架,通过对比成功和失败的轨迹来合成和验证可复用的推理时大语言模型(LLM)代理技能。该方法确保技能可审计,并通过实证验证其对代理性能具有净正面影响。

SkillOpt:自我进化智能体技能的执行策略

Hugging Face Daily Papers

SkillOpt 引入了一种系统化的文本空间优化器,用于智能体技能。该优化器将技能训练为智能体的外部状态,具有稳定的更新和零部署推理开销,在多个基准测试和执行环境中实现了卓越性能。