编写、执行、优化:通过执行反馈的强化学习从技能跟随者到技能优化者

arXiv cs.CL 论文

摘要

本文介绍了一种多阶段框架WER,它使用执行反馈的强化学习来训练技能优化器,以改进工具使用代理,在BFCL v4和τ2-bench等基准测试中实现了显著的性能提升。

arXiv:2608.17587v1 公告类型:新 摘要:专家编写的自然语言技能可以改进工具使用代理,但代理编写的技能比不使用技能表现差8-11分。这一差距表明,遵循程序化指导并从执行证据中改进它是不同的能力。推理时间循环可以修复技能,但不会改进编写下一个技能的模型。我们研究如何将中间技能的执行经验组织为优化器的训练状态。我们引入了WER(编写、执行和优化),这是一个多阶段框架,在冻结执行器外训练技能优化器。优化器提出技能,冻结代理反复执行每个技能,程序验证器对结果进行评分。分数提供相对信用并选择混合结果记录。从这些记录中匹配的成功和失败轨迹形成下一阶段的细化状态,因此优化器从其早期输出的后果中学习。在BFCL v4多轮和τ2-bench上,WER相比无技能基线平均Pass@1分别提高了7.80和3.85分。在相同的细化工作流下,它比未训练优化器的相同骨干网络分别高出9.35和10.29分。训练后的4B优化器在BFCL v4上达到76.63%,平均优于所有评估的现成通用模型用作技能优化器。
查看原文
查看缓存全文

缓存时间: 2026/08/19 10:00

# 从技能遵循者到技能优化器:基于执行反馈的强化学习路径  
来源:https://arxiv.org/html/2608.17587

## 编写、执行、优化:通过执行反馈强化学习实现从技能遵循者到技能优化器的演进  
彭康<sup>1</sup>, 张志伟<sup>1</sup><sup>脚注1</sup><br>
<sup>1</sup> 香港中文大学  
<sup>1</sup> 教育部高可信软件技术重点实验室  
张奕晨<br>
哈尔滨工业大学,中国哈尔滨 / 华为技术有限公司<br>
[1mm] [email protected], [email protected]<br>
王泽中<br>
香港中文大学<br>
杜逸鸣<br>
香港中文大学<br>
屠耿<br>
哈尔滨工业大学深圳,中国<br>
王保军  
梁斌<br>
香港中文大学  
教育部高可信软件技术重点实验室<br>
许瑞丰<sup>致谢:通讯作者。</sup><br>
哈尔滨工业大学深圳,中国<br>
黄锦辉<br>
香港中文大学  
教育部高可信软件技术重点实验室  

###### 摘要  
专家编写的自然语言技能可提升工具使用智能体的性能,但由智能体自主生成的技能比不使用任何技能时表现低8–11分。这一差距表明,遵循流程化指导与基于执行证据改进指导是两项不同的能力。推理时循环虽能修复技能,却无法优化生成技能的模型本身。本研究探讨如何将中间技能的执行经验组织为优化器的训练状态。我们提出**WER(编写-执行-优化)**框架,该多阶段框架在冻结执行器外部训练一个技能优化器。优化器提议技能,冻结智能体反复执行每个技能,程序化验证器对结果进行评分。分数提供相对奖励并筛选出具有混合结果的记录。从这些记录中匹配的成功与失败轨迹构成下一阶段的优化状态,使优化器能从其早期输出的后果中学习。在BFCL v4多轮对话和τ²-bench基准测试中,WER相比无技能基线平均Pass@1分别提升7.80和3.85分。在相同优化流程下,相比未经优化器训练的同主干模型,WER在两项测试中分别高出9.35和10.29分。仅40亿参数的训练后优化器在BFCL v4上达到76.63%的成绩,平均表现优于所有评估的通用现成模型作为技能优化器的表现。代码已发布于:https://github.com/littlepkk/WER4skill-optimizer-training  

## 1 引言  

可靠的工具使用需要程序性知识:调用何种工具、如何验证参数、何时重试[28];[14];[13]。一种常见方法是将这些知识表示为*技能*——在推理时添加到智能体上下文中的精炼自然语言指令[20];[5]。在SkillsBench基准测试中[7],专家整理的技能将平均通过率从33.9%提升至50.5%,但智能体自主编写的技能表现反而比不使用任何技能时低8–11分。这揭示了能力缺口:智能体能从程序化指导中显著受益,却无法可靠地编写这种指导。  

针对这一缺口,常见解决方案是采用推理时循环:由大语言模型草拟技能、观察执行结果并进行修订[18];[8];[1];[27];[9]。更广泛地说,反思轨迹与执行结果并将经验提炼为可复用知识,已成为改进智能体的常规工作流程。但该流程预设了一项语言模型可能无法可靠具备的能力:将行为证据转化为防止观察到的失败所需的程序性指令。尽管此类循环能改进当前成果,但技能编写器本身通常保持不变:每个新任务仍需依赖基础模型诊断执行日志并将失败转化为通用流程修正,而标准预训练或指令微调并未直接优化这种基于执行的反思能力。看似合理但错误的修正代价高昂:仅注入10%合理但错误的经验就会使τ²-bench Pass@1从82.5降至77.2,而自我验证几乎无法挽回损失(83.3→83.2)[31]。因此,推理时修复单个技能本身并不能教会编写器如何修复下一个技能。  

近期强化学习方法已证明技能改进本身可被学习。SkillMaster[26]通过反事实探测评估学习剧集后的技能突变;SkillOS[12]根据技能更新在后续任务中的效用训练技能仓库管理;Skill-R1[19]结合代内与代间优势优化递归技能修订。这些方法超越了固定技能编写器的提示模式,转而学习优化策略。在此新兴方向中,我们提出一个补充性训练问题:应如何将中间技能的执行经验结构化为训练技能优化器的优化状态?为研究此问题,我们构建了迭代技能优化的多阶段训练框架,协同设计其执行机制、奖励分配和跨阶段经验构建。验证结果既用于比较候选修订,也用于筛选并重组具有诊断价值的成功与失败轨迹,形成下一阶段的优化状态。通过跨阶段复用此经验,优化器学会修正其先前输出暴露的特定缺陷。  

我们将此框架实例化为**WER(编写、执行、优化)**。技能优化器πθ保持沙箱外部运行(图1),提议技能的多个修订版本。冻结的技能条件智能体反复执行每个候选方案,确定性验证器提供群体相对奖励。具有混合结果的候选方案尤其具有信息量:在任务、技能与执行器固定的情况下,它们的成功与失败轨迹提供了不同行为分支的可控局部比较。WER将这些配对证据与相应技能重组为下一阶段的优化状态。因此,WER在不修改下游智能体的情况下,基于优化器自身先前输出的执行后果进行训练。  

我们的主要贡献包括:  
- • 识别优化状态构建是迭代技能优化训练的核心问题,并将技能优化器构建为专门处理技能文档的执行条件策略。  
- • 引入阶段式自举方法,结合候选级相对优化与跨阶段诊断经验构建(基于匹配的成功与失败执行)。  
- • 在相同优化流程下,WER相比未经优化器训练的同主干模型,在BFCL v4多轮对话[13]和τ²-bench[2]测试中平均Pass@1分别提升9.35和10.29分。尽管仅有40亿参数,训练后的技能优化器在BFCL v4上的表现仍优于所有评估的通用现成模型作为同角色优化器的表现,证明专门优化训练能带来超越通用上下文推理的性能提升。  

## 2 相关工作  

#### 技能构建与推理时优化  

许多系统将技能表示为外部自然语言产物,可在不改变执行模型的情况下创建、存储、检索和修订。Voyager[20]构建可执行技能库,Trace2Skill[11]从单条轨迹中提取经验并组织为可迁移的技能目录。SkillsBench[7]和近期系统化研究[5]探讨了这些产物的价值与生命周期。其他系统利用执行反馈在推理时优化技能。EvoSkill[1]基于失败分析推导修订;SkillOpt[27]在验证约束下编辑技能文档;SkillRevise[9]根据执行轨迹进行连续修订。Execute-Distill-Verify[31]通过异构执行与共识验证进一步提升可靠性。在这些系统中,技能可能演变,但编写技能的现成模型通常不会从优化经验中学习。  

自动提示优化体现了相似区别。OPRO、PromptAgent、EvoPrompt、DSPy和TextGrad通过搜索、任务反馈、示范或文本梯度改进文本产物[25];[22];[3];[6];[29]。这些方法优化当前产物。WER保持外部文本接口,但从多轮轨迹和有状态工具环境中程序化验证的结果中训练技能优化器本身。  

#### 智能体强化学习中的技能  

大多数增强技能的强化学习方法更新任务智能体本身。SAGE[21]将技能库集成到GRPO中;Skill1[17]联合学习技能选择、利用与蒸馏;SkillRL[23]在智能体策略旁递归演化外部蒸馏技能库。ReSkill[4]同样评估竞争性技能库版本,同时执行器持续学习。另一方向将技能内化到模型参数中:Skill0[10]在训练过程中逐步移除外部技能;Skill0.5[30]结合通用技能内化与特定任务检索。在这些方法中,适应发生在执行模型中或与其共同发展。WER研究不同场景:执行器保持冻结,而独立策略学习修订调节它的自然语言指令。  

#### 学习的技能管理与优化  

最接近的工作训练技能级决策本身。SkillMaster[26]审查完成的轨迹,在每个剧集后提议、更新或保留技能,并通过相关探测任务的反事实评估提议的突变。SkillOS[12]训练独立管理器在外部仓库中插入、更新或删除条目,使用相关流中的后续任务衡量这些更新的长期效用。Skill-R1[19]冻结任务模型,训练轻量级技能生成器跨越多代,结合代内执行比较与跨代改进。这些方法在不同决策与奖励跨度上学习技能改进:剧集后的突变、在后续任务上评估的仓库操作、递归世代间的进步。WER在代内奖励分配与跨阶段经验构建上有所不同。同一优化状态的替代方案在组内比较,而同一中间技能的混合结果执行被配对形成下一阶段的优化状态。因此,优化器基于其自身先前修订的选定执行后果进行训练。  

## 3 方法  

图2:训练循环。优化状态由任务上下文、交互历史和当前技能组装而成,技能优化器从中采样K个候选技能(§3.1)。冻结的技能条件智能体在沙箱中执行每个候选方案,生成轨迹和验证器结果(§3.2)。结果为更新πθ提供群体相对优势(§3.3),而技能和轨迹进入经验缓冲区以组装下一阶段状态(§3.4)。如左图所示,保留的技能为下一轮候选方案提供种子,形成跨阶段修订树。为清晰起见,图中显示二值验证器奖励;实际奖励还包括公式4中的格式和长度项。  

我们考虑一个通过调用工具解决多轮任务的智能体,它作用于有状态环境,并在任务描述之外接收一份简短的自然语言技能以指导执行过程。环境会对任务进行评分:当终端状态与参考解决方案匹配时即视为成功。我们的研究对象不是智能体,而是它被赋予的技能,因此框架只有一个核心组件:一个接收技能及其运行时记录并返回更优技能的策略。其他所有组件都致力于真实生成该记录。图2展示了该循环。我们在两个暴露程序化验证器的多轮有状态工具环境中实例化该循环:BFCL多轮对话[13]和τ²-bench[2],完整配置见实验设置部分。我们在§3.1定义该算子,在§3.2描述执行结果传递给算子的两个通道,§3.3给出优化过程,§3.4将该算子应用于其跨阶段的输出。  

### 3.1 作为可学习算子的技能优化  

技能只有在作为具有明确效果的精确定义对象时才能被重写,因此我们在定义编辑策略前先固定这两点。  

#### 技能  

技能是一份简短的Markdown文档,包含四个部分:名称、覆盖任务族的一行描述、带编号的工作流程、以及记录假设、边缘情况和已知故障模式的注释列表。执行时技能正文会前置到下游智能体的系统提示中,且不

相似文章

@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2069064122218717387

X AI KOLs Timeline

本文探讨了AI代理如何利用微软研究院的SkillOpt等技术自动编写和优化其技能文件,该技术将技能文档视为可训练状态,并带来显著的性能提升。文章还解决了手动技能调优的挑战,并介绍了GEPA和EvoSkill等进化方法的框架。

SkillOpt:自我进化智能体技能的执行策略

Hugging Face Daily Papers

SkillOpt 引入了一种系统化的文本空间优化器,用于智能体技能。该优化器将技能训练为智能体的外部状态,具有稳定的更新和零部署推理开销,在多个基准测试和执行环境中实现了卓越性能。