@omarsar0: 微软研究院的新研究 我看到很多AI工程师手写智能体技能文档,并希望它们能泛化。…
摘要
微软研究院推出了SkillOpt,该方法将智能体技能文档视为可训练的外部状态,利用优化器模型进行受限编辑,并通过预留集进行验证。该方案在52个评估单元中取得最佳或并列结果,在GPT-5.5上准确率提升超过23个百分点,且零额外推理成本,技能可迁移。
查看缓存全文
缓存时间: 2026/05/25 16:41
微软研究院的新研究 我看到很多AI工程师手动编写智能体技能文档并希望它们能泛化。这很可能并非最优方案。本工作解释了其原因。它将技能文档视为冻结智能体的可训练外部状态。本文介绍了SkillOpt,其中优化器模型会基于验证门控对技能文件进行编辑。它会增加、删除或替换指令,并使用文本学习率控制每轮重写文档的激进程度。智能体本身从不改变。SkillOpt 在所有52个(模型、基准、工具链)组合上达到最佳或持平。在GPT-5.5上,它在直接对话模式下比无技能提升23.5点,在Codex中提升24.8点,在Claude Code中提升19.1点。它超越了人类编写的技能、TextGrad、GEPA和EvoSkill,且推理时零额外成本,学习到的技能可跨模型和工具链迁移。论文:https://arxiv.org/abs/2605.23904 在我们的学院学习构建高效AI智能体:https://academy.dair.ai — # 引言 来源:https://arxiv.org/html/2605.23904
2026年5月 SkillOpt:自演化智能体技能的执行策略 杨一帆¹,,‡ 龚子扬², 黄炜权³,* 杨启豪²,* 周子维⁴,* 黄紫苏⁴,* 李岩² 高雪梅¹ 戴琦¹ 刘贝¹ 邱凯¹ 杨玉清¹ 陈东东¹ 杨雪²,‡ 罗翀¹ ¹微软 ²上海交通大学 ³同济大学 ⁴复旦大学 如今的智能体技能要么手工制作,要么一次性生成,要么通过松散控制的自修订进行演化——这些方式没有一种像深度学习优化器那样作用于技能,也无法在反馈下可靠地超越其起点。我们认为技能应该被训练为冻结智能体的外部状态,并遵循与权重空间优化相同的原则,使其可复现。SkillOpt,据我们所知,是首个面向智能体技能的系统性可控文本空间优化器:一个独立的优化器模型将带分数的轨迹转化为对单个技能文档的有界增/删/改编辑,并且只有当编辑能严格提升保留验证集分数时才被接受。文本学习率预算、拒绝编辑缓冲区以及逐轮次慢/元更新使技能训练稳定,同时在部署时推理阶段零额外模型调用。在六个基准测试、七个目标模型和三个执行工具链(直接对话、Codex、Claude Code)上,SkillOpt 在所有 52 个评估的(模型、基准、工具链)组合中达到最佳或持平,并击败了包括人类、单次LLM、Trace2Skill、TextGrad、GEPA 和 EvoSkill 技能在内的每个组合的现有最优方法。在 GPT-5.5 上,它将无技能的平均准确率在直接对话中提升了+23.5点,在 Codex 智能体循环中提升了+24.8点,在 Claude Code 中提升了+19.1点。迁移实验进一步表明,优化后的技能制品在跨模型规模、在 Codex 和 Claude Code 执行环境之间以及迁移到邻近数学基准(无需进一步优化)时,仍保留价值。代码:https://aka.ms/SkillOpt 通讯作者:[email protected] (https://arxiv.org/html/2605.23904v1/mailto:[email protected]), [email protected] (https://arxiv.org/html/2605.23904v1/mailto:[email protected]) 共同第一作者。‡通讯作者。 参见图释 图1:SkillOpt 概览。目标模型使用当前技能执行任务,额外的前沿优化器模型将轨迹转化为有界增/删/改技能编辑,保留验证门控仅接受能提升验证性能的编辑。接受的编辑导出为可复用的技能制品,而拒绝的编辑则成为后续更新的负反馈。 前沿语言模型越来越多地被部署为智能体——从单提示调用者到带有工具、文件和验证器的多步执行工具链[39 (https://arxiv.org/html/2605.23904#bib.bib4), 26 (https://arxiv.org/html/2605.23904#bib.bib9), 32 (https://arxiv.org/html/2605.23904#bib.bib8), 37 (https://arxiv.org/html/2605.23904#bib.bib10)]。在此类设置中,领域适应不再仅仅关乎模型权重或提示:它还需要改进智能体收集证据、调用工具、遵循领域惯例以及格式化输出的流程*[36 (https://arxiv.org/html/2605.23904#bib.bib2), 11 (https://arxiv.org/html/2605.23904#bib.bib3)]。智能体技能为此类流程适应提供了自然接口[12 (https://arxiv.org/html/2605.23904#bib.bib14),10 (https://arxiv.org/html/2605.23904#bib.bib15)]:技能是一种可移植的自然语言制品,封装了流程、领域启发式规则、工具策略、输出约束和失败模式,使冻结的智能体能够通过外部文本进行适应。如果适应的核心对象是智能体的流程,那么技能文档本身应该是可训练的。然而,对于封闭的前沿模型,权重适应通常不可用,对于开放模型则成本高昂,而手动编写或一次性生成的技能在目标领域或工具链下往往脆弱。最近的系统将执行经验转化为可复用的文本制品——从轨迹中提取教训,通过失败分析完善技能文件夹,构建领域特定的技能库,或从轨迹反馈中优化提示[19 (https://arxiv.org/html/2605.23904#bib.bib19), 2 (https://arxiv.org/html/2605.23904#bib.bib20), 13 (https://arxiv.org/html/2605.23904#bib.bib21), 27 (https://arxiv.org/html/2605.23904#bib.bib17), 1 (https://arxiv.org/html/2605.23904#bib.bib11)]——但留下了一个更基本的问题:如果技能是适应层,它们应如何被优化? 我们的核心思想是将技能编辑视为一个可控的领域适应过程,将技能文档作为外部状态,将额外的前沿模型作为优化器,并采用训练风格的控制来管理证据、步长、验证和更新方向。我们引入了SkillOpt,一种用于智能体技能的文本空间优化器。给定一个目标域、一个初始技能以及被适应的模型,SkillOpt重复采样轨迹批次,分析成功与失败,并让前沿优化器模型提出结构化的增/删/改编辑。然后,它在文本学习率预算下聚合并排序候选编辑,对技能文档应用有界更新,并在接受之前对候选技能在保留的选择集上进行评估。被拒绝的编辑作为负反馈保留,而逐轮次慢/元更新则保留了更长时程的规律性。图1 (https://arxiv.org/html/2605.23904#S1.F1)示意了此循环。部署输出是一个紧凑的best_skill.md文件,约300–2,000词元,而适配的模型和执行工具链保持不变。 深度学习的类比是操作性的而非装饰性的。滚动和反思批次大小控制每次编辑所用证据的噪声;文本学习率及其调度控制一个技能版本允许从前一个版本偏离多远;保留门控扮演验证的角色;逐轮次慢/元更新起到动量项的作用,跨轮次传递稳定的编辑方向。这种稳定性至关重要:如果连续的技能修订偏离太远或方向不一致,被拒绝的编辑和之前接受的编辑将无法提供有意义的优化历史。通过有界、验证门控的更新,每次修订仍足够接近上一次,使得后续优化器调用能够从哪些有帮助、哪些失败、哪些应保留中学习。 据我们所知,我们首次系统性地研究了作为前沿智能体领域适应训练方法的技能优化。我们在六个基准测试上评估SkillOpt,涵盖问答、电子表格、文档、数学和具身决策,涉及从前沿规模的GPT到小规模Qwen的七个目标模型,并在三种执行模式(直接对话、Codex工具链、Claude Code工具链)下进行。在52个评估的(模型、基准、工具链)组合中,SkillOpt在所有52个上是最佳或并列最佳的方法。在GPT-5.5直接对话中,它将SearchQA从77.7提升至87.3,SpreadsheetBench从41.8提升至80.7,OfficeQA从33.1提升至72.1,DocVQA从78.8提升至91.2,LiveMathematicianBench从37.6提升至66.9,ALFWorld从83.6提升至95.5(平均比无技能提升+23.5点),并且它也比来自人类编写、一次性LLM、Trace2Skill、TextGrad、GEPA和EvoSkill技能的最强每个组合基线平均高出+5.4点。同样的优化接口在Codex风格和Claude Code风格执行循环内也有效,分别比无技能提升了GPT-5.5的+24.8点和+19.1点,并分别比EvoSkill高出+14.0点和+3.2点。 学习到的制品也能迁移到精确训练设置之外。在GPT-5.4上训练的SpreadsheetBench技能改进了我们测试的每个更小GPT变体;Codex训练的电子表格技能迁移到Claude Code时获得+59.7点的提升;而OlympiadBench技能在Omni-MATH[6 (https://arxiv.org/html/2605.23904#bib.bib38)]上产生正向增益。这些迁移结果对该论文的应用价值很重要:技能可以优化一次,作为文本进行审计,并在相关模型、工具链或任务之间重用,而无需更改模型权重。 我们的消融实验解释了其工作原理。有界文本学习优于无控制的改写,保留门控防止有害提议累积,拒绝步骤缓冲区将失败编辑转化为负反馈,逐轮次慢/元改进了长时程精炼而不会膨胀已部署的技能。最后,每个基准的案例研究表明,学习到的技能保持紧凑(仅11–44次接受编辑后为300–2,000词元)、可审查且是过程性的而非实例特定的。 我们的贡献如下: - • 我们将智能体技能学习形式化为对自然语言外部状态的优化,并引入SkillOpt,一种与工具链无关的优化器,具有滚动批次、反思小批次、增/删/改编辑、文本学习率、调度、保留接受、拒绝编辑缓冲区和逐轮次慢/元更新。 - • 我们提供了跨六个基准、七个目标模型和三个执行工具链的广泛实证研究,显示SkillOpt在52个组合上全部最佳或并列最佳,并在每个模型下优于无技能、人类技能、一次性LLM技能、提示优化(TextGrad, GEPA)和技能演化(Trace2Skill, EvoSkill)基线。 - • 我们通过组件消融和三种形式的迁移(跨模型、跨工具链、跨基准)验证了优化设计,显示导出的技能制品紧凑、可重用且无需模型权重更新即可部署。 ## 相关工作 ##### 提示自动调优与智能体配置搜索。GEPA展示了轨迹反馈可以指导反思性提示演化,并在若干语言智能体任务上优于强化学习[1 (https://arxiv.org/html/2605.23904#bib.bib11)]。ABSTRAL和EvoTest将这一思想从单一提示扩展到多智能体设计文档和测试时智能体系统演化,无需梯度或微调[30 (https://arxiv.org/html/2605.23904#bib.bib27), 9 (https://arxiv.org/html/2605.23904#bib.bib13)]。通过将语言制品视为可优化对象,这些方法可以直接利用执行反馈,但它们主要针对提示、系统设计或完整配置,而非可重用的领域适应。SkillOpt则优化一个持久的技能文档,该文档可以被训练、验证、导出并与适配模型一起重用,将语言级可控性应用于稳定的程序技能状态。 ##### 技能构建与技能演化。SkillsBench和关于智能体技能的SoK将技能定义为可重用的程序性知识,涵盖工具策略、适用条件、执行例程和支持资源[12 (https://arxiv.org/html/2605.23904#bib.bib14), 10 (https://arxiv.org/html/2605.23904#bib.bib15)]。先前的系统从终身经验、轨迹教训、技能知识库或异构领域资源中构建此类技能[38 (https://arxiv.org/html/2605.23904#bib.bib16), 19 (https://arxiv.org/html/2605.23904#bib.bib19), 31 (https://arxiv.org/html/2605.23904#bib.bib18), 27 (https://arxiv.org/html/2605.23904#bib.bib17), 5 (https://arxiv.org/html/2605.23904#bib.bib26)],并通过失败分析、创建-评估-修订循环、共同演化生成器和验证器、集体更新或强化学习进一步改进它们[2 (https://arxiv.org/html/2605.23904#bib.bib20), 13 (https://arxiv.org/html/2605.23904#bib.bib21), 41 (https://arxiv.org/html/2605.23904#bib.bib22), 15 (https://arxiv.org/html/2605.23904#bib.bib23), 35 (https://arxiv.org/html/2605.23904#bib.bib24), 33 (https://arxiv.org/html/2605.23904#bib.bib25), 23 (https://arxiv.org/html/2605.23904#bib.bib28), 18 (https://arxiv.org/html/2605.23904#bib.bib29), 34 (https://arxiv.org/html/2605.23904#bib.bib30)]。虽然这些工作强调技能发现、存储库增长、共享、演化搜索或策略优化,SkillOpt研究了一个更窄的问题:如何使用深度学习风格的控制(如轨迹批次、反思小批次、文本学习率、验证门、拒绝编辑缓冲区和慢/元更新)来训练一个紧凑的领域技能。这产生了一个可控且可审计的过程,用于生成可移植的best_skill.md,而无需改变模型权重。 ## 方法 参见图释 图2:SkillOpt 的流程。冻结的目标模型使用当前技能执行一个滚动批次;优化器模型对成功和失败进行小批次反思,提出有界的增/删/改编辑,在调度的编辑预算下合并和排序,并仅通过保留验证门控接受候选技能。跨轮次时,慢/元更新保留了更长时程的经验,而不改变目标模型。 ### 问题设定 技能ss是一种自然语言策略,在执行前插入智能体上下文中,这与近期将技能视为智能体可重用程序性知识的工作一致[12 (https://arxiv.org/html/2605.23904#bib.bib14), 10 (https://arxiv.org/html/2605.23904#bib.bib15)]。在直接对话基准中,它被前置到系统或开发者指令中;在工具使用工具链中,它成为持久的程序性记忆。我们用MM表示冻结的目标模型,其行为通过技能优化进行适应。对于工具链hh、任务xx和技能ss,执行产生一个轨迹τ\tau和一个标量分数rr: (τ(s),r(s)) = h(M,x,s), r(s) ∈ [0,1]. (1) 给定训练集、选择集和测试集Dtr,Dsel,Dtest,SkillOpt使用Dtr生成一组候选技能C(Dtr),在Dsel上选择最佳技能,并在Dtest上报告最终性能: s_sel⋆ = arg max_{s∈C(Dtr)} (1/|Dsel|) ∑{x∈Dsel} r(s), (2) Test(s_sel⋆) = (1/|Dtest|) ∑{x∈Dtest} r(s_sel⋆). (3) 训练集提供经验,选择集门控更新,测试集仅用于评估。
相似文章
@pauliusztin_: Microsoft 刚刚开源了今年我见过的最有趣的智能体工程项目之一…… → https://git…
Microsoft 开源了 SkillOpt,这是一个将智能体技能文档视为可训练产物的框架,通过迭代反馈循环优化它们,而无需修改模型权重。它作为一个 Python 库提供,支持自我演进的智能体技能。
@MSFTResearch: AI智能体常常失败,因为它们的指令(或技能)是手动修改的,无法保证改进。Lea…
SkillOpt将AI智能体的技能编辑从手动修改转变为训练过程,在不改变模型权重的情况下提高智能体可靠性,并在多个基准测试中取得一致提升。
@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2069064122218717387
本文探讨了AI代理如何利用微软研究院的SkillOpt等技术自动编写和优化其技能文件,该技术将技能文档视为可训练状态,并带来显著的性能提升。文章还解决了手动技能调优的挑战,并介绍了GEPA和EvoSkill等进化方法的框架。
@oliviscusAI: 微软刚刚开源了自我进化的智能体技能。它叫做 SkillOpt。技能能像训练AI模型一样自我改进……
微软开源了 SkillOpt,这是一个能让AI智能体技能自我改进的工具,通过自动评估和重写指令,无需绑定特定模型,即可超越手工制作的提示和其他优化器。
@Yif_Yang: 介绍 SkillOpt — 一个面向智能体技能的优化器。不再微调模型权重,而是将自然语言…
介绍 SkillOpt,一个将自然语言技能视为可训练外部参数而非微调模型权重的优化器。它通过有界编辑和验证门控实现稳定、可控的技能更新,在 7 个模型的 6 个基准测试的 52 个设置中取得最佳或并列最佳结果。