SkillOpt:自我进化智能体技能的执行策略
摘要
SkillOpt 引入了一种系统化的文本空间优化器,用于智能体技能。该优化器将技能训练为智能体的外部状态,具有稳定的更新和零部署推理开销,在多个基准测试和执行环境中实现了卓越性能。
查看缓存全文
缓存时间: 2026/05/25 02:35
Paper page - SkillOpt: Executive Strategy for Self-Evolving Agent Skills
来源:https://huggingface.co/papers/2605.23904 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
SkillOpt 引入了一个系统化的文本空间优化器,用于智能体技能训练,将技能作为外部智能体状态进行训练,具有稳定的更新和零部署推理开销,在多个基准测试和执行环境中均表现出卓越性能。
当前的智能体技能(https://huggingface.co/papers?q=Agent%20skills)要么通过人工编制,要么一次性生成,要么通过松散控制的自我修订进行演化,这些方法都无法像深度学习优化器那样作用于技能,并且无法在反馈下可靠地超越其初始起点。我们认为,技能应该作为冻结智能体的外部状态进行训练,采用与权重空间优化相同的严格规范,以确保可复现性。据我们所知,SkillOpt 是首个针对智能体技能(https://huggingface.co/papers?q=agent%20skills)的系统化可控文本空间优化器(https://huggingface.co/papers?q=text-space%20optimizer):一个独立的优化器模型将评分展开(https://huggingface.co/papers?q=rollouts)转换为对单个技能文档的有界添加/删除/替换编辑(https://huggingface.co/papers?q=add%2Fdelete%2Freplace%20edits),并且仅在编辑严格改善保留验证分数(https://huggingface.co/papers?q=validation%20score)时才接受该编辑。通过文本学习率预算(https://huggingface.co/papers?q=textual%20learning-rate%20budget)、拒绝编辑缓冲区(https://huggingface.co/papers?q=rejected-edit%20buffer)以及逐轮慢/元更新(https://huggingface.co/papers?q=epoch-wise%20slow%2Fmeta%20update),技能训练(https://huggingface.co/papers?q=skill%20training)得以稳定,同时在部署时无需增加任何推理时的模型调用。在六个基准测试、七个目标模型和三个执行框架(直接聊天、Codex、Claude Code)中,SkillOpt 在所有 52 个评估单元(模型、基准、框架)上均为最佳或平局,并且在每个单元中击败了所有竞争对手(包括人工、一次性 LLM、Trace2Skill、TextGrad、GEPA 和 EvoSkill 技能)。在 GPT-5.5 上,它将无技能的平均准确率提升了:直接聊天中 +23.5 分,Codex 智能体循环中 +24.8 分,Claude Code 中 +19.1 分。迁移实验(https://huggingface.co/papers?q=Transfer%20experiments)进一步表明,优化后的技能工件在跨模型规模、在 Codex 和 Claude Code 执行环境之间迁移,以及迁移到相近的数学基准测试(无需进一步优化)时,仍能保持其价值。
查看 arXiv 页面(https://arxiv.org/abs/2605.23904)查看 PDF(https://arxiv.org/pdf/2605.23904)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.23904)
在你的智能体中获取这篇论文:
hf papers read 2605.23904
还没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接到此论文
在模型的 README.md 中引用 arxiv.org/abs/2605.23904,即可从此页面链接。
引用此论文的数据集0
没有数据集链接到此论文
在数据集的 README.md 中引用 arxiv.org/abs/2605.23904,即可从此页面链接。
引用此论文的 Space0
没有 Space 链接到此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2605.23904,即可从此页面链接。
包含此论文的收藏集0
没有收藏集包含此论文
将这篇论文添加到一个收藏集(https://huggingface.co/new-collection),即可从此页面链接。
相似文章
SkillOpt-Lite: 通过一行指令实现更好更快的智能体自我进化
SkillOpt-Lite 提出了一种用于自主智能体技能优化的最小可行流水线,通过将所有组件视为可编辑代码并集成到生产编码智能体中,实现更好更快的自我进化。它通过零阶优化形式化技能优化,并在基准测试上优于先前方法。
@Yif_Yang: 介绍 SkillOpt — 一个面向智能体技能的优化器。不再微调模型权重,而是将自然语言…
介绍 SkillOpt,一个将自然语言技能视为可训练外部参数而非微调模型权重的优化器。它通过有界编辑和验证门控实现稳定、可控的技能更新,在 7 个模型的 6 个基准测试的 52 个设置中取得最佳或并列最佳结果。
@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2069064122218717387
本文探讨了AI代理如何利用微软研究院的SkillOpt等技术自动编写和优化其技能文件,该技术将技能文档视为可训练状态,并带来显著的性能提升。文章还解决了手动技能调优的挑战,并介绍了GEPA和EvoSkill等进化方法的框架。
@oliviscusAI: 微软刚刚开源了自我进化的智能体技能。它叫做 SkillOpt。技能能像训练AI模型一样自我改进……
微软开源了 SkillOpt,这是一个能让AI智能体技能自我改进的工具,通过自动评估和重写指令,无需绑定特定模型,即可超越手工制作的提示和其他优化器。
@omarsar0: 微软研究院的新研究 我看到很多AI工程师手写智能体技能文档,并希望它们能泛化。…
微软研究院推出了SkillOpt,该方法将智能体技能文档视为可训练的外部状态,利用优化器模型进行受限编辑,并通过预留集进行验证。该方案在52个评估单元中取得最佳或并列结果,在GPT-5.5上准确率提升超过23个百分点,且零额外推理成本,技能可迁移。