SkillOpt:自我进化智能体技能的执行策略

Hugging Face Daily Papers 论文

摘要

SkillOpt 引入了一种系统化的文本空间优化器,用于智能体技能。该优化器将技能训练为智能体的外部状态,具有稳定的更新和零部署推理开销,在多个基准测试和执行环境中实现了卓越性能。

当前的智能体技能要么是手工制作的,要么是单次生成的,要么是通过松散控制的自我修订进行进化,但这些方法都没有像深度学习优化器那样对技能进行优化,也没有一种方法能够在反馈的基础上可靠地改进其初始点。我们认为,技能应该被训练为冻结智能体的外部状态,并遵循与权重空间优化相同的严格规范以保证可重复性。据我们所知,SkillOpt 是首个针对智能体技能的系统化可控文本空间优化器:一个独立的优化器模型将带有评分的执行轨迹转化为对单个技能文档的有界添加/删除/替换编辑,并且只有当编辑能严格提高留存验证评分时才被接受。文本学习率预算、拒绝编辑缓冲区和逐周期的慢/元更新使得技能训练稳定,同时在部署时实现零推理时间模型调用。在六个基准测试、七个目标模型和三个执行框架(直接聊天、Codex、Claude Code)上,SkillOpt 在所有52个评估的(模型、基准测试、执行框架)组合中表现最佳或并列最佳,并且击败了每个组合的所有竞争对手,包括人类编写的技能、单次大语言模型生成的技能、Trace2Skill、TextGrad、GEPA 和 EvoSkill 技能。在 GPT-5.5 上,它将无技能基线在直接聊天中的平均准确率提升了 +23.5 个百分点,在 Codex 智能体循环中提升了 +24.8 个百分点,在 Claude Code 中提升了 +19.1 个百分点。迁移实验进一步表明,优化后的技能工件在跨模型规模、在 Codex 和 Claude Code 执行环境之间迁移,以及迁移到相近的数学基准测试时,无需进一步优化即可保留其价值。
查看原文
查看缓存全文

缓存时间: 2026/05/25 02:35

Paper page - SkillOpt: Executive Strategy for Self-Evolving Agent Skills

来源:https://huggingface.co/papers/2605.23904 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

SkillOpt 引入了一个系统化的文本空间优化器,用于智能体技能训练,将技能作为外部智能体状态进行训练,具有稳定的更新和零部署推理开销,在多个基准测试和执行环境中均表现出卓越性能。

当前的智能体技能(https://huggingface.co/papers?q=Agent%20skills)要么通过人工编制,要么一次性生成,要么通过松散控制的自我修订进行演化,这些方法都无法像深度学习优化器那样作用于技能,并且无法在反馈下可靠地超越其初始起点。我们认为,技能应该作为冻结智能体的外部状态进行训练,采用与权重空间优化相同的严格规范,以确保可复现性。据我们所知,SkillOpt 是首个针对智能体技能(https://huggingface.co/papers?q=agent%20skills)的系统化可控文本空间优化器(https://huggingface.co/papers?q=text-space%20optimizer):一个独立的优化器模型将评分展开(https://huggingface.co/papers?q=rollouts)转换为对单个技能文档的有界添加/删除/替换编辑(https://huggingface.co/papers?q=add%2Fdelete%2Freplace%20edits),并且仅在编辑严格改善保留验证分数(https://huggingface.co/papers?q=validation%20score)时才接受该编辑。通过文本学习率预算(https://huggingface.co/papers?q=textual%20learning-rate%20budget)、拒绝编辑缓冲区(https://huggingface.co/papers?q=rejected-edit%20buffer)以及逐轮慢/元更新(https://huggingface.co/papers?q=epoch-wise%20slow%2Fmeta%20update),技能训练(https://huggingface.co/papers?q=skill%20training)得以稳定,同时在部署时无需增加任何推理时的模型调用。在六个基准测试、七个目标模型和三个执行框架(直接聊天、Codex、Claude Code)中,SkillOpt 在所有 52 个评估单元(模型、基准、框架)上均为最佳或平局,并且在每个单元中击败了所有竞争对手(包括人工、一次性 LLM、Trace2Skill、TextGrad、GEPA 和 EvoSkill 技能)。在 GPT-5.5 上,它将无技能的平均准确率提升了:直接聊天中 +23.5 分,Codex 智能体循环中 +24.8 分,Claude Code 中 +19.1 分。迁移实验(https://huggingface.co/papers?q=Transfer%20experiments)进一步表明,优化后的技能工件在跨模型规模、在 Codex 和 Claude Code 执行环境之间迁移,以及迁移到相近的数学基准测试(无需进一步优化)时,仍能保持其价值。

查看 arXiv 页面(https://arxiv.org/abs/2605.23904)查看 PDF(https://arxiv.org/pdf/2605.23904)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.23904)

在你的智能体中获取这篇论文:

hf papers read 2605.23904

还没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接到此论文

在模型的 README.md 中引用 arxiv.org/abs/2605.23904,即可从此页面链接。

引用此论文的数据集0

没有数据集链接到此论文

在数据集的 README.md 中引用 arxiv.org/abs/2605.23904,即可从此页面链接。

引用此论文的 Space0

没有 Space 链接到此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2605.23904,即可从此页面链接。

包含此论文的收藏集0

没有收藏集包含此论文

将这篇论文添加到一个收藏集(https://huggingface.co/new-collection),即可从此页面链接。

相似文章

SkillOpt-Lite: 通过一行指令实现更好更快的智能体自我进化

Hugging Face Daily Papers

SkillOpt-Lite 提出了一种用于自主智能体技能优化的最小可行流水线,通过将所有组件视为可编辑代码并集成到生产编码智能体中,实现更好更快的自我进化。它通过零阶优化形式化技能优化,并在基准测试上优于先前方法。

@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2069064122218717387

X AI KOLs Timeline

本文探讨了AI代理如何利用微软研究院的SkillOpt等技术自动编写和优化其技能文件,该技术将技能文档视为可训练状态,并带来显著的性能提升。文章还解决了手动技能调优的挑战,并介绍了GEPA和EvoSkill等进化方法的框架。