SkillOpt 将 markdown 技能文件视为可训练参数并配备适当的优化机制
摘要
一篇新论文通过将 markdown 技能文件视为可训练参数并使用经过保留集验证的有界编辑,将智能体的技能优化形式化。该方法在不同模型间迁移良好,并提升了程序化基准测试的性能。
一篇新近发表的论文将许多智能体构建者一直在临时实践的方法进行了形式化。他们使用前沿模型对 markdown 技能文件提出有界编辑(添加/删除/替换),然后对每次编辑进行保留集的验证门控。只接受严格改进,平局则拒绝,被拒绝的编辑会成为下一轮的负面信号。几点值得注意:最佳技能在众多提案中仅接受 1 到 4 次编辑后收敛。每步的编辑预算为 4 到 8 个效果最佳,取消上限后性能崩溃。最终技能的中位数约为 920 个 token。在 Codex 上优化的技能无需修改即可迁移到 Claude Code,并在 SpreadsheetBench 上提升了 +59.7。而 GPT 4.1 nano 搭配优化后的技能,在程序化基准测试上大致达到了前沿水平。局限性在于验证门控需要具备明确正确答案的自动评分器。适用于代码和电子表格,但对于任何开放性问题则失效。论文:[https://arxiv.org/pdf/2605.23904](https://arxiv.org/pdf/2605.23904)
相似文章
@Yif_Yang: 介绍 SkillOpt — 一个面向智能体技能的优化器。不再微调模型权重,而是将自然语言…
介绍 SkillOpt,一个将自然语言技能视为可训练外部参数而非微调模型权重的优化器。它通过有界编辑和验证门控实现稳定、可控的技能更新,在 7 个模型的 6 个基准测试的 52 个设置中取得最佳或并列最佳结果。
@omarsar0: 微软研究院的新研究 我看到很多AI工程师手写智能体技能文档,并希望它们能泛化。…
微软研究院推出了SkillOpt,该方法将智能体技能文档视为可训练的外部状态,利用优化器模型进行受限编辑,并通过预留集进行验证。该方案在52个评估单元中取得最佳或并列结果,在GPT-5.5上准确率提升超过23个百分点,且零额外推理成本,技能可迁移。
@DAIEvolutionHub: 微软刚刚开源了一种无需触及模型权重即可“训练”AI智能体的方法 SkillOpt 将简单的 markdown 技能文件视为神经网络参数...
微软开源了 SkillOpt,这是一种将 markdown 技能文件视为神经网络参数来训练 AI 智能体的方法,无需修改模型权重,并使用学习率、验证检查、小批量数据和训练轮次进行优化。
SkillOpt:自我进化智能体技能的执行策略
SkillOpt 引入了一种系统化的文本空间优化器,用于智能体技能。该优化器将技能训练为智能体的外部状态,具有稳定的更新和零部署推理开销,在多个基准测试和执行环境中实现了卓越性能。
@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2069064122218717387
本文探讨了AI代理如何利用微软研究院的SkillOpt等技术自动编写和优化其技能文件,该技术将技能文档视为可训练状态,并带来显著的性能提升。文章还解决了手动技能调优的挑战,并介绍了GEPA和EvoSkill等进化方法的框架。