SkillOpt 将 markdown 技能文件视为可训练参数并配备适当的优化机制

Reddit r/LocalLLaMA 论文

摘要

一篇新论文通过将 markdown 技能文件视为可训练参数并使用经过保留集验证的有界编辑,将智能体的技能优化形式化。该方法在不同模型间迁移良好,并提升了程序化基准测试的性能。

一篇新近发表的论文将许多智能体构建者一直在临时实践的方法进行了形式化。他们使用前沿模型对 markdown 技能文件提出有界编辑(添加/删除/替换),然后对每次编辑进行保留集的验证门控。只接受严格改进,平局则拒绝,被拒绝的编辑会成为下一轮的负面信号。几点值得注意:最佳技能在众多提案中仅接受 1 到 4 次编辑后收敛。每步的编辑预算为 4 到 8 个效果最佳,取消上限后性能崩溃。最终技能的中位数约为 920 个 token。在 Codex 上优化的技能无需修改即可迁移到 Claude Code,并在 SpreadsheetBench 上提升了 +59.7。而 GPT 4.1 nano 搭配优化后的技能,在程序化基准测试上大致达到了前沿水平。局限性在于验证门控需要具备明确正确答案的自动评分器。适用于代码和电子表格,但对于任何开放性问题则失效。论文:[https://arxiv.org/pdf/2605.23904](https://arxiv.org/pdf/2605.23904)
查看原文

相似文章

SkillOpt:自我进化智能体技能的执行策略

Hugging Face Daily Papers

SkillOpt 引入了一种系统化的文本空间优化器,用于智能体技能。该优化器将技能训练为智能体的外部状态,具有稳定的更新和零部署推理开销,在多个基准测试和执行环境中实现了卓越性能。

@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2069064122218717387

X AI KOLs Timeline

本文探讨了AI代理如何利用微软研究院的SkillOpt等技术自动编写和优化其技能文件,该技术将技能文档视为可训练状态,并带来显著的性能提升。文章还解决了手动技能调优的挑战,并介绍了GEPA和EvoSkill等进化方法的框架。