SkillEvo:基于多轮交互反馈的自我更新进化梯度
摘要
SkillEvo 引入了一种通过使用多轮交互反馈和治理层来持续改进 AI 代理技能的方法,以保持进化梯度,超越了自反思和单轮问答驱动的方法。
查看缓存全文
缓存时间: 2026/08/21 04:07
论文页面 - SkillEvo:基于多轮交互反馈的自更新进化梯度
来源:https://huggingface.co/papers/2608.13120
摘要
SkillEvo通过多轮反馈和主动治理机制来持续优化进化梯度,从而提升智能体技能。
当前的智能体技能要么由人工编写,要么仅通过单次大语言模型生成,因此缺乏闭环机制来根据实际交互失败进行改进。近期研究虽然建立了这种闭环,但其反馈仅来源于单轮问答评估。这导致了一个显著的不对称性:一旦首轮修复了单次交互能暴露的缺陷,进化梯度就会衰减,而那些仅在多轮交互中浮现的缺陷仍不可见,进化过程陷入停滞。现有系统中的治理机制同样依赖端到端的验证分数——这种标量门控虽然能拒绝质量下降的候选方案,却无法定位或修复其结构性问题。我们认为,制约技能持续进化的核心约束既非编辑能力也非迭代次数,而在于评估反馈是否能持续提供可靠的进化梯度(https://huggingface.co/papers?q=evolution%20gradients)。本文提出SkillEvo框架,其中可靠反馈生成梯度,可控治理约束梯度方向。第一项改进将多轮用户模拟(https://huggingface.co/papers?q=multi-turn%20user%20simulation)从评估终端重构为反馈生成器(https://huggingface.co/papers?q=feedback%20generator):后续提问逐层暴露缺陷,使每轮修订既消耗反馈又生成新反馈。第二项改进用独立的治理层(https://huggingface.co/papers?q=governance%20layer)替代标量门控的被动拒绝机制,主动修复事实性退化和结构膨胀,防止梯度随退化累积而漂移。在涵盖六类云服务、9个生产级技能和98个技能参考文件的实验中,SkillEvo相比基于自反思(https://huggingface.co/papers?q=self-reflection)的进化方法提升23.0分,相比单轮QA驱动的进化方法提升15.4分。
查看arXiv页面(https://arxiv.org/abs/2608.13120)查看PDF(https://arxiv.org/pdf/2608.13120)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2608.13120)
获取论文至您的智能体:
hf papers read 2608\.13120
未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
无模型链接本文
在模型README.md中引用arxiv.org/abs/2608.13120以从本页面建立链接。
引用本文的数据集0
无数据集链接本文
在数据集README.md中引用arxiv.org/abs/2608.13120以从本页面建立链接。
引用本文的Spaces0
无Space链接本文
在Space README.md中引用arxiv.org/abs/2608.13120以从本页面建立链接。
包含本文的合集0
无合集包含本文
将本文添加到合集(https://huggingface.co/new-collection)以从本页面建立链接。
相似文章
@dair_ai: // MetaSkill-Evolve // 关于自我改进代理的优秀论文。大多数自我改进代理重写代理所做的并……
MetaSkill-Evolve 引入了一个递归的双时间尺度框架,用于LLM代理,使其能够同时进化任务技能和改进过程本身,在OfficeQA、SealQA和ALFWorld基准测试上取得了显著的准确性提升。
@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2069064122218717387
本文探讨了AI代理如何利用微软研究院的SkillOpt等技术自动编写和优化其技能文件,该技术将技能文档视为可训练状态,并带来显著的性能提升。文章还解决了手动技能调优的挑战,并介绍了GEPA和EvoSkill等进化方法的框架。
SkillOpt-Lite: 通过一行指令实现更好更快的智能体自我进化
SkillOpt-Lite 提出了一种用于自主智能体技能优化的最小可行流水线,通过将所有组件视为可编辑代码并集成到生产编码智能体中,实现更好更快的自我进化。它通过零阶优化形式化技能优化,并在基准测试上优于先前方法。
重新思考自我进化:一种受约束的探索-利用过程以缓解技能过拟合
本文提出SkillBoost,一种三阶段的受约束探索-利用框架,用于缓解LLM智能体自我进化中的技能过拟合。它在23个模型-基准配置上达到了最先进的性能,并证明了优化后的技能可以迁移到其他智能体。
SkillOpt:自我进化智能体技能的执行策略
SkillOpt 引入了一种系统化的文本空间优化器,用于智能体技能。该优化器将技能训练为智能体的外部状态,具有稳定的更新和零部署推理开销,在多个基准测试和执行环境中实现了卓越性能。