SkillEvo:基于多轮交互反馈的自我更新进化梯度

Hugging Face Daily Papers 论文

摘要

SkillEvo 引入了一种通过使用多轮交互反馈和治理层来持续改进 AI 代理技能的方法,以保持进化梯度,超越了自反思和单轮问答驱动的方法。

当前的代理技能要么是手工编写的,要么是通过单次 LLM 生成过程产生的,因此缺乏一个闭环,无法从它们实际导致的交互失败中改进。最近的研究确实闭合了这个循环,但其反馈源自单轮问答评估。结果是一个严重的不对称性:一旦第一轮修补了单次交换能揭示的缺口,进化梯度就会衰减,那些只有在多轮交互中才会显现的缺陷仍然不可见,进化便停滞了。这些系统中的治理同样由端到端验证分数驱动,这是一个标量门控,可以拒绝劣化的候选,但无法定位或修复其结构性原因。我们认为,持续技能进化的关键约束既不是编辑能力,也不是迭代次数,而是评估反馈是否持续提供可信的进化梯度。我们引入了 SkillEvo,其中可信反馈生成梯度,而可控治理约束其方向。第一个组件将多轮用户模拟从评估终点重塑为反馈生成器:后续问题逐层暴露缺陷,使得每轮修订既消耗反馈又产生新反馈。第二个组件用独立治理层取代了标量门控的被动拒绝,主动修复事实性退化和结构性膨胀,防止梯度随着退化的积累而漂移。在六类云服务、9 个生产技能和 98 个技能参考文件中,SkillEvo 超越了基于自反思的进化 23.0 分,超越了单轮问答驱动的进化 15.4 分。
查看原文
查看缓存全文

缓存时间: 2026/08/21 04:07

论文页面 - SkillEvo:基于多轮交互反馈的自更新进化梯度

来源:https://huggingface.co/papers/2608.13120

摘要

SkillEvo通过多轮反馈和主动治理机制来持续优化进化梯度,从而提升智能体技能。

当前的智能体技能要么由人工编写,要么仅通过单次大语言模型生成,因此缺乏闭环机制来根据实际交互失败进行改进。近期研究虽然建立了这种闭环,但其反馈仅来源于单轮问答评估。这导致了一个显著的不对称性:一旦首轮修复了单次交互能暴露的缺陷,进化梯度就会衰减,而那些仅在多轮交互中浮现的缺陷仍不可见,进化过程陷入停滞。现有系统中的治理机制同样依赖端到端的验证分数——这种标量门控虽然能拒绝质量下降的候选方案,却无法定位或修复其结构性问题。我们认为,制约技能持续进化的核心约束既非编辑能力也非迭代次数,而在于评估反馈是否能持续提供可靠的进化梯度(https://huggingface.co/papers?q=evolution%20gradients)。本文提出SkillEvo框架,其中可靠反馈生成梯度,可控治理约束梯度方向。第一项改进将多轮用户模拟(https://huggingface.co/papers?q=multi-turn%20user%20simulation)从评估终端重构为反馈生成器(https://huggingface.co/papers?q=feedback%20generator):后续提问逐层暴露缺陷,使每轮修订既消耗反馈又生成新反馈。第二项改进用独立的治理层(https://huggingface.co/papers?q=governance%20layer)替代标量门控的被动拒绝机制,主动修复事实性退化和结构膨胀,防止梯度随退化累积而漂移。在涵盖六类云服务、9个生产级技能和98个技能参考文件的实验中,SkillEvo相比基于自反思(https://huggingface.co/papers?q=self-reflection)的进化方法提升23.0分,相比单轮QA驱动的进化方法提升15.4分。

查看arXiv页面(https://arxiv.org/abs/2608.13120)查看PDF(https://arxiv.org/pdf/2608.13120)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2608.13120)

获取论文至您的智能体: hf papers read 2608\.13120

未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

无模型链接本文

在模型README.md中引用arxiv.org/abs/2608.13120以从本页面建立链接。

引用本文的数据集0

无数据集链接本文

在数据集README.md中引用arxiv.org/abs/2608.13120以从本页面建立链接。

引用本文的Spaces0

无Space链接本文

在Space README.md中引用arxiv.org/abs/2608.13120以从本页面建立链接。

包含本文的合集0

无合集包含本文

将本文添加到合集(https://huggingface.co/new-collection)以从本页面建立链接。

相似文章

@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2069064122218717387

X AI KOLs Timeline

本文探讨了AI代理如何利用微软研究院的SkillOpt等技术自动编写和优化其技能文件,该技术将技能文档视为可训练状态,并带来显著的性能提升。文章还解决了手动技能调优的挑战,并介绍了GEPA和EvoSkill等进化方法的框架。

SkillOpt-Lite: 通过一行指令实现更好更快的智能体自我进化

Hugging Face Daily Papers

SkillOpt-Lite 提出了一种用于自主智能体技能优化的最小可行流水线,通过将所有组件视为可编辑代码并集成到生产编码智能体中,实现更好更快的自我进化。它通过零阶优化形式化技能优化,并在基准测试上优于先前方法。

SkillOpt:自我进化智能体技能的执行策略

Hugging Face Daily Papers

SkillOpt 引入了一种系统化的文本空间优化器,用于智能体技能。该优化器将技能训练为智能体的外部状态,具有稳定的更新和零部署推理开销,在多个基准测试和执行环境中实现了卓越性能。