基于强化学习的渐进式智能体技能生成

Hugging Face Daily Papers 论文

摘要

介绍了 Skill-α,一种通过强化学习的方法,将技能生成视为具有回滚奖励的序列编辑过程,从而逐步生成高质量的智能体技能。在 CL-Bench 和 tau2-bench 上,相较于现有基线,它提升了下游任务的成功率。

现有的技能生成方法主要依赖于启发式方法或流水线式整合,这些方法必须针对不同的证据来源进行专门设计。相比之下,基于学习的方法提供了一种更统一的方式来对跨异构来源的技能生成进行建模。然而,基于学习的技能生成仍然具有挑战性,因为技能缺乏基于相关性或正确性的自然监督信号;其价值在很大程度上只能通过能否改善智能体在下游任务上的行为来判断。为了应对这一挑战,我们提出了 Skill-α,一种用于逐步生成高质量智能体技能的强化学习方法。具体而言,我们将技能生成形式化为一个序列编辑过程,将技能构建分解为可单独评估的编辑操作,并引入了一种新颖的回滚奖励,通过在锚定查询上比较原始技能和编辑后技能的下游执行情况来评估每次编辑。大量实验表明,在文档到技能和体验到技能两种设置下,Skill-α 生成的技能都比基于启发式或流水线的方法更有效。在主 GPT-4o worker 下,与最强的技能生成基线相比,Skill-α 在 CL-Bench 上将平均下游成功率提高了 3.3 个百分点,在 tau2-bench 上提高了 6.7 个百分点。进一步的消融实验验证了回滚奖励和渐进式生成的重要性。
查看原文
查看缓存全文

缓存时间: 2026/08/04 05:37

论文页面 - 通过强化学习逐步生成智能体技能

来源:https://huggingface.co/papers/2608.01678

摘要

现有的技能生成方法主要依赖启发式规则或流水线式的整合方式,这些方法必须针对不同的证据来源进行专门设计。相比之下,基于学习的方法提供了一种更统一的方式来对跨异构来源的技能生成进行建模。然而,基于学习的技能生成仍然具有挑战性,因为技能缺乏基于相关性或正确性的自然监督信号;它们的价值在很大程度上只能通过其是否改善智能体在下游任务上的行为来判断。为了应对这一挑战,我们提出了 Skill-α,一种用于逐步生成高质量智能体技能的强化学习方法。具体来说,我们将技能生成建模为一个序列化编辑过程,将技能构建分解为可单独评估的编辑操作,并引入一种新颖的回滚奖励机制,该机制通过在锚定查询上比较原始技能和编辑后技能的下游执行效果来评估每次编辑。大量实验表明,Skill-α 在文档到技能和体验到技能两种设置下,都能生成比基于启发式或流水线方法更有效的技能。在以 GPT-4o 为主要工作智能体的设置下,Skill-α 在 CL-Bench 上将平均下游成功率比最强的技能生成基线提高了 3.3 个百分点,在 tau2-bench 上提高了 6.7 个百分点。进一步的消融实验验证了回滚奖励和逐步生成机制的重要性。

查看 arXiv 页面 (https://arxiv.org/abs/2608.01678)查看 PDF (https://arxiv.org/pdf/2608.01678)GitHub1 (https://github.com/ejhshen/skill-alpha)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.01678)

在你的智能体中获取这篇论文:

hf papers read 2608\.01678

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

暂无模型关联此论文

在模型 README.md 中引用 arxiv.org/abs/2608.01678 即可从此页面关联该模型。

引用此论文的数据集0

暂无数据集关联此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.01678 即可从此页面关联该数据集。

引用此论文的 Space0

暂无 Space 关联此论文

在 Space README.md 中引用 arxiv.org/abs/2608.01678 即可从此页面关联该 Space。

包含此论文的收藏集0

暂无收藏集包含此论文

将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 中即可从此页面关联该收藏集。

相似文章

@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2069064122218717387

X AI KOLs Timeline

本文探讨了AI代理如何利用微软研究院的SkillOpt等技术自动编写和优化其技能文件,该技术将技能文档视为可训练状态,并带来显著的性能提升。文章还解决了手动技能调优的挑战,并介绍了GEPA和EvoSkill等进化方法的框架。

智能体强化学习中的动态技能生命周期管理

Hugging Face Daily Papers

本文介绍了 SLIM 框架,该框架通过在智能体强化学习中将主动技能集与策略学习联合更新,优化动态技能生命周期。实验表明,SLIM 通过高效的技能保留与扩展提升了任务性能,优于基线方法。