基于强化学习的渐进式智能体技能生成
摘要
介绍了 Skill-α,一种通过强化学习的方法,将技能生成视为具有回滚奖励的序列编辑过程,从而逐步生成高质量的智能体技能。在 CL-Bench 和 tau2-bench 上,相较于现有基线,它提升了下游任务的成功率。
查看缓存全文
缓存时间: 2026/08/04 05:37
论文页面 - 通过强化学习逐步生成智能体技能
来源:https://huggingface.co/papers/2608.01678
摘要
现有的技能生成方法主要依赖启发式规则或流水线式的整合方式,这些方法必须针对不同的证据来源进行专门设计。相比之下,基于学习的方法提供了一种更统一的方式来对跨异构来源的技能生成进行建模。然而,基于学习的技能生成仍然具有挑战性,因为技能缺乏基于相关性或正确性的自然监督信号;它们的价值在很大程度上只能通过其是否改善智能体在下游任务上的行为来判断。为了应对这一挑战,我们提出了 Skill-α,一种用于逐步生成高质量智能体技能的强化学习方法。具体来说,我们将技能生成建模为一个序列化编辑过程,将技能构建分解为可单独评估的编辑操作,并引入一种新颖的回滚奖励机制,该机制通过在锚定查询上比较原始技能和编辑后技能的下游执行效果来评估每次编辑。大量实验表明,Skill-α 在文档到技能和体验到技能两种设置下,都能生成比基于启发式或流水线方法更有效的技能。在以 GPT-4o 为主要工作智能体的设置下,Skill-α 在 CL-Bench 上将平均下游成功率比最强的技能生成基线提高了 3.3 个百分点,在 tau2-bench 上提高了 6.7 个百分点。进一步的消融实验验证了回滚奖励和逐步生成机制的重要性。
查看 arXiv 页面 (https://arxiv.org/abs/2608.01678)查看 PDF (https://arxiv.org/pdf/2608.01678)GitHub1 (https://github.com/ejhshen/skill-alpha)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.01678)
在你的智能体中获取这篇论文:
hf papers read 2608\.01678
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
暂无模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2608.01678 即可从此页面关联该模型。
引用此论文的数据集0
暂无数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.01678 即可从此页面关联该数据集。
引用此论文的 Space0
暂无 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2608.01678 即可从此页面关联该 Space。
包含此论文的收藏集0
暂无收藏集包含此论文
将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 中即可从此页面关联该收藏集。
相似文章
Skill1:通过强化学习实现技能增强型智能体的统一进化
Skill1 是一个统一框架,通过共享的任务结果目标,训练单一策略以协同进化技能选择、利用与蒸馏。在 ALFWorld 和 WebShop 上的实验表明,该框架在复杂任务环境中优于现有的基线方法。
SkillRise:面向跨任务技能演化的智能体强化学习
SkillRise 是一个统一的强化学习框架,使 LLM 智能体能够在相关且渐进难度的任务中学习并重用技能,在多个基准测试上比基线方法高出最多 8.5 个百分点。
@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2069064122218717387
本文探讨了AI代理如何利用微软研究院的SkillOpt等技术自动编写和优化其技能文件,该技术将技能文档视为可训练状态,并带来显著的性能提升。文章还解决了手动技能调优的挑战,并介绍了GEPA和EvoSkill等进化方法的框架。
SkillGraph:通过动态演进的技能图增强智能体的强化学习
SkillGraph 是一个框架,将可复用技能表示为有向图中的节点,使大型语言模型智能体能够通过结构化的技能检索和持续演进,更有效地处理组合任务。
智能体强化学习中的动态技能生命周期管理
本文介绍了 SLIM 框架,该框架通过在智能体强化学习中将主动技能集与策略学习联合更新,优化动态技能生命周期。实验表明,SLIM 通过高效的技能保留与扩展提升了任务性能,优于基线方法。