SkillGate: 长期视野智能体的策略内技能训练
摘要
SkillGate 通过使用执行和技能命名令牌的独立信用通道,解决了AI智能体技能选择中的选择器信用饥饿问题,提高了成功率并减少了长期任务中误导性技能的暴露。
查看缓存全文
缓存时间: 2026/08/20 12:03
论文页面 - SkillGate:长周期智能体的策略内技能选择训练
来源:https://huggingface.co/papers/2608.18852
摘要
SkillGate 通过将执行标记的结果奖励与技能命名标记的局部优势分离,解决了智能体技能选择中的选择器信用分配匮乏问题,从而提高了成功率并减少了误导性技能暴露。
智能体框架越来越多地将程序性知识封装为技能:智能体按需读取的指令文件,而公共库现在包含数千个此类文件。因此,选择阅读哪个技能已成为策略本身在训练过程中需要做出的决策,但目前尚无有效信号对此进行训练。我们证明,传统解决方案——基于候选集的结果奖励强化学习 (https://huggingface.co/papers?q=outcome-rewarded%20RL)——无法有效训练此决策能力,原因在于我们发现并命名为“选择器信用分配匮乏”(https://huggingface.co/papers?q=selector%20credit%20starvation) 的结构性问题:在广播式的序列级优势 (https://huggingface.co/papers?q=sequence-level%20advantage) 下,仅占少数的命名选定技能的标记所携带的损失份额极小,且随着轨迹长度增加,它们继承的信用符号越来越错误。只要后续执行失败,正确的选择就会受到惩罚,即使该选择本身可能是轨迹中最具价值的决策之一。对已完成运行的训练数据进行审计证实了这三个特性,且每个特性都随任务周期长度单调恶化。SkillGate (https://huggingface.co/papers?q=SkillGate) 从设计上消除了这一失败模式:它将标记支持集划分为两个独立的信用通道,结果信用仅传递给执行标记,而一个独立的行动局部优势 (https://huggingface.co/papers?q=action-local%20advantage) 则恰好传递给技能命名标记,仅当轨迹中唯一的技能读取正确时该优势才为正值。在16个候选技能的设置下,对五个智能体基准测试 (https://huggingface.co/papers?q=agentic%20benchmarks) 进行评估,SkillGate (https://huggingface.co/papers?q=SkillGate) 将一个9B参数策略的试验成功率从40.8%提升至53.2%,远超将相同计算预算仅用于结果奖励的方案,同时将对误导性候选技能的暴露减少了三分之二,并读取了更少的技能。
查看arXiv页面 (https://arxiv.org/abs/2608.18852)查看PDF (https://arxiv.org/pdf/2608.18852)GitHub0 (https://github.com/DeepExperience/SkillGate)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.18852)
在你的智能体中获取此论文:
hf papers read 2608\.18852
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型1
simonlqy/SkillGate-9B 文本生成• 10B• 约9小时前更新 • 214 (https://huggingface.co/simonlqy/SkillGate-9B)
引用此论文的数据集0
没有关联此论文的数据集
在数据集的README.md中引用 arxiv.org/abs/2608.18852 以将其链接到此页面。
引用此论文的Spaces0
没有关联此论文的Space
在Space的README.md中引用 arxiv.org/abs/2608.18852 以将其链接到此页面。
包含此论文的收藏0
没有包含此论文的收藏
将此论文添加到收藏 (https://huggingface.co/new-collection) 以将其链接到此页面。
相似文章
技能还是跳过?通过双粒度偏好学习在智能体任务中学习选择性技能调用
提出了SelSkill,一个双粒度偏好学习框架,学习在智能体任务中何时调用技能,在ALFWorld上将任务成功率提升10.9%,在BFCL上提升5.7%。
SkillDAG:大规模LLM技能选择中的自进化类型化技能图
介绍了SkillDAG,一种用于大规模LLM技能选择的自进化类型化有向图,它建模了技能间关系,并允许智能体在执行过程中查询和演化该图,在ALFWorld和SkillsBench上优于基线。
SkillGen:经过验证的推理时代理技能合成
本文介绍了 SkillGen,这是一个多智能体框架,通过对比成功和失败的轨迹来合成和验证可复用的推理时大语言模型(LLM)代理技能。该方法确保技能可审计,并通过实证验证其对代理性能具有净正面影响。
Skill1:通过强化学习实现技能增强型智能体的统一进化
Skill1 是一个统一框架,通过共享的任务结果目标,训练单一策略以协同进化技能选择、利用与蒸馏。在 ALFWorld 和 WebShop 上的实验表明,该框架在复杂任务环境中优于现有的基线方法。
SkillCenter:面向自主AI Agent的大规模源基技能库
介绍SkillCenter,这是目前最大的面向AI Agent的开放技能库,包含216,938个结构化、源基的技能,覆盖24个领域。该库通过自动化流水线构建,并使用了基于LLM的质量门控(SkillGate)。该库结合了同行评审技能和社区技能,强调可追溯性和离线可搜索性。