SkillGate: 长期视野智能体的策略内技能训练

Hugging Face Daily Papers 论文

摘要

SkillGate 通过使用执行和技能命名令牌的独立信用通道,解决了AI智能体技能选择中的选择器信用饥饿问题,提高了成功率并减少了长期任务中误导性技能的暴露。

智能体框架日益将程序性知识打包为技能:智能体按需读取的指令文件,而公共库中现在包含数千个这样的文件。因此,选择阅读哪个技能已成为策略本身在情节中做出的一个决策,但目前没有现有的信号来训练它。我们证明,默认的补救措施——基于候选列表的奖励强化学习——无法教会它,原因是我们识别并命名为选择器信用饥饿的结构性问题:在广播式、序列级优势下,命名所选技能的少数令牌承担着逐渐消失的损失份额,并且随着轨迹变长,它们继承的信用越来越符号错误。每当执行失败时,正确的选择都会受到惩罚,即使这个选择本身是轨迹中最有价值的决策之一。审计完成运行自身的训练工件证实了所有三个特性,每个特性都随着视野单调恶化。SkillGate 通过设计消除了失败:它将令牌支持划分为两个不相交的信用通道,结果信用仅到达执行令牌,而单独的行动局部优势仅到达技能命名令牌,仅在轨迹的单次读取正确时为正。在16个候选列表下的五个智能体基准测试中,SkillGate 将一个9B策略的试验成功率从40.8%提升到53.2%,远优于仅花费相同预算在结果奖励上的效果,同时将误导性候选的暴露减少了三分之二,并读取了更少的技能。
查看原文
查看缓存全文

缓存时间: 2026/08/20 12:03

论文页面 - SkillGate:长周期智能体的策略内技能选择训练

来源:https://huggingface.co/papers/2608.18852

摘要

SkillGate 通过将执行标记的结果奖励与技能命名标记的局部优势分离,解决了智能体技能选择中的选择器信用分配匮乏问题,从而提高了成功率并减少了误导性技能暴露。

智能体框架越来越多地将程序性知识封装为技能:智能体按需读取的指令文件,而公共库现在包含数千个此类文件。因此,选择阅读哪个技能已成为策略本身在训练过程中需要做出的决策,但目前尚无有效信号对此进行训练。我们证明,传统解决方案——基于候选集的结果奖励强化学习 (https://huggingface.co/papers?q=outcome-rewarded%20RL)——无法有效训练此决策能力,原因在于我们发现并命名为“选择器信用分配匮乏”(https://huggingface.co/papers?q=selector%20credit%20starvation) 的结构性问题:在广播式的序列级优势 (https://huggingface.co/papers?q=sequence-level%20advantage) 下,仅占少数的命名选定技能的标记所携带的损失份额极小,且随着轨迹长度增加,它们继承的信用符号越来越错误。只要后续执行失败,正确的选择就会受到惩罚,即使该选择本身可能是轨迹中最具价值的决策之一。对已完成运行的训练数据进行审计证实了这三个特性,且每个特性都随任务周期长度单调恶化。SkillGate (https://huggingface.co/papers?q=SkillGate) 从设计上消除了这一失败模式:它将标记支持集划分为两个独立的信用通道,结果信用仅传递给执行标记,而一个独立的行动局部优势 (https://huggingface.co/papers?q=action-local%20advantage) 则恰好传递给技能命名标记,仅当轨迹中唯一的技能读取正确时该优势才为正值。在16个候选技能的设置下,对五个智能体基准测试 (https://huggingface.co/papers?q=agentic%20benchmarks) 进行评估,SkillGate (https://huggingface.co/papers?q=SkillGate) 将一个9B参数策略的试验成功率从40.8%提升至53.2%,远超将相同计算预算仅用于结果奖励的方案,同时将对误导性候选技能的暴露减少了三分之二,并读取了更少的技能。

查看arXiv页面 (https://arxiv.org/abs/2608.18852)查看PDF (https://arxiv.org/pdf/2608.18852)GitHub0 (https://github.com/DeepExperience/SkillGate)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.18852)

在你的智能体中获取此论文:

hf papers read 2608\.18852

没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型1

simonlqy/SkillGate-9B 文本生成• 10B• 约9小时前更新 • 214 (https://huggingface.co/simonlqy/SkillGate-9B)

引用此论文的数据集0

没有关联此论文的数据集

在数据集的README.md中引用 arxiv.org/abs/2608.18852 以将其链接到此页面。

引用此论文的Spaces0

没有关联此论文的Space

在Space的README.md中引用 arxiv.org/abs/2608.18852 以将其链接到此页面。

包含此论文的收藏0

没有包含此论文的收藏

将此论文添加到收藏 (https://huggingface.co/new-collection) 以将其链接到此页面。

相似文章

SkillGen:经过验证的推理时代理技能合成

arXiv cs.LG

本文介绍了 SkillGen,这是一个多智能体框架,通过对比成功和失败的轨迹来合成和验证可复用的推理时大语言模型(LLM)代理技能。该方法确保技能可审计,并通过实证验证其对代理性能具有净正面影响。

SkillCenter:面向自主AI Agent的大规模源基技能库

arXiv cs.AI

介绍SkillCenter,这是目前最大的面向AI Agent的开放技能库,包含216,938个结构化、源基的技能,覆盖24个领域。该库通过自动化流水线构建,并使用了基于LLM的质量门控(SkillGate)。该库结合了同行评审技能和社区技能,强调可追溯性和离线可搜索性。