SkillGym:通过自动可验证环境生成训练技能使用智能体

Hugging Face Daily Papers 论文

摘要

SkillGym 提出了一条自动化流水线:从互联网上爬取可复现的技能,构建可验证且难度可控的环境,并收集 19k 条已验证轨迹来训练技能使用智能体。在这些轨迹上对 Qwen3.5 系列模型(2B 到 122B)进行微调后,其在四个技能使用基准上的表现均有所提升;其中 9B 的 SFT 模型在两项基准上超过了 397B 的未训练模型。

技能使 LLM 智能体掌握专业知识与指导,从而完成长时程的复杂任务。尽管近年来技能已被广泛应用于各种智能体范式与框架中,但如何合成可靠的训练数据、以及如何训练智能体使用技能,仍是较少被探索的问题。在本工作中,我们提出了 SkillGym——一条用于构建可验证环境、收集轨迹并训练技能使用智能体的自动化流水线。SkillGym 首先从互联网上爬取大量技能,然后保留那些其工作流程可以离线可复现运行的技能。我们采用构建者-审查者(builder-reviewer)流水线来构造难度可控的任务,涵盖四种任务类型,每个任务均配有参考解答和可执行的验证器。借助这一流水线,我们构建了 6.8k 个环境,并收集了 19k 条已验证的成功轨迹用于监督微调。在这些轨迹上进行微调,可以提升不同系列、不同规模(2B 到 122B 参数)的 LLM 在四个技能使用基准上的表现;我们的 Qwen3.5-9B SFT 模型在其中两项基准上超过了 397B 的未训练模型。进一步的分析表明,训练教会了智能体调用技能,将读取相关技能的比例从 28% 提升到 96%,并且这些增益在不同的推理结构上都成立,还能延伸到那些在训练数据中占少数的任务类型以及未参与训练的技能上。
查看原文
查看缓存全文

缓存时间: 2026/10/01 16:24

论文页面 - SkillGym:通过自动生成可验证环境来训练技能使用型智能体

来源:https://huggingface.co/papers/2609.37539

摘要

技能(Skill)能够为 LLM 智能体注入专业知识与指导,使其完成长时程且复杂的任务。尽管技能已在近年的智能体范式与框架中被广泛采用,但如何合成可靠的训练数据、以及如何训练智能体以使用技能,仍鲜有人探索。在本工作中,我们提出 SkillGym——一个自动化的流水线,用于构建可验证环境、收集轨迹并训练技能使用型智能体。SkillGym 首先从互联网上抓取大量技能,然后仅保留那些其工作流能够离线可复现地运行的技能。我们采用「构建者-审查者」(builder-reviewer)流水线来构造难度可控的任务,涵盖四类任务,每类任务都配备参考解答与可执行的验证器。借助该流水线,我们构建了 6.8k 个环境,并收集了 19k 条经验证的成功轨迹用于监督微调。在这些轨迹上进行微调,提升了不同系列、不同规模(参数量从 2B 到 122B)的 LLM 在四个技能使用基准上的表现;我们的 Qwen3.5-9B SFT 模型在其中两个基准上超过了 397B 的未训练模型。进一步的分析表明,训练教会了智能体调用技能,将读取相关技能的比例从 28% 提升到 96%;且这些收益在不同推理结构下均能保持,并可推广到在训练数据中占少数的任务类型以及训练中未见过(held-out)的技能上。

查看 arXiv 页面 (https://arxiv.org/abs/2609.37539) 查看 PDF (https://arxiv.org/pdf/2609.37539) GitHub1 (https://github.com/Reason-Wang/SkillGym) 添加到合集 (https://huggingface.co/login?next=%2Fpapers%2F2609.37539)

在你的智能体中获取本文:

hf papers read 2609.37539

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型 5

reasonwang/SkillGym-Qwen3.5-9B 文本生成 • 9B • 约 4 小时前更新 • 32 (https://huggingface.co/reasonwang/SkillGym-Qwen3.5-9B)

reasonwang/SkillGym-Qwen3.5-4B 文本生成 • 5B • 约 4 小时前更新 • 2 (https://huggingface.co/reasonwang/SkillGym-Qwen3.5-4B)

reasonwang/SkillGym-Qwen3.5-27B 文本生成 • 3.05M • 约 4 小时前更新 • 2 (https://huggingface.co/reasonwang/SkillGym-Qwen3.5-27B)

reasonwang/SkillGym-Qwen3.5-122B-A10B 文本生成 • 125B • 约 4 小时前更新 • 11 (https://huggingface.co/reasonwang/SkillGym-Qwen3.5-122B-A10B)

浏览引用本文的 5 个模型 (https://huggingface.co/models?other=arxiv:2609.37539)

引用本文的数据集 0

没有数据集链接到本文

在数据集的 README.md 中引用 arxiv.org/abs/2609.37539,即可将其链接到本页面。

引用本文的 Space 0

没有 Space 链接到本文

在 Space 的 README.md 中引用 arxiv.org/abs/2609.37539,即可将其链接到本页面。

包含本文的合集 1

相似文章

CUA-Gym: 为计算机使用代理扩展可验证的训练环境与任务

Hugging Face Daily Papers

CUA-Gym 引入了一个可扩展的流水线,用于为计算机使用代理生成可验证的训练环境和任务,从而解决数据稀缺问题。由此产生的数据集和模型在OSWorld-Verified和WebArena等基准测试上取得了强劲的性能。

SkillGen:经过验证的推理时代理技能合成

arXiv cs.LG

本文介绍了 SkillGen,这是一个多智能体框架,通过对比成功和失败的轨迹来合成和验证可复用的推理时大语言模型(LLM)代理技能。该方法确保技能可审计,并通过实证验证其对代理性能具有净正面影响。

SKT:通过验证合成数据生成实现规模化技能使用训练

Hugging Face Daily Papers

介绍了SKT,一个用于语言模型智能体技能使用训练的验证数据合成流水线,从2,000个公开技能中生成4,000个任务包和27,164条经验证的轨迹。在SKT生成的轨迹上进行监督微调,能够持续提升不同模型和智能体框架的技能使用性能。