SkillGym:通过自动可验证环境生成训练技能使用智能体
摘要
SkillGym 提出了一条自动化流水线:从互联网上爬取可复现的技能,构建可验证且难度可控的环境,并收集 19k 条已验证轨迹来训练技能使用智能体。在这些轨迹上对 Qwen3.5 系列模型(2B 到 122B)进行微调后,其在四个技能使用基准上的表现均有所提升;其中 9B 的 SFT 模型在两项基准上超过了 397B 的未训练模型。
查看缓存全文
缓存时间: 2026/10/01 16:24
论文页面 - SkillGym:通过自动生成可验证环境来训练技能使用型智能体
来源:https://huggingface.co/papers/2609.37539
摘要
技能(Skill)能够为 LLM 智能体注入专业知识与指导,使其完成长时程且复杂的任务。尽管技能已在近年的智能体范式与框架中被广泛采用,但如何合成可靠的训练数据、以及如何训练智能体以使用技能,仍鲜有人探索。在本工作中,我们提出 SkillGym——一个自动化的流水线,用于构建可验证环境、收集轨迹并训练技能使用型智能体。SkillGym 首先从互联网上抓取大量技能,然后仅保留那些其工作流能够离线可复现地运行的技能。我们采用「构建者-审查者」(builder-reviewer)流水线来构造难度可控的任务,涵盖四类任务,每类任务都配备参考解答与可执行的验证器。借助该流水线,我们构建了 6.8k 个环境,并收集了 19k 条经验证的成功轨迹用于监督微调。在这些轨迹上进行微调,提升了不同系列、不同规模(参数量从 2B 到 122B)的 LLM 在四个技能使用基准上的表现;我们的 Qwen3.5-9B SFT 模型在其中两个基准上超过了 397B 的未训练模型。进一步的分析表明,训练教会了智能体调用技能,将读取相关技能的比例从 28% 提升到 96%;且这些收益在不同推理结构下均能保持,并可推广到在训练数据中占少数的任务类型以及训练中未见过(held-out)的技能上。
查看 arXiv 页面 (https://arxiv.org/abs/2609.37539) 查看 PDF (https://arxiv.org/pdf/2609.37539) GitHub1 (https://github.com/Reason-Wang/SkillGym) 添加到合集 (https://huggingface.co/login?next=%2Fpapers%2F2609.37539)
在你的智能体中获取本文:
hf papers read 2609.37539
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型 5
reasonwang/SkillGym-Qwen3.5-9B 文本生成 • 9B • 约 4 小时前更新 • 32 (https://huggingface.co/reasonwang/SkillGym-Qwen3.5-9B)
reasonwang/SkillGym-Qwen3.5-4B 文本生成 • 5B • 约 4 小时前更新 • 2 (https://huggingface.co/reasonwang/SkillGym-Qwen3.5-4B)
reasonwang/SkillGym-Qwen3.5-27B 文本生成 • 3.05M • 约 4 小时前更新 • 2 (https://huggingface.co/reasonwang/SkillGym-Qwen3.5-27B)
reasonwang/SkillGym-Qwen3.5-122B-A10B 文本生成 • 125B • 约 4 小时前更新 • 11 (https://huggingface.co/reasonwang/SkillGym-Qwen3.5-122B-A10B)
浏览引用本文的 5 个模型 (https://huggingface.co/models?other=arxiv:2609.37539)
引用本文的数据集 0
没有数据集链接到本文
在数据集的 README.md 中引用 arxiv.org/abs/2609.37539,即可将其链接到本页面。
引用本文的 Space 0
没有 Space 链接到本文
在 Space 的 README.md 中引用 arxiv.org/abs/2609.37539,即可将其链接到本页面。
包含本文的合集 1
相似文章
@dair_ai:一个有趣的想法是持续在技能上训练专门模型。这篇论文探讨了这一想法。他们提出了 S…
SkillGym 是一个框架,将人类编写的技能转化为大语言模型的训练环境,从而进行微调,提升在 Terminal-Bench 和 SkillsBench 等基准测试上的性能,超越了 Claude Sonnet 4.6 和 GPT-5.4 Mini 等模型的得分。
CUA-Gym: 为计算机使用代理扩展可验证的训练环境与任务
CUA-Gym 引入了一个可扩展的流水线,用于为计算机使用代理生成可验证的训练环境和任务,从而解决数据稀缺问题。由此产生的数据集和模型在OSWorld-Verified和WebArena等基准测试上取得了强劲的性能。
SkillGen:经过验证的推理时代理技能合成
本文介绍了 SkillGen,这是一个多智能体框架,通过对比成功和失败的轨迹来合成和验证可复用的推理时大语言模型(LLM)代理技能。该方法确保技能可审计,并通过实证验证其对代理性能具有净正面影响。
SkillGym:使大语言模型内化人类技能以解决现实问题
SkillGym 将人类编写的智能体技能转化为可执行的训练环境,供大语言模型使用,从而实现监督微调和强化学习,以增强解决现实问题的能力和在基准测试中的性能。
SKT:通过验证合成数据生成实现规模化技能使用训练
介绍了SKT,一个用于语言模型智能体技能使用训练的验证数据合成流水线,从2,000个公开技能中生成4,000个任务包和27,164条经验证的轨迹。在SKT生成的轨迹上进行监督微调,能够持续提升不同模型和智能体框架的技能使用性能。