@dair_ai:一个有趣的想法是持续在技能上训练专门模型。这篇论文探讨了这一想法。他们提出了 S…
摘要
SkillGym 是一个框架,将人类编写的技能转化为大语言模型的训练环境,从而进行微调,提升在 Terminal-Bench 和 SkillsBench 等基准测试上的性能,超越了 Claude Sonnet 4.6 和 GPT-5.4 Mini 等模型的得分。
查看缓存全文
缓存时间: 2026/09/28 15:39
一个有趣的想法是持续在技能上训练专业化模型。
这篇论文探讨了这一思路。
他们提出了SkillGym框架,该框架将人类编写的技能转化为2,756个可通过代码检查器验证的训练环境,随后在8,364条成功轨迹上进行微调。
经过微调后,在Claude Code中运行的Qwen3.5-35B-A3B模型在Terminal-Bench 2.1上提升19.10分,在技能辅助的SkillsBench v1.1上提升28.13分,达到51.47%的准确率。
这一成绩超过了Claude Sonnet 4.6和GPT-5.4 Mini的公开分数。
即使不加载技能,经过训练的模型也能超越在上下文中包含技能的基础模型。
论文链接:https://academy.dair.ai/papers/skillgym-internalizing-human-skills-into-llms-for-real-world-problem-solving-2609.27717…
SkillGym:将人类技能内化至LLM以解决现实世界问题
来源:https://academy.dair.ai/papers/skillgym-internalizing-human-skills-into-llms-for-real-world-problem-solving-2609.27717 智能体 · 推理 与论文对话(https://academy.dair.ai/dashboard/paper-chat/skillgym-internalizing-human-skills-into-llms-for-real-world-problem-solving-2609.27717)
首页
SkillGym:将人类技能内化至LLM以解决现实世界问题
策划者观点
华东师范大学的葛志龙、陈钦等人提出了SkillGym,该框架将人类编写的智能体技能转化为可执行、可验证的训练环境,使这些流程最终融入模型权重。
本文要点
关于本文的提问 核心要点01
技能到任务流水线。每项技能被转化为具体任务,并配有基于代码的结果检查器,通过对比使用与不使用技能的运行情况,衡量任务对该技能的依赖程度。
02
发布资源。包含12个类别的2,756个环境,以及来自多个模型和框架的8,364条成功轨迹,平均每条轨迹包含49次工具调用和超过6万个记录词元。
03
Claude Code下的监督微调增益。Qwen3.5-35B-A3B在GDPval-AA v2上提升199 Elo,在Terminal-Bench 2.1上提升19.10分,在SkillsBench v1.1上分别提升28.13分(带技能)和12.38分(无技能)。
04
对比结果。35B的SkillGym-Agent在技能辅助的SkillsBench上达到51.47%,超越了Claude Sonnet 4.6、GPT-5.4 Mini和DeepSeek V4 Pro的公开分数。
05
内化流程。在不使用技能的情况下,它超越了在Codex和Claude Code中依赖技能的基础模型。
摘要人类编写的智能体技能编码了丰富的现实世界问题解决流程,但通常作为外部推理时指令使用,而非内化为可重用的模型能力。我们引入了\texttt{SkillGym}框架,将这些技能转化为大型语言模型智能体可执行、可验证的训练环境。其技能到任务流水线实例化具体任务,使用基于代码的检查器验证结果,并通过对比执行评估经验性的技能依赖关系。我们构建并发布了12个类别的2,756个环境,从多个模型和框架中收集了8,364条成功轨迹,平均包含49次工具调用和超过6万个记录文本词元。这些资源支持在验证流程上进行监督微调,以及基于结果奖励的强化学习。在Claude Code中,监督微调使Qwen3.5-35B-A3B在GDPval-AA v2上提升199 Elo,在Terminal-Bench 2.1上提升19.10个百分点,在SkillsBench v1.1上带技能提升28.13分、无技能提升12.38分。我们35B的\texttt{SkillGym-Agent}在技能辅助的SkillsBench上达到51.47%,超过了Claude Sonnet 4.6、GPT-5.4 Mini和DeepSeek V4 Pro的公开分数。即使不使用技能,它也超越了在Codex和Claude Code中依赖技能的基础模型,表明其具备可重用的程序性能力。
相似文章
SkillGym:通过自动可验证环境生成训练技能使用智能体
SkillGym 提出了一条自动化流水线:从互联网上爬取可复现的技能,构建可验证且难度可控的环境,并收集 19k 条已验证轨迹来训练技能使用智能体。在这些轨迹上对 Qwen3.5 系列模型(2B 到 122B)进行微调后,其在四个技能使用基准上的表现均有所提升;其中 9B 的 SFT 模型在两项基准上超过了 397B 的未训练模型。
SkillGym:使大语言模型内化人类技能以解决现实问题
SkillGym 将人类编写的智能体技能转化为可执行的训练环境,供大语言模型使用,从而实现监督微调和强化学习,以增强解决现实问题的能力和在基准测试中的性能。
@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2069064122218717387
本文探讨了AI代理如何利用微软研究院的SkillOpt等技术自动编写和优化其技能文件,该技术将技能文档视为可训练状态,并带来显著的性能提升。文章还解决了手动技能调优的挑战,并介绍了GEPA和EvoSkill等进化方法的框架。
SkillMaster:迈向大语言模型智能体的自主技能掌握
本文介绍了 SkillMaster,一种训练框架,使大语言模型智能体能够通过轨迹知情审查和反事实效用评估,自主地创建、优化和选择技能。
@dair_ai: // MetaSkill-Evolve // 关于自我改进代理的优秀论文。大多数自我改进代理重写代理所做的并……
MetaSkill-Evolve 引入了一个递归的双时间尺度框架,用于LLM代理,使其能够同时进化任务技能和改进过程本身,在OfficeQA、SealQA和ALFWorld基准测试上取得了显著的准确性提升。