@dair_ai:一个有趣的想法是持续在技能上训练专门模型。这篇论文探讨了这一想法。他们提出了 S…

X AI KOLs Timeline 论文

摘要

SkillGym 是一个框架,将人类编写的技能转化为大语言模型的训练环境,从而进行微调,提升在 Terminal-Bench 和 SkillsBench 等基准测试上的性能,超越了 Claude Sonnet 4.6 和 GPT-5.4 Mini 等模型的得分。

一个有趣的想法是持续在技能上训练专门模型。 这篇论文探讨了这一想法。 他们提出了 SkillGym,它将人类编写的技能转化为 2,756 个带有代码检查器的训练环境,然后在 8,364 条成功轨迹上进行微调。 微调后,在 Claude Code 中运行的 Qwen3.5-35B-A3B 在 Terminal-Bench 2.1 上提升了 19.10 分,在技能辅助的 SkillsBench v1.1 上提升了 28.13 分,达到 51.47%。 这高于 Claude Sonnet 4.6 和 GPT-5.4 Mini 的报告分数。 在不加载技能的情况下,训练后的模型击败了在上下文中具有技能的基础模型。 论文:https://academy.dair.ai/papers/skillgym-internalizing-human-skills-into-llms-for-real-world-problem-solving-2609.27717…
查看原文
查看缓存全文

缓存时间: 2026/09/28 15:39

一个有趣的想法是持续在技能上训练专业化模型。

这篇论文探讨了这一思路。

他们提出了SkillGym框架,该框架将人类编写的技能转化为2,756个可通过代码检查器验证的训练环境,随后在8,364条成功轨迹上进行微调。

经过微调后,在Claude Code中运行的Qwen3.5-35B-A3B模型在Terminal-Bench 2.1上提升19.10分,在技能辅助的SkillsBench v1.1上提升28.13分,达到51.47%的准确率。

这一成绩超过了Claude Sonnet 4.6和GPT-5.4 Mini的公开分数。

即使不加载技能,经过训练的模型也能超越在上下文中包含技能的基础模型。

论文链接:https://academy.dair.ai/papers/skillgym-internalizing-human-skills-into-llms-for-real-world-problem-solving-2609.27717…


SkillGym:将人类技能内化至LLM以解决现实世界问题

来源:https://academy.dair.ai/papers/skillgym-internalizing-human-skills-into-llms-for-real-world-problem-solving-2609.27717 智能体 · 推理 与论文对话(https://academy.dair.ai/dashboard/paper-chat/skillgym-internalizing-human-skills-into-llms-for-real-world-problem-solving-2609.27717)

首页

SkillGym:将人类技能内化至LLM以解决现实世界问题

策划者观点

华东师范大学的葛志龙、陈钦等人提出了SkillGym,该框架将人类编写的智能体技能转化为可执行、可验证的训练环境,使这些流程最终融入模型权重。

本文要点

关于本文的提问 核心要点01

技能到任务流水线。每项技能被转化为具体任务,并配有基于代码的结果检查器,通过对比使用与不使用技能的运行情况,衡量任务对该技能的依赖程度。

02

发布资源。包含12个类别的2,756个环境,以及来自多个模型和框架的8,364条成功轨迹,平均每条轨迹包含49次工具调用和超过6万个记录词元。

03

Claude Code下的监督微调增益。Qwen3.5-35B-A3B在GDPval-AA v2上提升199 Elo,在Terminal-Bench 2.1上提升19.10分,在SkillsBench v1.1上分别提升28.13分(带技能)和12.38分(无技能)。

04

对比结果。35B的SkillGym-Agent在技能辅助的SkillsBench上达到51.47%,超越了Claude Sonnet 4.6、GPT-5.4 Mini和DeepSeek V4 Pro的公开分数。

05

内化流程。在不使用技能的情况下,它超越了在Codex和Claude Code中依赖技能的基础模型。

摘要人类编写的智能体技能编码了丰富的现实世界问题解决流程,但通常作为外部推理时指令使用,而非内化为可重用的模型能力。我们引入了\texttt{SkillGym}框架,将这些技能转化为大型语言模型智能体可执行、可验证的训练环境。其技能到任务流水线实例化具体任务,使用基于代码的检查器验证结果,并通过对比执行评估经验性的技能依赖关系。我们构建并发布了12个类别的2,756个环境,从多个模型和框架中收集了8,364条成功轨迹,平均包含49次工具调用和超过6万个记录文本词元。这些资源支持在验证流程上进行监督微调,以及基于结果奖励的强化学习。在Claude Code中,监督微调使Qwen3.5-35B-A3B在GDPval-AA v2上提升199 Elo,在Terminal-Bench 2.1上提升19.10个百分点,在SkillsBench v1.1上带技能提升28.13分、无技能提升12.38分。我们35B的\texttt{SkillGym-Agent}在技能辅助的SkillsBench上达到51.47%,超过了Claude Sonnet 4.6、GPT-5.4 Mini和DeepSeek V4 Pro的公开分数。即使不使用技能,它也超越了在Codex和Claude Code中依赖技能的基础模型,表明其具备可重用的程序性能力。

相似文章

SkillGym:通过自动可验证环境生成训练技能使用智能体

Hugging Face Daily Papers

SkillGym 提出了一条自动化流水线:从互联网上爬取可复现的技能,构建可验证且难度可控的环境,并收集 19k 条已验证轨迹来训练技能使用智能体。在这些轨迹上对 Qwen3.5 系列模型(2B 到 122B)进行微调后,其在四个技能使用基准上的表现均有所提升;其中 9B 的 SFT 模型在两项基准上超过了 397B 的未训练模型。

@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2069064122218717387

X AI KOLs Timeline

本文探讨了AI代理如何利用微软研究院的SkillOpt等技术自动编写和优化其技能文件,该技术将技能文档视为可训练状态,并带来显著的性能提升。文章还解决了手动技能调优的挑战,并介绍了GEPA和EvoSkill等进化方法的框架。