@billxbf: 今天我们把Superintelligence还给它的所有者。介绍Skill2Env,最对齐且多样化的数据集,以驱动…
摘要
介绍Skill2Env,一个对齐且多样化的数据集,旨在驱动现代Agentic RL研究。
查看缓存全文
缓存时间: 2026/09/22 16:01
今天,我们将超级智能归还其所有者。
隆重推出 Skill2Env 🎉 —— 为现代智能体强化学习提供最对齐且最多样的数据集。🧵
(1/5) 一年内,开放社区已贡献了数千项公开的智能体技能,将领域专长与理想行为模式广泛打包——形成了一个由集体人类兴趣与价值观所定义的分布。
(2/5) 我们抓取了这些由领域专家公开分享的技能,并开发了一套流程,将每项技能转化为多项可验证的强化学习数据与环境。所生成的任务在真实环境中运行,如GitHub仓库、论文、数据库和各类制品。每个任务都包含一组程序化测试,以及源自技能的定性对齐评估标准。
(3/5) 我们基于Qwen3.8-27b模型运行了DPPO变体300步。效果超出预期——我们在公开的TerminalBench2.1和私有的S2EBench(一个手工验证的保留集,继承了Skill2Env的全部多样性)上均观察到提升。这一努力进一步缩小了本地与云端大语言模型在强大(最强)27B模型上的差距。
(4/5) 训练基础设施是主要挑战。我们重建了基础设施,整合了前期工作的创新:Molt控制训练循环,Polar在沙箱内控制任意框架的 rollout 与评分,vLLM作为推理引擎,并通过Ray进行分布式资源管理。
(5/5) 开放AI的道路在于,针对公众自身定义的、人类兴趣与价值观的分布进行优化。
🌊 数据集:https://hub.harborframework.com/datasets/skill2env/skill2env…
💻 仓库:https://github.com/NVlabs/Skill2Env…
📜 论文:https://github.com/NVlabs/Skill2Env/blob/main/paper/Skill2Env_arXiv.pdf…
🔳 强化学习基础设施(供参考):https://github.com/billxbf/Linex
相似文章
@rohanpaul_ai: 阅读Sentient新EvoSkill v2的完整技术博客
Sentient的新EvoSkill v2是一个开源框架,能从失败尝试中进化代理技能,展示了AI教练如何利用奖励破解,并强调了在评估中需要权力分立和强沙盒机制。
@billxbf: 技术报告现已发布 https://alphaxiv.org/abs/2609.reinforcing-agents-collective-skills…
本文介绍了一种方法,将从业者编写的'Agent Skills'整合到AI代理的训练环境中,使用强化学习以提高他们在现实世界任务和基准测试中的性能。
Google's SkillOS:面向自进化 AI 智能体(阅读需22分钟)
Google Cloud AI Research 推出 SkillOS,这是一种强化学习框架,使基于 LLM 的智能体能够通过从过往经验中提炼可复用技能来实现自我进化。
Skill1:通过强化学习实现技能增强型智能体的统一进化
Skill1 是一个统一框架,通过共享的任务结果目标,训练单一策略以协同进化技能选择、利用与蒸馏。在 ALFWorld 和 WebShop 上的实验表明,该框架在复杂任务环境中优于现有的基线方法。
SkillNet:创建、评估并连接AI技能
SkillNet 提供了一个开放的基础设施,通过统一的本体系统地积累和迁移 AI 技能,在多个领域展现了智能体性能的显著提升。