@kevin_x_li: 介绍 SWE-ZERO-12M-trajectories:公开中最大的智能体追踪数据集,比之前最大的大5.7倍…
摘要
SWE-ZERO-12M-trajectories 是最大的公开编码智能体追踪数据集,包含来自122K个拉取请求和3K个仓库的12M条轨迹,共计112B个token,支持在不需容器化执行的情况下对智能体编码模型进行可扩展训练。
查看缓存全文
缓存时间: 2026/05/13 20:24
介绍 SWE-ZERO-12M-trajectories:迄今为止开源的最大智能体轨迹数据集,是此前最大数据集的 5.7 倍。
112B 词元 · 12M 条轨迹 · 122K 个拉取请求 · 3K 个仓库 · 16 种编程语言
https://t.co/beIxnrHnlR
AlienKevin/SWE-ZERO-12M-trajectories · Hugging Face 数据集
来源:https://huggingface.co/datasets/AlienKevin/SWE-ZERO-12M-trajectories
https://huggingface.co/datasets/AlienKevin/SWE-ZERO-12M-trajectories#swe-zero-12m-trajectoriesSWE-ZERO 12M 条轨迹
迄今为止最大的智能体编码轨迹数据集:112 B 词元的免执行智能体轨迹,涵盖 122 K 个拉取请求、3 K 个仓库和 16 种编程语言。
https://huggingface.co/datasets/AlienKevin/SWE-ZERO-12M-trajectories#motivation动机
智能体中期训练已成为前沿编码模型的标准组成部分:
- Code World Model(2025 年 9 月)在 5 T 词元上进行中期训练,使用了来自 10.2 K 个 Docker 镜像(覆盖 3.15 K 个仓库)的 3 M 条智能体轨迹。
- Kimi-Dev(2025 年 12 月)在约 150 B 词元的“高质量真实世界数据”上进行中期训练,以注入 BugFixer 和 TestWriter 先验。
- DeepSeek-V4(2026 年 5 月)在中期训练中引入智能体数据以增强编码能力。
三者都依赖容器化执行来验证轨迹,而这也是数据的天花板所在。Kimi-Dev 最先指出了这一点:
“虽然 GitHub 上的仓库快照可用,但并非所有快照都配备了可执行的 Docker 环境。”
目前最大的容器化数据集 SWE-rebench-V2 提供了 32 K 个任务及预构建镜像,但也承认了天花板的存在,额外发布了 120 K+ 个无法容器化的任务(4 倍以上),仅附有安装说明和失败通过元数据,因为构建这些镜像的成本过高。
SWE-ZERO(先前工作)首次提出了用于智能体 SWE 训练数据的免执行流水线,指出了 Docker 带来的两个瓶颈:
- 数据扩展性:由于复杂或遗留的构建配置在现代容器化环境中无法工作,大部分真实仓库和拉取请求被丢弃。
- 训练扩展性:编排数千个特定任务的 Docker 镜像会产生巨大的基础设施开销,使大规模优化和强化学习复杂化。
SWE-ZERO 通过指示模型不要运行依赖项目安装环境的仓库特定命令(如 pytest、npm test 或构建脚本)来规避 Docker 需求。模型仍可自由使用无需搭建环境的标准 POSIX 命令(grep、find、cat、sed、ls、git 等)来探索和编辑仓库。这些命令都不需要仓库被构建或其依赖被安装,因此该流水线可以针对任何 GitHub PR 快照运行,并解锁了过去流水线不得不丢弃的大量长尾 PR。
SWE-ZERO 发布了 9 B 词元,我们使用相同的免执行方案将其规模扩大了 10 倍,达到 112 B 词元。覆盖范围:
- 12,290,800 次展开
- 122,908 个唯一 PR
- 3,222 个仓库
- 16 种编程语言
据我们所知,它现在是此前最大智能体轨迹数据集 open-thoughts/AgentTrove 的 5.7 倍(111.06 B 对比 19.41 B 词元):
| 数据集 | 发布 | 展开次数 | 总词元 |
|---|---|---|---|
ricdomolm/mini-coder-trajs-400k | 2025-09-30 | 396,515 | 5.26 B |
nvidia/Nemotron-Terminal-Corpus | 2026-02-19 | 366,154 | 6.23 B |
nvidia/SWE-Zero-openhands-trajectories(原始 SWE-ZERO 发布) | 2026-04-17 | 318,115 | 8.92 B |
open-thoughts/AgentTrove | 2026-04-27 | 1,696,847 | 19.41 B |
AlienKevin/SWE-ZERO-12M-trajectories(本数据集,10 倍扩展) | 2026-05-12 | 12,290,800 | 111.06 B |
https://huggingface.co/datasets/AlienKevin/SWE-ZERO-12M-trajectories#experiment-validation实验验证
**多样性检查(MinHash-64)。**我们遵循 Code World Model 论文的多样性协议。它衡量同一 PR 内各展开之间在 bash 命令分片上的平均 Jaccard 相似度。低于 0.5 即视为多样。在我们的语料库上,我们测得 0.2730,远低于阈值。
**训练检查。**为验证轨迹确实能转化为模型能力,我们在本数据集早期快照(@ab6295c3 (https://huggingface.co/datasets/AlienKevin/SWE-ZERO-12M-trajectories/tree/ab6295c37153e938c871d4021c4457379e67396e),1.6 M 条展开 / 18.4 B 词元)的三个代表性子集上训练了 Marin-8B 基础模型,并在 SWE-bench Verified(100 个随机任务,mini-swe-agent v1 + Harbor,每个模型运行 3 次,温度 1.0)上进行评估:
| 训练数据 | 展开次数 | 词元数 | 平均解决率 |
|---|---|---|---|
| Marin-8B 基线 | 无/无 | 无/无 | 0.0 % |
| SWE-ZERO 训练 | 10,000 | ~100 M | 3.3 % ± 0.6 |
| SWE-ZERO 训练 | 50,000 | ~570 M | 4.0 % ± 2.0 |
| SWE-ZERO 训练 | 100,000 | ~1.1 B | 5.3 % ± 1.5 |
Marin-8B 在 SWE-bench Verified 上的扩展 (https://huggingface.co/datasets/AlienKevin/SWE-ZERO-12M-trajectories/blob/main/assets/marin8b_swe_bench_scaling.png)
解决率在我们测试的 1 B 词元点之前与训练数据持续扩展。为简化方法,这些运行使用了标准的 SFT 掩码损失方案,但此语料库旨在作为中期训练数据集。下游模型应进一步在专门的 SFT 数据集(如 nvidia/SWE-Hero-openhands-trajectories (https://huggingface.co/datasets/nvidia/SWE-Hero-openhands-trajectories) 和 ricdomolm/mini-coder-trajs-400k (https://huggingface.co/datasets/ricdomolm/mini-coder-trajs-400k))上进行后训练。完整方法、每个任务的细分以及其他实验详情:marin-community/marin#4898(评论) (https://github.com/marin-community/marin/issues/4898#issuecomment-4283675417)。
https://huggingface.co/datasets/AlienKevin/SWE-ZERO-12M-trajectories#methodology方法论
每次展开从 nebius/SWE-rebench-V2-PRs (https://huggingface.co/datasets/nebius/SWE-rebench-V2-PRs) 中的一个真实 GitHub PR 快照开始,该快照提供了覆盖 3,222 个仓库的真实世界软件工程任务。我们从 ricdomolm/mini-coder-1.7b (https://huggingface.co/ricdomolm/mini-coder-1.7b)(一个紧凑的 1.7 B 参数代码模型,在 SWE-bench Verified 上得分为 50.4 pass@100)中,以温度 1.0 为目标,为每个 PR 采样 100 条独立的多轮展开。轨迹遵循 mini-swe-agent v1 (https://github.com/SWE-agent/mini-SWE-agent) 格式:一个 messages 列表,其中助手每轮发布一条 bash 命令,测试工具返回命令输出。
依据 SWE-ZERO,生成完全免执行:不构建容器、不执行测试、不咨询验证器。这正是实现大规模扩展的关键。
https://huggingface.co/datasets/AlienKevin/SWE-ZERO-12M-trajectories#schema模式
| 字段 | 类型 |
|---|---|
instance_id | string - PR 标识符 |
repo | string - owner/name |
messages | list[{role, content}] - 多轮智能体轨迹 |
trajectory_format | string - mini-swe-agent-1 |
exit_status | string - Submitted、incomplete 等 |
duration_sec | float64 - 挂钟生成时间 |
https://huggingface.co/datasets/AlienKevin/SWE-ZERO-12M-trajectories#sampling-settings采样设置
| 设置 | 值 |
|---|---|
| 每次展开最大轮数 | 15 |
| 每个 PR 的展开次数 | 100 |
| 采样温度 | 1.0 |
| 最大模型长度(vLLM) | 32,768 词元 |
| 最大序列数(vLLM) | 256 |
| 每次展开最大总词元数 | 32,768 |
https://huggingface.co/datasets/AlienKevin/SWE-ZERO-12M-trajectories#limitations局限性
这是一个中期训练语料库,而非 SFT 数据集。请按此对待。
- 技能习得,而非任务完成。 此语料库的目标是在大规模上向基础模型灌输智能体工具使用先验:如何驱动 bash shell、导航仓库、读取和编辑文件,以及将思考与行动交织。它并非设计来教导模型解决端到端 SWE-bench 风格的任务。那是下游强化学习和 SFT 阶段的职责。
- 无验证。 由于 SWE-ZERO 是免执行的,没有轨迹经过地面真实测试的检查。补丁不保证能编译、干净地应用或通过。正确性被有意牺牲以换取规模和仓库覆盖率。
- 低提交率。 大多数展开未达到成功的
Submitted退出状态;许多以incomplete退出或达到其他终止条件。如果仅过滤干净的提交,将丢失语料库的大部分内容。 - 15 轮上限。 轨迹在 15 轮模型交互后被截断,以保持 p99 词元成本可控和吞吐量高。许多任务在 15 轮内无法解决,轨迹在调查中途结束。
尽管如此,先前工作表明这些局限性在实践中是可以接受的。SERA 和 NemotronTerminal 均报告下游 SFT 性能对不完整、失败和长度截断的轨迹鲁棒。具体来说,NemotronTerminal 的表 7 显示,不进行过滤(12.4 %) 显著优于仅完整(6.74 %) 和仅成功(5.06 %) 的过滤策略。我们自己在 Qwen3-1.7-Base 上的实验也证实了这一点:当在此语料库中截断至 8K 词元的 100K 样本上训练时,模型在 SWE-bench Verified 上达到 9 %,尽管大多数展开并未以补丁提交结束。完整详情见 marin-community/marin#5611(评论) (https://github.com/marin-community/marin/issues/5611#issuecomment-4440640008)。
https://huggingface.co/datasets/AlienKevin/SWE-ZERO-12M-trajectories#related-datasets相关数据集
SWE-ZERO-96K-trajectories(https://huggingface.co/datasets/AlienKevin/SWE-ZERO-96K-trajectories) - 来自 1B 扩展运行的 96K 条展开 (#4666)SWE-ZERO-multilang-300-trajectories(https://huggingface.co/datasets/AlienKevin/SWE-ZERO-multilang-300-trajectories) - 来自多语言验证的 300 条展开 (#4653)
https://huggingface.co/datasets/AlienKevin/SWE-ZERO-12M-trajectories#citation引用
@misc{li2026swezero12m, author = {Xiang Li}, title = {{SWE-ZERO-12M-trajectories: 112B Tokens of Execution-Free Agentic Trajectories}}, year = {2026}, publisher = {Hugging Face}, howpublished = {\url{https://huggingface.co/datasets/AlienKevin/SWE-ZERO-12M-trajectories}}, }
上月下载量:1,192
相似文章
@tom_doerr: 生成96,000条高质量深度研究轨迹,并提供完全开源的配方,用于训练代理型语言模型…
OpenResearcher是来自TIGER-AI-Lab的一个开源项目,它提供了96,000条深度研究轨迹以及一套无需外部API即可训练代理型语言模型进行长周期网络研究的方案。它包含数据集、模型和演示,并已被NVIDIA的Nemotron模型采用。
将您的编程会话捐赠至开放的CC-BY-4.0数据集,以帮助训练开放权重和开源模型
一项名为Trace Commons的新倡议旨在将编码智能体的追踪记录收集到开放CC-BY-4.0数据集中,以帮助训练开放权重和开源模型,从而对抗来自Anthropic和OpenAI的专有模型的数据优势。
S1-DeepResearch:超越搜索,迈向真实世界的长周期研究代理
本文介绍了S1-DeepResearch-32B,这是一个开源模型及包含15K条轨迹的数据集,用于深度研究代理,通过联合建模信息获取、知识综合与规划,在20个基准测试中取得了最先进的性能。
基于Docker化环境的大规模终端智能体轨迹生成
TerminalTraj是一个可扩展的流水线,利用Docker化环境生成高质量的终端智能体轨迹,在终端任务基准上使用TerminalTraj-32B等模型实现了高达20%的性能提升。
@JiaZhihao: 推出 Motus Tracing:AI 代理的开源可观测性。没有追踪,代理就是消耗 token 的黑盒……
Motus Tracing 是一个完全开源的可观测层,专为 AI 代理设计,能够捕获每一次模型调用、工具调用、沙箱交互和错误,提供统一的跨度模型,支持本地开发和云部署,零设置成本。