@kevin_x_li: 介绍 SWE-ZERO-12M-trajectories:公开中最大的智能体追踪数据集,比之前最大的大5.7倍…

X AI KOLs Following 工具

摘要

SWE-ZERO-12M-trajectories 是最大的公开编码智能体追踪数据集,包含来自122K个拉取请求和3K个仓库的12M条轨迹,共计112B个token,支持在不需容器化执行的情况下对智能体编码模型进行可扩展训练。

介绍 SWE-ZERO-12M-trajectories:公开中最大的智能体追踪数据集,比之前最大的大5.7倍。 112B tokens · 12M 条轨迹 · 122K 个PR · 3K 个仓库 · 16 种语言 https://t.co/beIxnrHnlR
查看原文
查看缓存全文

缓存时间: 2026/05/13 20:24

介绍 SWE-ZERO-12M-trajectories:迄今为止开源的最大智能体轨迹数据集,是此前最大数据集的 5.7 倍。

112B 词元 · 12M 条轨迹 · 122K 个拉取请求 · 3K 个仓库 · 16 种编程语言

https://t.co/beIxnrHnlR


AlienKevin/SWE-ZERO-12M-trajectories · Hugging Face 数据集

来源:https://huggingface.co/datasets/AlienKevin/SWE-ZERO-12M-trajectories

https://huggingface.co/datasets/AlienKevin/SWE-ZERO-12M-trajectories#swe-zero-12m-trajectoriesSWE-ZERO 12M 条轨迹

迄今为止最大的智能体编码轨迹数据集:112 B 词元的免执行智能体轨迹,涵盖 122 K 个拉取请求3 K 个仓库16 种编程语言

https://huggingface.co/datasets/AlienKevin/SWE-ZERO-12M-trajectories#motivation动机

智能体中期训练已成为前沿编码模型的标准组成部分:

  • Code World Model(2025 年 9 月)在 5 T 词元上进行中期训练,使用了来自 10.2 K 个 Docker 镜像(覆盖 3.15 K 个仓库)的 3 M 条智能体轨迹。
  • Kimi-Dev(2025 年 12 月)在约 150 B 词元的“高质量真实世界数据”上进行中期训练,以注入 BugFixer 和 TestWriter 先验。
  • DeepSeek-V4(2026 年 5 月)在中期训练中引入智能体数据以增强编码能力。

三者都依赖容器化执行来验证轨迹,而这也是数据的天花板所在。Kimi-Dev 最先指出了这一点:

“虽然 GitHub 上的仓库快照可用,但并非所有快照都配备了可执行的 Docker 环境。”

目前最大的容器化数据集 SWE-rebench-V2 提供了 32 K 个任务及预构建镜像,但也承认了天花板的存在,额外发布了 120 K+ 个无法容器化的任务(4 倍以上),仅附有安装说明和失败通过元数据,因为构建这些镜像的成本过高。

SWE-ZERO(先前工作)首次提出了用于智能体 SWE 训练数据的免执行流水线,指出了 Docker 带来的两个瓶颈:

  • 数据扩展性:由于复杂或遗留的构建配置在现代容器化环境中无法工作,大部分真实仓库和拉取请求被丢弃。
  • 训练扩展性:编排数千个特定任务的 Docker 镜像会产生巨大的基础设施开销,使大规模优化和强化学习复杂化。

SWE-ZERO 通过指示模型不要运行依赖项目安装环境的仓库特定命令(如 pytestnpm test 或构建脚本)来规避 Docker 需求。模型仍可自由使用无需搭建环境的标准 POSIX 命令(grepfindcatsedlsgit 等)来探索和编辑仓库。这些命令都不需要仓库被构建或其依赖被安装,因此该流水线可以针对任何 GitHub PR 快照运行,并解锁了过去流水线不得不丢弃的大量长尾 PR。

SWE-ZERO 发布了 9 B 词元,我们使用相同的免执行方案将其规模扩大了 10 倍,达到 112 B 词元。覆盖范围:

  • 12,290,800 次展开
  • 122,908 个唯一 PR
  • 3,222 个仓库
  • 16 种编程语言

据我们所知,它现在是此前最大智能体轨迹数据集 open-thoughts/AgentTrove 的 5.7 倍(111.06 B 对比 19.41 B 词元):

数据集发布展开次数总词元
ricdomolm/mini-coder-trajs-400k2025-09-30396,5155.26 B
nvidia/Nemotron-Terminal-Corpus2026-02-19366,1546.23 B
nvidia/SWE-Zero-openhands-trajectories(原始 SWE-ZERO 发布)2026-04-17318,1158.92 B
open-thoughts/AgentTrove2026-04-271,696,84719.41 B
AlienKevin/SWE-ZERO-12M-trajectories(本数据集,10 倍扩展)2026-05-1212,290,800111.06 B

https://huggingface.co/datasets/AlienKevin/SWE-ZERO-12M-trajectories#experiment-validation实验验证

**多样性检查(MinHash-64)。**我们遵循 Code World Model 论文的多样性协议。它衡量同一 PR 内各展开之间在 bash 命令分片上的平均 Jaccard 相似度。低于 0.5 即视为多样。在我们的语料库上,我们测得 0.2730,远低于阈值。

**训练检查。**为验证轨迹确实能转化为模型能力,我们在本数据集早期快照(@ab6295c3 (https://huggingface.co/datasets/AlienKevin/SWE-ZERO-12M-trajectories/tree/ab6295c37153e938c871d4021c4457379e67396e),1.6 M 条展开 / 18.4 B 词元)的三个代表性子集上训练了 Marin-8B 基础模型,并在 SWE-bench Verified(100 个随机任务,mini-swe-agent v1 + Harbor,每个模型运行 3 次,温度 1.0)上进行评估:

训练数据展开次数词元数平均解决率
Marin-8B 基线无/无无/无0.0 %
SWE-ZERO 训练10,000~100 M3.3 % ± 0.6
SWE-ZERO 训练50,000~570 M4.0 % ± 2.0
SWE-ZERO 训练100,000~1.1 B5.3 % ± 1.5

Marin-8B 在 SWE-bench Verified 上的扩展 (https://huggingface.co/datasets/AlienKevin/SWE-ZERO-12M-trajectories/blob/main/assets/marin8b_swe_bench_scaling.png)

解决率在我们测试的 1 B 词元点之前与训练数据持续扩展。为简化方法,这些运行使用了标准的 SFT 掩码损失方案,但此语料库旨在作为中期训练数据集。下游模型应进一步在专门的 SFT 数据集(如 nvidia/SWE-Hero-openhands-trajectories (https://huggingface.co/datasets/nvidia/SWE-Hero-openhands-trajectories) 和 ricdomolm/mini-coder-trajs-400k (https://huggingface.co/datasets/ricdomolm/mini-coder-trajs-400k))上进行后训练。完整方法、每个任务的细分以及其他实验详情:marin-community/marin#4898(评论) (https://github.com/marin-community/marin/issues/4898#issuecomment-4283675417)。

https://huggingface.co/datasets/AlienKevin/SWE-ZERO-12M-trajectories#methodology方法论

每次展开从 nebius/SWE-rebench-V2-PRs (https://huggingface.co/datasets/nebius/SWE-rebench-V2-PRs) 中的一个真实 GitHub PR 快照开始,该快照提供了覆盖 3,222 个仓库的真实世界软件工程任务。我们从 ricdomolm/mini-coder-1.7b (https://huggingface.co/ricdomolm/mini-coder-1.7b)(一个紧凑的 1.7 B 参数代码模型,在 SWE-bench Verified 上得分为 50.4 pass@100)中,以温度 1.0 为目标,为每个 PR 采样 100 条独立的多轮展开。轨迹遵循 mini-swe-agent v1 (https://github.com/SWE-agent/mini-SWE-agent) 格式:一个 messages 列表,其中助手每轮发布一条 bash 命令,测试工具返回命令输出。

依据 SWE-ZERO,生成完全免执行:不构建容器、不执行测试、不咨询验证器。这正是实现大规模扩展的关键。

https://huggingface.co/datasets/AlienKevin/SWE-ZERO-12M-trajectories#schema模式

字段类型
instance_idstring - PR 标识符
repostring - owner/name
messageslist[{role, content}] - 多轮智能体轨迹
trajectory_formatstring - mini-swe-agent-1
exit_statusstring - Submittedincomplete
duration_secfloat64 - 挂钟生成时间

https://huggingface.co/datasets/AlienKevin/SWE-ZERO-12M-trajectories#sampling-settings采样设置

设置
每次展开最大轮数15
每个 PR 的展开次数100
采样温度1.0
最大模型长度(vLLM)32,768 词元
最大序列数(vLLM)256
每次展开最大总词元数32,768

https://huggingface.co/datasets/AlienKevin/SWE-ZERO-12M-trajectories#limitations局限性

这是一个中期训练语料库,而非 SFT 数据集。请按此对待。

  • 技能习得,而非任务完成。 此语料库的目标是在大规模上向基础模型灌输智能体工具使用先验:如何驱动 bash shell、导航仓库、读取和编辑文件,以及将思考与行动交织。它并非设计来教导模型解决端到端 SWE-bench 风格的任务。那是下游强化学习和 SFT 阶段的职责。
  • 无验证。 由于 SWE-ZERO 是免执行的,没有轨迹经过地面真实测试的检查。补丁不保证能编译、干净地应用或通过。正确性被有意牺牲以换取规模和仓库覆盖率。
  • 低提交率。 大多数展开未达到成功的 Submitted 退出状态;许多以 incomplete 退出或达到其他终止条件。如果仅过滤干净的提交,将丢失语料库的大部分内容。
  • 15 轮上限。 轨迹在 15 轮模型交互后被截断,以保持 p99 词元成本可控和吞吐量高。许多任务在 15 轮内无法解决,轨迹在调查中途结束。

尽管如此,先前工作表明这些局限性在实践中是可以接受的。SERANemotronTerminal 均报告下游 SFT 性能对不完整、失败和长度截断的轨迹鲁棒。具体来说,NemotronTerminal 的表 7 显示,不进行过滤(12.4 %) 显著优于仅完整(6.74 %)仅成功(5.06 %) 的过滤策略。我们自己在 Qwen3-1.7-Base 上的实验也证实了这一点:当在此语料库中截断至 8K 词元的 100K 样本上训练时,模型在 SWE-bench Verified 上达到 9 %,尽管大多数展开并未以补丁提交结束。完整详情见 marin-community/marin#5611(评论) (https://github.com/marin-community/marin/issues/5611#issuecomment-4440640008)。

https://huggingface.co/datasets/AlienKevin/SWE-ZERO-12M-trajectories#related-datasets相关数据集

  • SWE-ZERO-96K-trajectories (https://huggingface.co/datasets/AlienKevin/SWE-ZERO-96K-trajectories) - 来自 1B 扩展运行的 96K 条展开 (#4666)
  • SWE-ZERO-multilang-300-trajectories (https://huggingface.co/datasets/AlienKevin/SWE-ZERO-multilang-300-trajectories) - 来自多语言验证的 300 条展开 (#4653)

https://huggingface.co/datasets/AlienKevin/SWE-ZERO-12M-trajectories#citation引用

@misc{li2026swezero12m, author = {Xiang Li}, title = {{SWE-ZERO-12M-trajectories: 112B Tokens of Execution-Free Agentic Trajectories}}, year = {2026}, publisher = {Hugging Face}, howpublished = {\url{https://huggingface.co/datasets/AlienKevin/SWE-ZERO-12M-trajectories}}, }

上月下载量:1,192

相似文章