MindForge: 通过无源码程序合成教会小语言模型全生命周期软件工程

Hugging Face Daily Papers 论文

摘要

MindForge 是一个自动化管道,将开源命令行程序转换为无源码的训练环境,供小型语言模型使用。在由 GLM-5.2 生成的轨迹上微调 Qwen3.6-27B,显著提升了其在软件工程基准测试中的表现,取得了与更大模型相当的结果。

编码代理(Coding agents)在修改现有代码库的软件工程任务上取得了显著进展,包括缺陷修复和功能实现。然而,从头开始构建完整程序仍然是一个重大挑战:即使在 ProgramBench 上评估的前沿模型,完全解决的任务也不到 1%。其中一个障碍是缺乏针对这种从头开始场景的可扩展训练环境,该场景涵盖整个软件开发生命周期,因为现有的环境构建框架只关注软件开发的单一阶段。为了解决这个问题,我们引入了 MindForge,这是一个自动化管道,将开源命令行程序转换为仅暴露编译后参考可执行文件及其文档的无源码环境。利用 MindForge,我们从与 ProgramBench 不相交的仓库中构建训练环境,并策划了一个高质量的数据配方,该配方包含使用 GLM-5.2 作为教师代理生成的程序合成轨迹。在 Qwen3.6-27B 上对这些轨迹进行微调,使其在 ProgramBench 上的平均测试通过率从 37.98% 提高到 49.51%,实现了与规模大得多的前沿模型相当的性能。此外,微调模型在所有七个未见过的软件工程基准测试上均持续优于基础模型,这些基准测试涵盖长期仓库生成与翻译、缺陷修复、功能实现以及跨语言问题解决,绝对增益分别为:RepoZero-C2Rust 31.00 分、DeepSWE 14.16 分、NL2Repo-Bench 10.70/4.56 分(含/不含测试)、SWE-bench Verified 5.04 分、SWE-bench Pro 5.93 分、SWE-bench Multilingual 5.22 分、FeatBench 4.94 分。
查看原文
查看缓存全文

缓存时间: 2026/07/30 17:49

论文页面 - MindForge:通过无源程序合成为小型语言模型教授全生命周期软件工程

来源:https://huggingface.co/papers/2607.27146

摘要

编码智能体在修改现有代码库的软件工程任务(包括修复漏洞和实现功能)上取得了显著进展。然而,从头开始构建一个完整程序仍然是一个重大挑战:在ProgramBench上评估的前沿模型,完全解决的任务不到1%。其中一个障碍是缺乏针对这种从头开始场景(涵盖整个软件工程生命周期)的可扩展训练环境,因为现有的环境构建框架只关注软件开发中的单一阶段。为了解决这一缺口,我们引入了MindForge,这是一个自动化流水线,可将开源命令行程序转换为无源环境,仅暴露一个编译后的参考可执行文件及其文档。利用MindForge,我们从与ProgramBench无交集的开源仓库中构建训练环境,并使用GLM-5.2作为教师智能体,精心策划了一个由程序合成轨迹组成的高质量数据配方。在Qwen3.6-27B上微调这些轨迹,将其ProgramBench平均测试通过率从37.98%提升至49.51%,性能与规模大得多的前沿模型相当。此外,微调后的模型在所有七个未见软件工程基准测试上均持续优于基础模型,涵盖长周期仓库生成与翻译、修复漏洞、功能实现以及跨语言问题解决,在RepoZero-C2Rust上绝对提升31.00个点,在DeepSWE上提升14.16,在NL2Repo-Bench上(有/无测试)分别提升10.70/4.56,在SWE-bench Verified上提升5.04,在SWE-bench Pro上提升5.93,在SWE-bench Multilingual上提升5.22,在FeatBench上提升4.94。

查看 arXiv 页面 (https://arxiv.org/abs/2607.27146) 查看 PDF (https://arxiv.org/pdf/2607.27146) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.27146)

在你的智能体中获取这篇论文:

hf papers read 2607\.27146

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接到此论文

在模型 README.md 中引用 arxiv.org/abs/2607.27146,即可在此页面链接它。

引用此论文的数据集0

没有数据集链接到此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.27146,即可在此页面链接它。

引用此论文的 Spaces0

没有 Space 链接到此论文

在 Space README.md 中引用 arxiv.org/abs/2607.27146,即可在此页面链接它。

包含此论文的收藏集0

没有包含此论文的收藏集

将这篇论文添加到一个收藏集 (https://huggingface.co/new-collection) 中以在此页面链接它。

相似文章

Qwen-Scope:将稀疏特征转化为大语言模型的开发工具

arXiv cs.CL

本文介绍了 Qwen-Scope,这是一套在 Qwen3 和 Qwen3.5 模型上训练的稀疏自编码器(SAE)工具包,旨在实现机械可解释性分析与干预。该工具包发布了涵盖密集和 MoE 骨干网络的 14 组 SAE 权重,为残差流激活提供了稀疏表示。

通过大型模型的演化

OpenAI Blog

本论文证明了在代码上训练的大型语言模型可以显著增强遗传编程的变异算子,使得能够在 Sodarace 领域中生成数十万个功能性 Python 程序用于机器人设计,且无需预训练数据。该方法称为演化通过大型模型(ELM),将 LLM 与 MAP-Elites 相结合,为上下文特定的制品生成引导新的条件模型。