MindForge: 通过无源码程序合成教会小语言模型全生命周期软件工程
摘要
MindForge 是一个自动化管道,将开源命令行程序转换为无源码的训练环境,供小型语言模型使用。在由 GLM-5.2 生成的轨迹上微调 Qwen3.6-27B,显著提升了其在软件工程基准测试中的表现,取得了与更大模型相当的结果。
查看缓存全文
缓存时间: 2026/07/30 17:49
论文页面 - MindForge:通过无源程序合成为小型语言模型教授全生命周期软件工程
来源:https://huggingface.co/papers/2607.27146
摘要
编码智能体在修改现有代码库的软件工程任务(包括修复漏洞和实现功能)上取得了显著进展。然而,从头开始构建一个完整程序仍然是一个重大挑战:在ProgramBench上评估的前沿模型,完全解决的任务不到1%。其中一个障碍是缺乏针对这种从头开始场景(涵盖整个软件工程生命周期)的可扩展训练环境,因为现有的环境构建框架只关注软件开发中的单一阶段。为了解决这一缺口,我们引入了MindForge,这是一个自动化流水线,可将开源命令行程序转换为无源环境,仅暴露一个编译后的参考可执行文件及其文档。利用MindForge,我们从与ProgramBench无交集的开源仓库中构建训练环境,并使用GLM-5.2作为教师智能体,精心策划了一个由程序合成轨迹组成的高质量数据配方。在Qwen3.6-27B上微调这些轨迹,将其ProgramBench平均测试通过率从37.98%提升至49.51%,性能与规模大得多的前沿模型相当。此外,微调后的模型在所有七个未见软件工程基准测试上均持续优于基础模型,涵盖长周期仓库生成与翻译、修复漏洞、功能实现以及跨语言问题解决,在RepoZero-C2Rust上绝对提升31.00个点,在DeepSWE上提升14.16,在NL2Repo-Bench上(有/无测试)分别提升10.70/4.56,在SWE-bench Verified上提升5.04,在SWE-bench Pro上提升5.93,在SWE-bench Multilingual上提升5.22,在FeatBench上提升4.94。
查看 arXiv 页面 (https://arxiv.org/abs/2607.27146) 查看 PDF (https://arxiv.org/pdf/2607.27146) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.27146)
在你的智能体中获取这篇论文:
hf papers read 2607\.27146
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接到此论文
在模型 README.md 中引用 arxiv.org/abs/2607.27146,即可在此页面链接它。
引用此论文的数据集0
没有数据集链接到此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.27146,即可在此页面链接它。
引用此论文的 Spaces0
没有 Space 链接到此论文
在 Space README.md 中引用 arxiv.org/abs/2607.27146,即可在此页面链接它。
包含此论文的收藏集0
没有包含此论文的收藏集
将这篇论文添加到一个收藏集 (https://huggingface.co/new-collection) 中以在此页面链接它。
相似文章
Qwen-Scope:将稀疏特征转化为大语言模型的开发工具
本文介绍了 Qwen-Scope,这是一套在 Qwen3 和 Qwen3.5 模型上训练的稀疏自编码器(SAE)工具包,旨在实现机械可解释性分析与干预。该工具包发布了涵盖密集和 MoE 骨干网络的 14 组 SAE 权重,为残差流激活提供了稀疏表示。
从搜索到综合:训练大语言模型为零样本工作流生成器
介绍MetaFlow,一种通过结合监督微调和带执行反馈的强化学习来训练大语言模型为零样本任务生成工作流的方法,实现对未训练任务和算子集的强大泛化能力。
@0xCodez: https://x.com/0xCodez/status/2058911661973454915
一份详细指南,解释构建大型语言模型的五个阶段流程,强调数据质量和工程实践比架构更为重要。
通过大型模型的演化
本论文证明了在代码上训练的大型语言模型可以显著增强遗传编程的变异算子,使得能够在 Sodarace 领域中生成数十万个功能性 Python 程序用于机器人设计,且无需预训练数据。该方法称为演化通过大型模型(ELM),将 LLM 与 MAP-Elites 相结合,为上下文特定的制品生成引导新的条件模型。
@KirkDBorne: "如何构建并微调小型语言模型:面向初学者、研究人员和非程序员的逐步指南…
一份关于构建和微调小型语言模型的逐步指南,专为初学者、研究人员和非程序员设计,包含动手实践示例和Colab笔记本。