NexForge:通过需求驱动任务合成扩展LLM的智能体能力
摘要
NexForge是一个需求驱动的框架,能够为LLM后训练合成多样化、可执行的智能体任务和专家轨迹,优于先前的方法,并在Terminal-Bench上实现了最先进的开源智能体性能。
查看缓存全文
缓存时间: 2026/07/22 02:40
论文页面 - NexForge:通过需求驱动的任务合成扩展LLM的智能体能力
来源:https://huggingface.co/papers/2607.14186
摘要
为LLM后训练扩展可执行的智能体训练数据,受到受限于底层环境的方法的瓶颈——这些方法将任务生成与预定义工具、代码库或技能图谱绑定:扩大覆盖范围需要人工环境工程,每个新领域都需要定制化流程,而且生成的任务分布往往反映环境的偏见而非真实世界需求。我们提出了NexForge,一个需求驱动的框架,以高层次能力需求作为输入,合成多样化、可执行的智能体任务及用于SFT的专家轨迹。NexForge首先调研真实世界需求以构建代表性场景和任务画像,然后执行分布感知的编译来生成任务指令。对于每条指令,NexForge自动检索或构建所需的文件、依赖项和运行时配置,最后合成专家执行过程并生成训练轨迹。无需领域特定基础设施,NexForge生成了3.6K个终端任务和2K个办公任务,将Qwen3.5-35B-A3B Base在Terminal-Bench 2.0上的性能从22.5%提升至52.0%,在GDPval上的Elo从813提升至1338;进一步扩展到43.2K个终端任务后达到58.4%,与配备Claude Code的Claude Opus 4.6相当。进一步扩展后,NexForge合成的数据为Nex-N2(一系列公开可用的智能体模型)的训练做出了贡献,这些模型将Qwen3.5-35B-A3B在Terminal-Bench 2.1上的性能提升至75.3%,在GDPval上的Elo提升至1585——实现了开源最优性能,并超越了多个前沿专有系统。Nex-N2模型可在 https://nex.sii.edu.cn/ 获取。
查看 arXiv 页面 (https://arxiv.org/abs/2607.14186) 查看 PDF (https://arxiv.org/pdf/2607.14186) 项目页面 (https://nex.sii.edu.cn/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.14186)
引用该论文的模型0
没有模型链接该论文
请在模型 README.md 中引用 arxiv.org/abs/2607.14186 以在此页面建立链接。
引用该论文的数据集0
没有数据集链接该论文
请在数据集 README.md 中引用 arxiv.org/abs/2607.14186 以在此页面建立链接。
引用该论文的Space0
没有 Space 链接该论文
请在 Space README.md 中引用 arxiv.org/abs/2607.14186 以在此页面建立链接。
包含该论文的合集0
没有合集包含该论文
请将该论文添加到一个合集中 (https://huggingface.co/new-collection) 以在此页面建立链接。
相似文章
EnvFactory:通过可执行环境合成与鲁棒强化学习扩展工具使用智能体
EnvFactory 自动化创建可执行工具环境和自然的多轮轨迹,用于训练具有智能体强化学习能力的大语言模型,在使用比先前工作更少的环境下,在 BFCLv3 和 MCP-Atlas 等基准测试上取得了优异性能。
CLI-Universe:面向终端代理的可验证任务合成引擎
CLI-Universe是一个合成引擎,通过多维能力分类体系和证据引导的研究生成可验证的终端代理任务,并产生包含6000条轨迹的精炼数据集。在该数据集上微调Qwen3-32B,在Terminal-Bench 2.0上达到了33.4%,为参数量在32B及以下的开源模型树立了新的最优水平。
ClawForge:为命令行智能体生成可执行的交互式基准测试
ClawForge 是一个基于生成器的基准测试框架,用于在状态冲突下生成可执行的命令行工作流,通过在17个场景中评估LLM智能体处理预先存在的部分、过时或冲突工件的能力。
HarnessForge: 联合执行框架与策略演化用于自适应智能体系统
HarnessForge 提出一种用于演化LLM智能体系统的元自适应框架,通过联合优化执行框架与推理策略,在五个基准测试上对Qwen3骨干模型实现持续改进。
ExecuGraph:一种基于执行的多智能体框架,用于利用大型语言模型进行可靠的后端代码合成
ExecuGraph是一个用于后端代码合成的多智能体框架,利用基于执行的验证和六个专用智能体来提高可靠性,尤其在更强模型(如DeepSeek-Coder-V2-Lite)上表现出增益。