Nanbeige4.2-3B:在紧凑模式下释放智能体能力
摘要
Nanbeige4.2-3B 是一个紧凑的 3B 参数通用智能体模型,采用 Looped Transformer 从零开始预训练,在智能体和推理任务上表现出色,在多个基准测试中超越了更大的模型。该模型和代码均已开源。
arXiv:2607.22083v1 公告类型:交叉
摘要:我们提出 Nanbeige4.2-3B,一个紧凑的通用智能体模型,拥有 3B 非嵌入参数。它在代码智能体、办公智能体和复杂工具使用任务中表现出强劲性能,同时在数学、编程和科学领域保持高度竞争力的推理能力。Nanbeige4.2-3B 使用 Looped Transformer 在 28T tokens 上从零开始预训练,该结构复用层堆栈以在不增加参数的情况下提升容量。对于 SFT 数据和轨迹构建,我们通过实际部署和大规模合成扩展了可执行环境、任务资产和智能体框架的多样性。我们的 RL 流水线对思考(Think)和非思考(Non-Think)响应应用混合模式 RLHF 以提升整体模型质量并减少失败案例,应用长度控制推理 RL 以平衡准确性和推理效率,以及应用带有结果和过程奖励的智能体 RL 以稳定长程训练。广泛评估表明,Nanbeige4.2-3B 在多个智能体基准测试中优于更大的模型(包括 Qwen3.5-9B 和 Gemma4-12B),同时在推理和对齐任务上保持竞争力。与 OpenClaw 的配合表现进一步支持其作为紧凑型本地个人助理的用途。
查看缓存全文
缓存时间: 2026/07/27 07:42
# Nanbeige4.2-3B: 在小规模模型中解锁智能体能力 来源:https://arxiv.org/html/2607.22083 ![[无题图]](https://arxiv.org/html/2607.22083v1/x1.png) ###### 摘要 我们提出 Nanbeige4.2-3B,一个紧凑的通用智能体模型,拥有 3B 个非嵌入参数。它在代码智能体、办公智能体和复杂工具使用任务中展现出强大的性能,同时在数学、编程和科学领域保持极具竞争力的推理能力。Nanbeige4.2-3B 使用循环 Transformer 从零开始在 28T 个 Token 上预训练,该架构重用层堆栈以在不增加参数的情况下提升容量。对于 SFT 数据和轨迹构建,我们通过实际部署和大规模合成来扩展可执行环境、任务资产和智能体脚手架的多样性。我们的 RL 流程在思考和非思考响应上应用混合模式 RLHF,以提高整体模型质量并减少失败案例;应用长度控制的推理 RL,以平衡准确性和推理效率;并应用结合结果和过程奖励的智能体 RL,以稳定长时程训练。大量评估表明,Nanbeige4.2-3B 在各种智能体基准测试中优于更大的模型,包括 Qwen3.5-9B 和 Gemma4-12B,同时在推理和对齐任务上保持竞争力。与 OpenClaw 配合使用时,其性能进一步支持其作为紧凑型本地个人助理的用途。模型检查点可在https://huggingface.co/Nanbeige/Nanbeige4.2-3B 获取。 参见标题图 1:Nanbeige4.2-3B 与其他开源模型的性能对比。## 1 引言 近期的研究表明,小型语言模型可以在数学推理、竞争性编程和其他可验证任务上取得优异成绩 [Xu 等人 (2026)](https://arxiv.org/html/2607.22083#bib.bib101);[Yang 等人 (2025b)](https://arxiv.org/html/2607.22083#bib.bib52)。其他研究则探讨了针对特定智能体场景(如深度搜索)结合推理和工具使用的紧凑模型 [Yang 等人 (2026a)](https://arxiv.org/html/2607.22083#bib.bib102)。然而,强大的智能体必须在异构环境中运行,操纵代码仓库和办公文档,从失败中恢复,并在长时程轨迹中取得进展。将这些能力整合到一个小型模型中仍然具有挑战性。 现有研究通常通过任务特定的训练来为小型语言模型配备高级智能体能力。由此产生的模型通常专精于单一领域,例如仓库级别的编码或协作任务 [Ivison 等人 (2026)](https://arxiv.org/html/2607.22083#bib.bib108);[Bai 等人 (2026)](https://arxiv.org/html/2607.22083#bib.bib90),而不是作为通用智能体。虽然它们在目标环境中很有效,但它们留下了一个开放性问题:一个紧凑模型是否能在不牺牲通用推理能力的情况下支持多样化的智能体能力。为了研究这个问题,我们提出了 Nanbeige4.2-3B,这是一个旨在最大化通用智能体能力,同时保持强大推理性能的紧凑模型。 Nanbeige4.2-3B 没有采用扩展参数的方式,而是采用了循环 Transformer 架构 [Bae 等人 (2026)](https://arxiv.org/html/2607.22083#bib.bib112)。该架构重用相同的 Transformer 堆栈对隐藏状态进行额外的一轮处理,从而在不引入额外参数的情况下增加有效模型容量。使用这种循环架构从零开始在 28T 个 Token 上进行预训练,配合扩展后的语料库和优化的数据混合,得到了一个强大的基座模型。这为后续的后训练阶段奠定了坚实的基础。 在预训练之后,我们应用监督微调(SFT)来发展广泛的智能体能力。我们首先构建了一个混合环境池,其中包含真实世界环境和大量合成环境。在这些环境中,我们构建了基于执行的轨迹,涵盖仓库级别的软件工程、复杂的工具使用以及以工件为中心的办公任务,并配备了多样化的任务资产和智能体脚手架。然后,我们使用执行信号和基于量规的评估,在轨迹级别和轮次级别过滤轨迹,以在大规模下保持数据质量。 在 SFT 模型的基础上,我们进一步开发了一个多阶段 RL 流程,目标是提高响应质量、推理效率和稳定的智能体学习。我们首先对思考和非思考响应应用两阶段 RLHF,以减轻常见的失败模式,如幻觉、重复生成和指令遵循错误。然后,我们引入长度控制的推理 RL,通过平衡简洁推理和充分探索来提高推理效率。最后,我们执行结合结果和过程奖励的智能体 RL,以提供更密集的信用分配并稳定复杂轨迹上的学习。 由此产生的模型在其规模上展现出广泛的智能体能力概况。Nanbeige4.2-3B 在复杂的工具使用、办公智能体和代码智能体基准测试中取得了强劲的性能,在各种评估中优于明显更大的 Qwen3.5-9B [Qwen 团队 (2026)](https://arxiv.org/html/2607.22083#bib.bib109) 和 Gemma4-12B [团队 等人 (2026)](https://arxiv.org/html/2607.22083#bib.bib110)。它在数学、编程和科学推理以及对齐方面也保持了竞争力。当部署在如 OpenClaw [Steinberger 及贡献者 (2026)](https://arxiv.org/html/2607.22083#bib.bib111) 这样的通用智能体框架中时,它在日常助手、办公工作流和深度研究中表现良好,进一步支持其作为紧凑型本地助手的用途。 据我们所知,Nanbeige4.2-3B 是此规模下第一个开源模型,它展示了代码智能体、办公智能体和复杂工具使用能力的组合,同时保持了强大的通用推理性能。我们开源 Nanbeige4.2-3B 以支持对紧凑型通用智能体的研究,并希望这次发布能鼓励进一步研究如何在严格的参数预算下发展智能体能力。 ## 2 预训练 在本节中,我们首先描述循环 Transformer 架构、循环深度和初始化策略的选择,以及我们对预训练数据配方的更改。然后,我们将预训练的基座模型与可比参数规模的开源模型进行评估。 ### 2.1 架构 为了在固定的参数预算下提高有效深度和推理能力,Nanbeige4.2-3B 采用了循环 Transformer 架构 [Bae 等人 (2026)](https://arxiv.org/html/2607.22083#bib.bib112)。隐藏状态在自下而上地通过 Transformer 层后,会被送入相同的层堆栈进行额外一轮处理。这增加了有效的计算深度和模型容量,而无需引入另一组参数。 **从头训练循环 Transformer。** 获得循环模型的一种方法是先预训练一个标准 Transformer,然后通过上循环 [Zhu 等人 (2025)](https://arxiv.org/html/2607.22083#bib.bib114);[Yang 等人 (2026b)](https://arxiv.org/html/2607.22083#bib.bib113) 将其转换为循环架构。我们将这种方法与从头训练循环架构进行比较。在我们的实验中,从头开始的方法表现明显更好,这表明模型受益于在整个预训练过程中适应重复的层重用,而不是在模型已经训练好之后才引入循环。 **循环深度选择。** 我们研究了通过共享层堆栈的轮次数量。在我们的实验中,两轮配置提供了最有利的权衡:相对于标准 Transformer,它保留了大约 75% 的 Token 效率,并提供了显著的容量增益。增加轮次数量仅带来边际的额外改进,但会显著减慢训练速度,并使优化变得不那么稳定。 **KV 缓存共享与缩放配置。** 为了减少重复计算引入的推理内存开销,我们研究了一种在循环轮次之间共享 KV 缓存的变体。虽然共享配置将 KV 缓存减少了一半,但其性能增益始终低于完整、非共享的循环配置。因此,我们在 Nanbeige4.2-3B 中保留了完整循环,以优先保证模型性能。除了循环配置之外,我们还调整了 Transformer 堆栈的深度和隐藏宽度,在训练和推理期间寻求模型能力与效率之间的平衡。 ### 2.2 数据配方 我们的预训练语料库包含 28T 个 Token,在规模和数数据质量上都超过了 Nanbeige 4.1。我们通过增加数学、代码和合成问答数据的采样权重来进一步优化数据混合,我们发现这对紧凑模型特别有益。我们还将一小部分智能体轨迹数据纳入预训练混合数据中。这种混合数据代表着朝着智能体预训练迈出的第一步。进一步扩展智能体数据的多样性、质量和覆盖范围仍然是未来工作的重要方向。 ### 2.3 预训练评估 我们选择了一组多样化的基准测试,包括面向推理的指标(GSM8K [Cobbe 等人 (2021)](https://arxiv.org/html/2607.22083#bib.bib106),BBH [Suzgun 等人 (2023)](https://arxiv.org/html/2607.22083#bib.bib105) 和 MBPP [Austin 等人 (2021)](https://arxiv.org/html/2607.22083#bib.bib107))和面向知识的指标(MMLU-Pro [Wang 等人 (2024)](https://arxiv.org/html/2607.22083#bib.bib103),SuperGPQA [Du 等人 (2026)](https://arxiv.org/html/2607.22083#bib.bib104) 和 GPQA [Rein 等人 (2023)](https://arxiv.org/html/2607.22083#bib.bib74))。表 1(见 https://arxiv.org/html/2607.22083#S2.T1)将 Nanbeige4.2-3B-Base 与相似参数规模的基座模型进行了比较,包括 Nanbeige4-3B-Base、Qwen3.5-4B-Base 和 Gemma4-E4B-Base。Nanbeige4.2-3B-Base 持续优于 Nanbeige4-3B-Base,并且性能显著优于其他基座模型。结果表明,将循环 Transformer 结构与改进的预训练数据配方相结合是有效的。 表 1:基座模型性能比较。 | 模型 | 规模 | 基准分数 | |---|---|---| | **Model** | **Total** | **Non-emb.** | **GSM8K** | **BBH** | **MBPP** | **MMLU-Pro** | **SuperGPQA** | **GPQA** | | Gemma4-E4B | 8B | 4B | 61.8 | 62.5 | 53.5 | 37.6 | 23.3 | 27.5 | | Qwen3.5-4B | 5B | 4B | 84.4 | 79.1 | 57.1 | 51.8 | 32.1 | 43.1 | | Nanbeige4-3B | 4B | 3B | 85.9 | 70.7 | 60.7 | 47.6 | 24.8 | 36.2 | | Nanbeige4.2-3B | 4B | 3B | 92.7 | 81.6 | 67.6 | 63.8 | 35.2 | 53.3 | ## 3 后训练 在本节中,我们介绍用于发展 Nanbeige4.2-3B 推理和智能体能力的后训练流程。该流程将可扩展的 SFT 数据和轨迹构建与多阶段 RL 配方相结合,旨在提高响应质量、推理效率和长时程智能体行为。然后,我们在通用和智能体基准测试以及本地个人助手场景中评估生成的模型。 ### 3.1 数据 我们整理和合成了一个大规模、多领域的后训练语料库,涵盖智能体软件工程、复杂工具使用和智能体协作。通过系统地扩展其任务多样性和难度边界,我们旨在将紧凑模型推向性能上限,并探索可通过高质量、可扩展的监督解锁的能力极限。 #### 3.1.1 智能体软件工程:从仓库到轨迹的合成。 参见标题图 2:智能体软件工程数据合成流程。 与单轮代码生成不同,真实世界的智能体编码要求模型导航复杂的仓库,从模糊的规范中推断意图,定位缺陷路径,应用协调的多文件补丁,并通过闭环执行验证正确性。为了大规模构建高质量的轨迹监督,我们建立了一个仓库级数据合成流程。该系统将历史上的 GitHub 开发活动转化为由自动化环境支持的可执行任务,同时利用模型失败的反馈来协同演进任务分布和智能体能力。由此产生的从仓库到任务的数据合成过程如图 2 所示(见 https://arxiv.org/html/2607.22083#S3.F2)。 **能力引导的代码仓库收集。** 为了确保我们数据的多样性和规模,我们首先收集跨编程语言、项目规模和应用领域的代码仓库,并从中构建具有可执行验证的范围明确的软件工程任务。为了进一步识别最有可能提高模型能力的仓库,我们在少量种子训练任务上运行模型,分析和分类其失败模式,并使用由此产生的能力差距来指导仓库和补丁的选择。这个过程保持了仓库和问题设置的多样性,同时改进了对模型表现出系统性弱点的能力领域的覆盖。 **可执行环境重建与任务合成。** 一旦准备好仓库并选择了补丁,我们通过分析仓库元数据、依赖项规范和测试基础设施来重建执行环境。然后,我们在隔离的沙箱中从父提交构建一个自包含的容器镜像。任务基于选定的补丁进行合成,而补丁本身和特定任务的评分测试则对暴露给智能体的仓库隐藏。隐藏测试仅在评估期间注入。 **验证与闭环任务演进。** 在轨迹合成之前,我们使用从原始源码和测试变更中构建的可执行验证器来验证每个任务。失败到通过的测试确认目标行为在基座仓库中不存在并由参考补丁恢复,而通过到通过的测试则保护现有功能免受回归。我们还审计任务描述、隐藏测试和参考补丁是否表达了一致的行为契约,修复可恢复的任务,并丢弃损坏的、不稳定或未充分定义的任务。在常规推理和训练期间,重复出现的模型失败会被自动收集并转化为后续仓库挖掘的结构化搜索线索。这种闭环机制扩展了任务空间,以系统地集中在模型自身演化过程中检测到的弱点上。 **跨不同脚手架的轨迹合成。** 为了防止模型过度拟合特定的提示模板或工具使用惯例,我们在容器化沙箱中部署了多个异构的智能体脚手架,包括 Claude Code、OpenHands、SWE-agent 和专门的基于 Codex 的驱动程序。给定相同的仓库状态和失败到通过的验证任务,每个智能体并行独立探索和解决问题。它们不同的系统提示、上下文压缩策略和编辑接口引发了多样化的解决策略(例如,广泛的探索性搜索与局部的精确定位编辑)。聚合这些互补的轨迹产生了一个训练语料库,它强调脚手架不变的推理和修复策略,而不是特定于脚手架的交互模式,从而提高对未见过的智能体接口和工具模式的泛化能力。 ##### 基于执行的轮次级过滤。 为了确保数据质量,我们只保留那些结果补丁通过了指定目标和回归测试的轨迹。我们进一步对不正确的工具调用、非终止循环、冗余操作和上下文截断进行轮次级过滤,优先
相似文章
Nanbeige/Nanbeige4.2-3B
Nanbeige4.2-3B 是一款紧凑型智能体模型,采用循环Transformer架构,在3B规模下展现出强大的智能体任务和推理基准性能,超越了Qwen3.5-9B和Gemma4-12B等更大规模的模型。
两种不同规模的智能体AI:Nanbeige4.2-3B与Laguna S2.1(9分钟阅读)
比较了两个用于智能体工作负载的新AI模型:采用循环Transformer架构的紧凑型Nanbeige4.2-3B,以及大型混合专家模型Laguna S2.1,两者均在Hugging Face上发布。
新模型:Nanbeige4.2-3B(Looped Transformer,性能超越4倍规模模型)
Nanbeige4.2-3B是一个新的3B参数AI模型,采用Looped Transformer架构,性能超越其4倍规模的模型。
@LottoLabs: 这里有一个有趣的模型,35b a3b 专为智能体使用而训练。它在 Terminal Bench2 上获得 60.7 分,而 qwen 3.6 27b 得分为 59.3。关键……
Nex-AGI 发布了 Nex-N2,一个开源的智能体模型系列 (Nex-N2-Pro 和 Nex-N2-mini),采用 Agentic Thinking 框架,统一了推理、工具使用和环境执行,在智能体和编码基准测试中达到顶级性能。
Agents-A1-4B (Qwen3.7-4B ???):扩展能力而非参数规模
Agents-A1-4B是InternScience推出的一款紧凑型4B参数模型,在多项智能体和推理基准测试中取得了最先进的结果,通过扩展能力而非参数规模超越了更大模型。