Nanbeige/Nanbeige4.2-3B
摘要
Nanbeige4.2-3B 是一款紧凑型智能体模型,采用循环Transformer架构,在3B规模下展现出强大的智能体任务和推理基准性能,超越了Qwen3.5-9B和Gemma4-12B等更大规模的模型。
查看缓存全文
缓存时间: 2026/07/22 02:16
Nanbeige/Nanbeige4.2-3B · Hugging Face 来源:https://huggingface.co/Nanbeige/Nanbeige4.2-3B Nanbeige 标志 ## https://huggingface.co/Nanbeige/Nanbeige4.2-3B#1-introduction 1. 简介 Nanbeige4.2-3B 是一款基于 Nanbeige4.2-3B-Base (https://huggingface.co/Nanbeige/Nanbeige4.2-3B-Base) 构建的轻量级智能体模型,旨在将强大的智能体行为与广泛的推理和对齐能力相结合。其循环 Transformer 架构通过复用 Transformer 层来增加模型容量,而不增加参数量。该模型仅拥有 3B 非嵌入参数,在通用智能体和代码智能体任务上表现出色。在监督微调 (SFT) 阶段,我们通过真实世界环境集成和大规模环境合成,扩展了训练环境的多样性。我们进一步多样化任务类型、任务资产以及每个任务所使用的智能体框架。为确保训练数据质量,我们在轨迹和轮次两个层面进行过滤,结合基于测试用例的验证和基于评分标准的评估。在强化学习 (RL) 阶段,我们结合结果奖励和过程奖励,以提升轻量模型的训练稳定性。 主要优势包括: - 3B 规模下的稳健智能体行为:在复杂的工具使用、办公智能体和代码智能体基准测试中,Nanbeige4.2-3B 优于更大的模型,如 Qwen3.5-9B 和 Gemma4-12B。 - 强大的推理能力:Nanbeige4.2-3B 在数学、编程和科学推理任务中领先于同等规模的开源模型,延续了 Nanbeige4.1-3B (https://huggingface.co/Nanbeige/Nanbeige4.1-3B) 的强劲推理性能。 - 本地个人助理:当与专为个人工作流设计的智能体框架(如 OpenClaw)集成时,Nanbeige4.2-3B 可支持涵盖日常助手、办公工作和深度研究的扩展任务。 > 附带的 modeling_nanbeige.py 还包含我们最新的架构改进,包括 LoopSplit、mHC with depth attention 和 concatenated n-gram embeddings。这些特性已被纳入 Nanbeige4.5,其训练正在进行中,预计于 2026 年晚些发布。 ## https://huggingface.co/Nanbeige/Nanbeige4.2-3B#2-model-performance 2. 模型性能 ## https://huggingface.co/Nanbeige/Nanbeige4.2-3B#general-and-agentic-capabilities 通用与智能体能力 我们在涵盖通用智能体、代码智能体、推理和对齐能力的多样化基准套件上,将 Nanbeige4.2-3B 与 Qwen3.5 和 Gemma4 模型进行比较。 | | Nanbeige4.2-3B¹ | Qwen3.5-9B | Qwen3.5-4B | Gemma4-12B | Gemma4-E4B |
|—|—|—|—|—|—| | 参数 | | | | | | | 总参数量 | 4B | 10B | 5B | 12B | 8B | | 非嵌入参数量 | 3B | 8B | 4B | 10B | 4B | | 通用智能体² | | | | | | | GDPval rubrics | 74.3 | 61.9 | 46.7 | 68.5 | 31.5 | | Agent-IF-Oneday | 67.5 | 60.4 | 56.9 | — | — | | Office-QA-Pro³ | 21.1 | 15.8 | 8.3 | 15.3 | 3.1 | | Pinch-Bench-V2 | 74.7 | 68.2 | 63.9 | 53.8 | 33.3 | | Claw-Gym | 65.0 | 56.1 | 53.0 | 40.8 | 16.4 | | Claw-Eval | 52.2 | 47.1 | 36.9 | 25.5 | 15.9 | | MCP-Atlas | 57.8 | 47.4 | 40.8 | 30.5 | 15.0 | | 代码智能体⁴ | | | | | | | SWE-Bench Verified | 63.6 | 53.1 | 38.8 | 44.2 | 14.0 | | SWE-Bench Pro | 46.9 | 33.8 | 29.4 | 21.9 | 4.0 | | Terminal-Bench 2.0 | 44.1 | 29.2 | 25.8 | 21.1 | 12.4 | | 推理 | | | | | | | HLE w/o Search | 17.8 | 12.5 | 6.8 | 14.8 | 4.0 | | SciCode | 35.6 | 32.7 | 22.7 | 38.2 | 24.9 | | GPQA-Diamond | 87.4 | 81.7 | 78.2 | 78.8 | 60.6 | | HMMT-Feb-2026 | 82.8 | 69.6 | 60.6 | 51.5 | 24.2 | | IMO-Answer-Bench | 67.3 | 56.3 | 46.8 | 54.5 | 24.0 | | LiveCodeBench-V6 | 72.5 | 65.6 | 55.8 | 72.0 | 55.3 | | 对齐 | | | | | | | AA-LCR | 58.7 | 58.0 | 52.0 | 55.3 | 30.7 | | IF-Bench | 54.6 | 54.1 | 41.4 | 73.5 | 44.0 | | Recruit-Bench⁵ | 63.3 | 59.0 | 40.7 | 69.4 | 57.9 |
¹ 所有评估均在思考模式下进行,聊天模板中 preserve_thinking=true。
² 办公及协作任务(如 GDPval、Office-QA-Pro、Agent-IF-Oneday)使用我们内部框架进行评估。
³ 对于 OfficeQA-pro,我们采用最具挑战性的评估设置:针对每个问题,提供所有原始 PDF 材料,但不给出相关文档的提示。
⁴ SWE-Bench Verified 使用 OpenHands 框架,SWE-Bench Pro 使用 SWE-agent 框架,Terminal-Bench 2.0 使用 Terminus 2 框架。
⁵ Recruit-Bench 是我们的内部基准,涵盖企业招聘场景 (B2C) 和候选人求职场景 (C2B)。
结果表明,Nanbeige4.2-3B 在远超其参数量级的规模上表现出强劲性能。仅凭 3B 非嵌入参数,它在通用智能体、代码智能体和推理基准上持续优于更大的模型(包括 Qwen3.5-9B 和 Gemma4-12B),同时在对齐任务上保持竞争力。
https://huggingface.co/Nanbeige/Nanbeige4.2-3B#local-personal-assistant 本地个人助理
凭借仅 3B 的非嵌入参数,Nanbeige4.2-3B 足够紧凑,可在本地部署,同时保留多步骤工作流所需的智能体能力,使其成为本地个人助理应用的自然选择。为了在实用且一致的智能体环境中评估此用例,我们使用 OpenClaw(一个支持日常助手、办公工作流和深度研究任务的通用框架)。所有比较模型使用相同的框架,并在需要与工具和外部资源进行多步骤交互的任务上进行评估。
| 能力 | 基准 | Nanbeige4.2-3B | Qwen3.5-9B | Qwen3.5-4B |
|---|---|---|---|---|
| 日常任务 | Pinch-Bench-V2 | 74.7 | 68.2 | 63.9 |
| Claw-Gym | 65.0 | 56.1 | 53.0 | |
| 办公任务 | GDPval | 68.8 | 38.0 | 37.0 |
| Agent-IF-Oneday | 58.9 | 32.1 | 27.0 | |
| 深度研究 | DeepResearch Bench II | 33.4 | 28.3 | 26.0 |
| ResearchRubrics | 44.8 | 37.2 | 35.1 |
在所有六个基准上,Nanbeige4.2-3B 的表现均优于 Qwen3.5-4B 和更大的 Qwen3.5-9B。这些结果支持其作为紧凑型本地个人助理的用途。
https://huggingface.co/Nanbeige/Nanbeige4.2-3B#3-quickstart 3. 快速开始
分词器提供了一个可配置的聊天模板,用于推理和工具使用场景:
enable_thinking控制模型是否为当前响应生成推理。默认启用;设置为False可进入非思考模式。preserve_thinking控制是否在多轮对话中保留之前助手轮次的推理。对于常规聊天和问答,建议设为False;对于多轮工具使用、办公任务和代码智能体工作流,建议设为True。- 传递
tools可启用工具使用模板。建议使用tool_call_format="xml"以获得最佳工具调用性能;也支持json以实现兼容性。
我们建议根据目标场景调整推理设置:
| 场景 | 温度 | 最大新 Token 数 |
|---|---|---|
| 智能体和工具使用任务 | 1.0 | 65,536 |
| 推理和聊天任务 | 0.6 | 131,072 |
https://huggingface.co/Nanbeige/Nanbeige4.2-3B#huggingface Huggingface
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "Nanbeige/Nanbeige4.2-3B"
tokenizer = AutoTokenizer.from_pretrained(
model_id,
use_fast=False,
trust_remote_code=True
)
model = AutoModelForCausalLM.from_pretrained(
model_id,
torch_dtype="auto",
device_map="auto",
trust_remote_code=True
)
messages = [
{"role": "user", "content": "Which number is bigger, 9.11 or 9.8?"}
]
prompt = tokenizer.apply_chat_template(
messages,
add_generation_prompt=True,
tokenize=False
)
input_ids = tokenizer(
prompt,
add_special_tokens=False,
return_tensors="pt"
).input_ids
output_ids = model.generate(
input_ids.to("cuda"),
max_new_tokens=131072,
temperature=0.6,
top_p=0.95,
top_k=20,
eos_token_id=166101
)
response = tokenizer.decode(
output_ids[0][len(input_ids[0]):],
skip_special_tokens=True
)
print(response)
https://huggingface.co/Nanbeige/Nanbeige4.2-3B#sglang SGLang
https://huggingface.co/Nanbeige/Nanbeige4.2-3B#installation 安装
# 克隆仓库
git clone -b nanbeige42 https://github.com/Nanbeige/sglang.git
cd sglang
pip install -e "python"
https://huggingface.co/Nanbeige/Nanbeige4.2-3B#usage 使用
MODEL_PATH=/path/to/your/Nanbeige4.2-3B
python -m sglang.launch_server \
--model-path ${MODEL_PATH} \
--host 0.0.0.0 \
--port 8000 \
--tp-size 1 \
--mem-fraction-static 0.8 \
--reasoning-parser nanbeige \
--tool-call-parser nanbeige
https://huggingface.co/Nanbeige/Nanbeige4.2-3B#vllm vLLM
https://huggingface.co/Nanbeige/Nanbeige4.2-3B#installation-1 安装
# 克隆仓库
git clone -b nanbeige42 https://github.com/Nanbeige/vllm.git
cd vllm
pip install -e .
https://huggingface.co/Nanbeige/Nanbeige4.2-3B#usage-1 使用
MODEL_PATH=/path/to/your/Nanbeige4.2-3B
vllm serve ${MODEL_PATH} \
--host 0.0.0.0 \
--port 8000 \
--tensor-parallel-size 1 \
--gpu-memory-utilization 0.8 \
--enable-auto-tool-choice \
--tool-call-parser nanbeige \
--reasoning-parser nanbeige
https://huggingface.co/Nanbeige/Nanbeige4.2-3B#llamacpp llama.cpp
https://huggingface.co/Nanbeige/Nanbeige4.2-3B#installation-2 安装
# 克隆仓库
git clone -b nanbeige42 https://github.com/Nanbeige/llama.cpp.git
cd llama.cpp
cmake -B build -DGGML_CUDA=ON
cmake --build build --config Release -j
https://huggingface.co/Nanbeige/Nanbeige4.2-3B#usage-2 使用
# 输入:HuggingFace 模型目录
MODEL_PATH_HF=/path/to/your/Nanbeige4.2-3B
# 输出:转换/量化后的 GGUF
MODEL_PATH_BF16_GGUF=/path/to/your/Nanbeige4.2-3B-BF16.gguf
MODEL_PATH_GGUF_Q4_K_M=/path/to/your/Nanbeige4.2-3B-Q4_K_M.gguf
# 转换为 gguf
python3 convert_hf_to_gguf.py ${MODEL_PATH_HF} \
--outfile ${MODEL_PATH_BF16_GGUF} \
--outtype bf16
# 量化为 int4
./build/bin/llama-quantize \
${MODEL_PATH_BF16_GGUF} \
${MODEL_PATH_GGUF_Q4_K_M} \
Q4_K_M
# 运行推理
./build/bin/llama-cli \
-m ${MODEL_PATH_GGUF_Q4_K_M} \
-ngl 99
https://huggingface.co/Nanbeige/Nanbeige4.2-3B#ollama ollama
https://huggingface.co/Nanbeige/Nanbeige4.2-3B#requirements 要求
- Go
- llama.cpp(参见上方 llama.cpp (https://huggingface.co/Nanbeige/Nanbeige4.2-3B#llamacpp) 部分)
https://huggingface.co/Nanbeige/Nanbeige4.2-3B#installation-3 安装
# 克隆仓库
# 如果仅使用 llama-server (GGUF) 后端,官方 ollama 仓库也可用:
# git clone https://github.com/ollama/ollama.git
git clone -b nanbeige42 https://github.com/Nanbeige/ollama.git
cd ollama
# 完整原生构建(macOS arm64 上包含 MLX Metal;包含 llama-server 负载)
# 选择一种:
cmake -B build .
cmake --build build --parallel $(sysctl -n hw.ncpu) # macOS
# cmake --build build --parallel $(nproc) # Linux
# 将上方 llama.cpp 构建输出复制到 Ollama 运行时负载目录
LLAMA_CPP_PATH=/path/to/your/llama.cpp
cp -r ${LLAMA_CPP_PATH}/build/bin/* build/lib/ollama/
go build .
Ollama 支持两种本地推理后端:
| 路径 | 模型格式 | 后端 | 典型用途 |
|---|---|---|---|
| llama-server | GGUF | llama.cpp (Metal / CUDA / …) | 传统 GGUF 量化部署 |
| MLX | HuggingFace safetensors | MLX (Apple Metal 等) | 直接运行 BF16 或量化 safetensors |
https://huggingface.co/Nanbeige/Nanbeige4.2-3B#usage–llama-server-gguf 使用 — llama-server (GGUF)
# 选项 1:拉取已发布模型(客户端无需 Modelfile)
./ollama serve
./ollama run nanbeige/nanbeige4.2:3b-Q4_K_M
# 选项 2:从 llama.cpp 生成的本地 .gguf 创建模型
# (参见上方的 convert_hf_to_gguf.py / llama-quantize)
MODEL_PATH_GGUF_Q4_K_M=/path/to/your/Nanbeige4.2-3B-Q4_K_M.gguf
# Modelfile
cat > Modelfile <<EOF
FROM ${MODEL_PATH_GGUF_Q4_K_M}
TEMPLATE "{{ .Prompt }}"
EOF
# 创建并运行
./ollama create nanbeige4.2:3b-Q4_K_M -f Modelfile
./ollama run nanbeige4.2:3b-Q4_K_M
https://huggingface.co/Nanbeige/Nanbeige4.2-3B#usage–mlx-safetensors 使用 — MLX (safetensors)
# 选项 1:拉取官方 safetensors 模型(无需 Modelfile)
./ollama serve
./ollama run nanbeige/nanbeige4.2:3b-BF16
# 选项 2:从本地 HuggingFace 目录创建
MODEL_PATH_HF=/path/to/your/Nanbeige4.2-3B
# Modelfile
cat > Modelfile <<EOF
FROM ${MODEL_PATH_HF}
EOF
./ollama create nanbeige4.2:3b-BF16 -f Modelfile
./ollama run nanbeige4.2:3b-BF16
相似文章
Nanbeige4.2-3B:在紧凑模式下释放智能体能力
Nanbeige4.2-3B 是一个紧凑的 3B 参数通用智能体模型,采用 Looped Transformer 从零开始预训练,在智能体和推理任务上表现出色,在多个基准测试中超越了更大的模型。该模型和代码均已开源。
新模型:Nanbeige4.2-3B(Looped Transformer,性能超越4倍规模模型)
Nanbeige4.2-3B是一个新的3B参数AI模型,采用Looped Transformer架构,性能超越其4倍规模的模型。
@ModelScope2022: Nanbeige4.2 @nanbeige 登陆 ModelScope,提供两个模型:- 28T-token Looped Transformer 基座 - 3B SFT+RL 智能体,用于…
Nanbeige4.2 已在 ModelScope 上发布,包含两个模型:一个 28T-token Looped Transformer 基座和一个 3B SFT+RL 智能体,据称在智能体基准测试中优于 Qwen3.5-9B 和 Gemma4-12B。
@xdotli: ICYMI Nanbeige 4.1,一个由中国Indeed发布的3B模型,性能优于Qwen3-30b-A3b + Qwen 3.5 4b。它可以完成长…
Nanbeige 4.1,一个来自中国Indeed的3B模型,在需要600+工具调用的任务上性能优于更大的Qwen模型。
两种不同规模的智能体AI:Nanbeige4.2-3B与Laguna S2.1(9分钟阅读)
比较了两个用于智能体工作负载的新AI模型:采用循环Transformer架构的紧凑型Nanbeige4.2-3B,以及大型混合专家模型Laguna S2.1,两者均在Hugging Face上发布。