Nanbeige/Nanbeige4.2-3B

Hugging Face Models Trending 模型

摘要

Nanbeige4.2-3B 是一款紧凑型智能体模型,采用循环Transformer架构,在3B规模下展现出强大的智能体任务和推理基准性能,超越了Qwen3.5-9B和Gemma4-12B等更大规模的模型。

任务:文本生成 标签:transformers, safetensors, nanbeige, text-generation, llm, conversational, custom_code, en, zh, base_model:Nanbeige/Nanbeige4.2-3B-Base, base_model:finetune:Nanbeige/Nanbeige4.2-3B-Base, license:apache-2.0, region:us
查看原文
查看缓存全文

缓存时间: 2026/07/22 02:16

Nanbeige/Nanbeige4.2-3B · Hugging Face 来源:https://huggingface.co/Nanbeige/Nanbeige4.2-3B Nanbeige 标志 ## https://huggingface.co/Nanbeige/Nanbeige4.2-3B#1-introduction 1. 简介 Nanbeige4.2-3B 是一款基于 Nanbeige4.2-3B-Base (https://huggingface.co/Nanbeige/Nanbeige4.2-3B-Base) 构建的轻量级智能体模型,旨在将强大的智能体行为与广泛的推理和对齐能力相结合。其循环 Transformer 架构通过复用 Transformer 层来增加模型容量,而不增加参数量。该模型仅拥有 3B 非嵌入参数,在通用智能体和代码智能体任务上表现出色。在监督微调 (SFT) 阶段,我们通过真实世界环境集成和大规模环境合成,扩展了训练环境的多样性。我们进一步多样化任务类型、任务资产以及每个任务所使用的智能体框架。为确保训练数据质量,我们在轨迹和轮次两个层面进行过滤,结合基于测试用例的验证和基于评分标准的评估。在强化学习 (RL) 阶段,我们结合结果奖励和过程奖励,以提升轻量模型的训练稳定性。 主要优势包括: - 3B 规模下的稳健智能体行为:在复杂的工具使用、办公智能体和代码智能体基准测试中,Nanbeige4.2-3B 优于更大的模型,如 Qwen3.5-9B 和 Gemma4-12B。 - 强大的推理能力:Nanbeige4.2-3B 在数学、编程和科学推理任务中领先于同等规模的开源模型,延续了 Nanbeige4.1-3B (https://huggingface.co/Nanbeige/Nanbeige4.1-3B) 的强劲推理性能。 - 本地个人助理:当与专为个人工作流设计的智能体框架(如 OpenClaw)集成时,Nanbeige4.2-3B 可支持涵盖日常助手、办公工作和深度研究的扩展任务。 > 附带的 modeling_nanbeige.py 还包含我们最新的架构改进,包括 LoopSplitmHC with depth attentionconcatenated n-gram embeddings。这些特性已被纳入 Nanbeige4.5,其训练正在进行中,预计于 2026 年晚些发布。 ## https://huggingface.co/Nanbeige/Nanbeige4.2-3B#2-model-performance 2. 模型性能 ## https://huggingface.co/Nanbeige/Nanbeige4.2-3B#general-and-agentic-capabilities 通用与智能体能力 我们在涵盖通用智能体、代码智能体、推理和对齐能力的多样化基准套件上,将 Nanbeige4.2-3B 与 Qwen3.5 和 Gemma4 模型进行比较。 | | Nanbeige4.2-3B¹ | Qwen3.5-9B | Qwen3.5-4B | Gemma4-12B | Gemma4-E4B |

|—|—|—|—|—|—| | 参数 | | | | | | | 总参数量 | 4B | 10B | 5B | 12B | 8B | | 非嵌入参数量 | 3B | 8B | 4B | 10B | 4B | | 通用智能体² | | | | | | | GDPval rubrics | 74.3 | 61.9 | 46.7 | 68.5 | 31.5 | | Agent-IF-Oneday | 67.5 | 60.4 | 56.9 | — | — | | Office-QA-Pro³ | 21.1 | 15.8 | 8.3 | 15.3 | 3.1 | | Pinch-Bench-V2 | 74.7 | 68.2 | 63.9 | 53.8 | 33.3 | | Claw-Gym | 65.0 | 56.1 | 53.0 | 40.8 | 16.4 | | Claw-Eval | 52.2 | 47.1 | 36.9 | 25.5 | 15.9 | | MCP-Atlas | 57.8 | 47.4 | 40.8 | 30.5 | 15.0 | | 代码智能体⁴ | | | | | | | SWE-Bench Verified | 63.6 | 53.1 | 38.8 | 44.2 | 14.0 | | SWE-Bench Pro | 46.9 | 33.8 | 29.4 | 21.9 | 4.0 | | Terminal-Bench 2.0 | 44.1 | 29.2 | 25.8 | 21.1 | 12.4 | | 推理 | | | | | | | HLE w/o Search | 17.8 | 12.5 | 6.8 | 14.8 | 4.0 | | SciCode | 35.6 | 32.7 | 22.7 | 38.2 | 24.9 | | GPQA-Diamond | 87.4 | 81.7 | 78.2 | 78.8 | 60.6 | | HMMT-Feb-2026 | 82.8 | 69.6 | 60.6 | 51.5 | 24.2 | | IMO-Answer-Bench | 67.3 | 56.3 | 46.8 | 54.5 | 24.0 | | LiveCodeBench-V6 | 72.5 | 65.6 | 55.8 | 72.0 | 55.3 | | 对齐 | | | | | | | AA-LCR | 58.7 | 58.0 | 52.0 | 55.3 | 30.7 | | IF-Bench | 54.6 | 54.1 | 41.4 | 73.5 | 44.0 | | Recruit-Bench⁵ | 63.3 | 59.0 | 40.7 | 69.4 | 57.9 |

¹ 所有评估均在思考模式下进行,聊天模板中 preserve_thinking=true
² 办公及协作任务(如 GDPval、Office-QA-Pro、Agent-IF-Oneday)使用我们内部框架进行评估。
³ 对于 OfficeQA-pro,我们采用最具挑战性的评估设置:针对每个问题,提供所有原始 PDF 材料,但不给出相关文档的提示。
⁴ SWE-Bench Verified 使用 OpenHands 框架,SWE-Bench Pro 使用 SWE-agent 框架,Terminal-Bench 2.0 使用 Terminus 2 框架。
⁵ Recruit-Bench 是我们的内部基准,涵盖企业招聘场景 (B2C) 和候选人求职场景 (C2B)。

结果表明,Nanbeige4.2-3B 在远超其参数量级的规模上表现出强劲性能。仅凭 3B 非嵌入参数,它在通用智能体、代码智能体和推理基准上持续优于更大的模型(包括 Qwen3.5-9B 和 Gemma4-12B),同时在对齐任务上保持竞争力。

https://huggingface.co/Nanbeige/Nanbeige4.2-3B#local-personal-assistant 本地个人助理

凭借仅 3B 的非嵌入参数,Nanbeige4.2-3B 足够紧凑,可在本地部署,同时保留多步骤工作流所需的智能体能力,使其成为本地个人助理应用的自然选择。为了在实用且一致的智能体环境中评估此用例,我们使用 OpenClaw(一个支持日常助手、办公工作流和深度研究任务的通用框架)。所有比较模型使用相同的框架,并在需要与工具和外部资源进行多步骤交互的任务上进行评估。

能力基准Nanbeige4.2-3BQwen3.5-9BQwen3.5-4B
日常任务Pinch-Bench-V274.768.263.9
Claw-Gym65.056.153.0
办公任务GDPval68.838.037.0
Agent-IF-Oneday58.932.127.0
深度研究DeepResearch Bench II33.428.326.0
ResearchRubrics44.837.235.1

在所有六个基准上,Nanbeige4.2-3B 的表现均优于 Qwen3.5-4B 和更大的 Qwen3.5-9B。这些结果支持其作为紧凑型本地个人助理的用途。

https://huggingface.co/Nanbeige/Nanbeige4.2-3B#3-quickstart 3. 快速开始

分词器提供了一个可配置的聊天模板,用于推理和工具使用场景:

  • enable_thinking 控制模型是否为当前响应生成推理。默认启用;设置为 False 可进入非思考模式。
  • preserve_thinking 控制是否在多轮对话中保留之前助手轮次的推理。对于常规聊天和问答,建议设为 False;对于多轮工具使用、办公任务和代码智能体工作流,建议设为 True
  • 传递 tools 可启用工具使用模板。建议使用 tool_call_format="xml" 以获得最佳工具调用性能;也支持 json 以实现兼容性。

我们建议根据目标场景调整推理设置:

场景温度最大新 Token 数
智能体和工具使用任务1.065,536
推理和聊天任务0.6131,072

https://huggingface.co/Nanbeige/Nanbeige4.2-3B#huggingface Huggingface

from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "Nanbeige/Nanbeige4.2-3B"
tokenizer = AutoTokenizer.from_pretrained(
    model_id,
    use_fast=False,
    trust_remote_code=True
)
model = AutoModelForCausalLM.from_pretrained(
    model_id,
    torch_dtype="auto",
    device_map="auto",
    trust_remote_code=True
)

messages = [
    {"role": "user", "content": "Which number is bigger, 9.11 or 9.8?"}
]
prompt = tokenizer.apply_chat_template(
    messages,
    add_generation_prompt=True,
    tokenize=False
)
input_ids = tokenizer(
    prompt,
    add_special_tokens=False,
    return_tensors="pt"
).input_ids
output_ids = model.generate(
    input_ids.to("cuda"),
    max_new_tokens=131072,
    temperature=0.6,
    top_p=0.95,
    top_k=20,
    eos_token_id=166101
)
response = tokenizer.decode(
    output_ids[0][len(input_ids[0]):],
    skip_special_tokens=True
)
print(response)

https://huggingface.co/Nanbeige/Nanbeige4.2-3B#sglang SGLang

https://huggingface.co/Nanbeige/Nanbeige4.2-3B#installation 安装

# 克隆仓库
git clone -b nanbeige42 https://github.com/Nanbeige/sglang.git
cd sglang
pip install -e "python"

https://huggingface.co/Nanbeige/Nanbeige4.2-3B#usage 使用

MODEL_PATH=/path/to/your/Nanbeige4.2-3B
python -m sglang.launch_server \
    --model-path ${MODEL_PATH} \
    --host 0.0.0.0 \
    --port 8000 \
    --tp-size 1 \
    --mem-fraction-static 0.8 \
    --reasoning-parser nanbeige \
    --tool-call-parser nanbeige

https://huggingface.co/Nanbeige/Nanbeige4.2-3B#vllm vLLM

https://huggingface.co/Nanbeige/Nanbeige4.2-3B#installation-1 安装

# 克隆仓库
git clone -b nanbeige42 https://github.com/Nanbeige/vllm.git
cd vllm
pip install -e .

https://huggingface.co/Nanbeige/Nanbeige4.2-3B#usage-1 使用

MODEL_PATH=/path/to/your/Nanbeige4.2-3B
vllm serve ${MODEL_PATH} \
    --host 0.0.0.0 \
    --port 8000 \
    --tensor-parallel-size 1 \
    --gpu-memory-utilization 0.8 \
    --enable-auto-tool-choice \
    --tool-call-parser nanbeige \
    --reasoning-parser nanbeige

https://huggingface.co/Nanbeige/Nanbeige4.2-3B#llamacpp llama.cpp

https://huggingface.co/Nanbeige/Nanbeige4.2-3B#installation-2 安装

# 克隆仓库
git clone -b nanbeige42 https://github.com/Nanbeige/llama.cpp.git
cd llama.cpp
cmake -B build -DGGML_CUDA=ON
cmake --build build --config Release -j

https://huggingface.co/Nanbeige/Nanbeige4.2-3B#usage-2 使用

# 输入:HuggingFace 模型目录
MODEL_PATH_HF=/path/to/your/Nanbeige4.2-3B
# 输出:转换/量化后的 GGUF
MODEL_PATH_BF16_GGUF=/path/to/your/Nanbeige4.2-3B-BF16.gguf
MODEL_PATH_GGUF_Q4_K_M=/path/to/your/Nanbeige4.2-3B-Q4_K_M.gguf

# 转换为 gguf
python3 convert_hf_to_gguf.py ${MODEL_PATH_HF} \
    --outfile ${MODEL_PATH_BF16_GGUF} \
    --outtype bf16

# 量化为 int4
./build/bin/llama-quantize \
    ${MODEL_PATH_BF16_GGUF} \
    ${MODEL_PATH_GGUF_Q4_K_M} \
    Q4_K_M

# 运行推理
./build/bin/llama-cli \
    -m ${MODEL_PATH_GGUF_Q4_K_M} \
    -ngl 99

https://huggingface.co/Nanbeige/Nanbeige4.2-3B#ollama ollama

https://huggingface.co/Nanbeige/Nanbeige4.2-3B#requirements 要求

  • Go
  • llama.cpp(参见上方 llama.cpp (https://huggingface.co/Nanbeige/Nanbeige4.2-3B#llamacpp) 部分)

https://huggingface.co/Nanbeige/Nanbeige4.2-3B#installation-3 安装

# 克隆仓库
# 如果仅使用 llama-server (GGUF) 后端,官方 ollama 仓库也可用:
# git clone https://github.com/ollama/ollama.git
git clone -b nanbeige42 https://github.com/Nanbeige/ollama.git
cd ollama

# 完整原生构建(macOS arm64 上包含 MLX Metal;包含 llama-server 负载)
# 选择一种:
cmake -B build .
cmake --build build --parallel $(sysctl -n hw.ncpu)  # macOS
# cmake --build build --parallel $(nproc)  # Linux

# 将上方 llama.cpp 构建输出复制到 Ollama 运行时负载目录
LLAMA_CPP_PATH=/path/to/your/llama.cpp
cp -r ${LLAMA_CPP_PATH}/build/bin/* build/lib/ollama/
go build .

Ollama 支持两种本地推理后端:

路径模型格式后端典型用途
llama-serverGGUFllama.cpp (Metal / CUDA / …)传统 GGUF 量化部署
MLXHuggingFace safetensorsMLX (Apple Metal 等)直接运行 BF16 或量化 safetensors

https://huggingface.co/Nanbeige/Nanbeige4.2-3B#usage–llama-server-gguf 使用 — llama-server (GGUF)

# 选项 1:拉取已发布模型(客户端无需 Modelfile)
./ollama serve
./ollama run nanbeige/nanbeige4.2:3b-Q4_K_M
# 选项 2:从 llama.cpp 生成的本地 .gguf 创建模型
# (参见上方的 convert_hf_to_gguf.py / llama-quantize)
MODEL_PATH_GGUF_Q4_K_M=/path/to/your/Nanbeige4.2-3B-Q4_K_M.gguf

# Modelfile
cat > Modelfile <<EOF
FROM ${MODEL_PATH_GGUF_Q4_K_M}
TEMPLATE "{{ .Prompt }}"
EOF

# 创建并运行
./ollama create nanbeige4.2:3b-Q4_K_M -f Modelfile
./ollama run nanbeige4.2:3b-Q4_K_M

https://huggingface.co/Nanbeige/Nanbeige4.2-3B#usage–mlx-safetensors 使用 — MLX (safetensors)

# 选项 1:拉取官方 safetensors 模型(无需 Modelfile)
./ollama serve
./ollama run nanbeige/nanbeige4.2:3b-BF16
# 选项 2:从本地 HuggingFace 目录创建
MODEL_PATH_HF=/path/to/your/Nanbeige4.2-3B

# Modelfile
cat > Modelfile <<EOF
FROM ${MODEL_PATH_HF}
EOF

./ollama create nanbeige4.2:3b-BF16 -f Modelfile
./ollama run nanbeige4.2:3b-BF16

相似文章

Nanbeige4.2-3B:在紧凑模式下释放智能体能力

arXiv cs.CL

Nanbeige4.2-3B 是一个紧凑的 3B 参数通用智能体模型,采用 Looped Transformer 从零开始预训练,在智能体和推理任务上表现出色,在多个基准测试中超越了更大的模型。该模型和代码均已开源。