两种不同规模的智能体AI:Nanbeige4.2-3B与Laguna S2.1(9分钟阅读)
摘要
比较了两个用于智能体工作负载的新AI模型:采用循环Transformer架构的紧凑型Nanbeige4.2-3B,以及大型混合专家模型Laguna S2.1,两者均在Hugging Face上发布。
Nanbeige4.2-3B是一个紧凑的密集型模型,旨在使强大的智能体行为在消费级和工作站硬件上实用化;而Laguna S 2.1是一个1180亿参数的混合专家模型,它通过稀疏访问来利用一个更大的已学习参数池。
查看缓存全文
缓存时间: 2026/07/27 13:40
# 两种不同规模的智能体AI:Nanbeige4.2-3B 与 Laguna S2.1
来源:https://kaitchup.substack.com/p/agentic-ai-at-two-different-scales
[](https://substackcdn.com/image/fetch/$s_!c7_f!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fbd3f4615-2c66-4a1a-8e7c-7002fe563e0b_1517x849.png)
大家好,
在本期《Kaitchup周报》中,我将关注本周最有趣的两个面向智能体工作负载的发布:Nanbeige4.2-3B 和 Laguna S2.1。
智能体工作负载包括多步推理、工具使用、与外部环境的交互,以及那些可能需要多次行动才能完成的任务。
- Nanbeige/Nanbeige4.2-3B (https://huggingface.co/Nanbeige/Nanbeige4.2-3B)
- poolside/Laguna-S-2.1 (https://huggingface.co/poolside/Laguna-S-2.1)
尽管关注点相同,但它们运行的规模大相径庭。
Nanbeige4.2-3B 是一个紧凑的密集模型,总参数约40亿,非嵌入参数约30亿。它的设计目标是在消费级和工作站硬件上实现实用的智能体行为。
Laguna S2.1 是一个1180亿参数的混合专家(MoE)模型。每个token大约激活80亿参数。
这两个模型代表了实现智能体AI的不同方法。Nanbeige 在相对较小的权重集上使用重复计算,而 Laguna 则稀疏地访问一个更大的学习参数池。
虽然 Nanbeige4.1 使用了基本的 Llama 架构,但 Nanbeige4.2-3B 采用了循环 Transformer。
该模型并非包含大量独特的Transformer层,而是拥有22个物理解码器层,这些层被**执行两次**。在第二次传递中重复使用相同的权重,使得模型具有大约44层执行的计算深度,而无需存储44个独立的层。
这种设计减少了权重内存,但并未将推理计算减少到普通22层模型的程度。每个token仍然需要两次通过Transformer堆栈。
该模型有48个注意力头,每个头的维度为128,以及8个键/值头。这数量相当多。例如,Qwen3.6 35B A3B 只有两个KV头。
循环引入了另一个内存考量。除非实现明确地在两次传递之间共享KV缓存状态,否则每次循环可能需要单独的键/值条目。Nanbeige 的默认配置似乎并未启用循环级别的KV共享。
此外,我认为使用循环Transformer的模型应该更恰当地命名。当你使用一个3B模型时,你不会期望它几乎和6B模型一样慢。小型MoE模型,如Qwen3.6和Gemma 4,会在名称中显示活动参数的数量,例如26B-A4B。对于循环Transformer,我们应该采用类似的约定,例如3B-2P(代表“2次传递”)。
一块16GB GPU应该能够以适度上下文长度运行该模型(无需量化),但需要仔细设置。24GB GPU则为更长的提示、更高的并发性和运行时开销提供了更多空间。
根据该模型的22个物理层、两次循环传递、8个键/值头、128维头和BF16 KV值,保守估计每个活动序列的每个缓存token的KV缓存消耗约为176 KiB。
*我在以下文章中展示了如何估算KV缓存内存消耗:*
小型MoE的KV缓存:Qwen3、Qwen3.5/3.6、GLM 4.7 Flash 和 Nemotron 3 Nano 对比 (https://kaitchup.substack.com/p/the-kv-cache-of-small-moes-qwen3)
在16K tokens时,这将需要大约2.75 GiB的KV缓存内存。使用完整的256K上下文,单个活动序列可能需要大约44 GiB的KV缓存内存。
这个数量非常大。几乎是 Qwen3.6 27B 在相同上下文长度下消耗的两倍。
发布时,Nanbeige 为该模型提供了一个专用的 vLLM 分支:
``
git clone -b nanbeige42 https://github.com/Nanbeige/vllm.git
cd vllm
pip install -e .
``
然后可以通过 vLLM 的 OpenAI 兼容 API 来提供模型服务:
``
vllm serve Nanbeige/Nanbeige4.2-3B \
--host 0.0.0.0 \
--port 8000 \
--enable-auto-tool-choice \
--tool-call-parser nanbeige \
--reasoning-parser nanbeige
#如果你本地运行,请使用 --host 127.0.0.1
``
推理和工具调用解析器对于智能体框架非常重要。它们允许 vLLM 将推理内容和结构化的工具调用与普通的助手文本区分开来。
Nanbeige 的聊天模板公开了两个控制选项。
`enable_thinking` 选项决定当前响应是否包含显式的推理阶段。`preserve_thinking` 选项决定先前助手轮次中的推理内容是否保留在对话历史中。
对于普通聊天和问答,通常可以禁用保留的推理。对于多轮工具使用、办公工作流和编码智能体,开发者建议保留早期的推理内容,但我不理解这如何能很好地工作。推理轨迹可能非常长,例如超过50K tokens。即使只保留一个,也意味着模型在下一次轮次可能达到其最大上下文长度。
根据已发布的评估,Nanbeige 在大多数包含的智能体、编码和推理任务上超过了 Qwen3.5-9B。在包括 GDPval、SWE-Bench Verified、SWE-Bench Pro 和 Terminal-Bench 2.0 等多个基准测试上,它也超越了 Gemma 4 12B。
[](https://substackcdn.com/image/fetch/$s_!z6QI!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fe8e3b3ee-342e-484e-b3b7-ff2a4e570171_4920x3356.png)
智能体结果不仅受基础模型影响,还受允许的推理预算、工具定义、提示策略、对话状态处理、重试策略和最大操作次数的影响。
*参考:Nanbeige4.2-3B: Unlocking Agentic Capabilities in a Compact Model (https://huggingface.co/Nanbeige/Nanbeige4.2-3B/blob/main/Nanbeige42_report.pdf)*
Laguna S2.1 是一个更大的、专注于编码的 MoE 模型。
它包含1180亿总参数,但每个token仅激活约80亿参数。路由机制在推理过程中选择一部分专家,使得模型能够访问一个大型的学习参数池,而无需为每个token执行所有参数。
Laguna 包含48个Transformer层。其中12个使用全局注意力,其余36个使用滑动窗口注意力,窗口大小为512个token。全局层和局部层大致以1:3的比例交错排列。
全局层允许信息在整个输入上下文中移动。滑动窗口层将注意力限制在附近的token上,从而降低了长上下文推理的成本,并限制了KV缓存的增长。
该模型包含256个路由专家和1个共享专家。对于每个token,路由器除了共享计算外,还会选择排名前10的路由专家。
Laguna 还使用了每头 softplus 输出门控。
> **每头 softplus 输出门控** 为每个注意力头提供了自己的学习音量控制。对于每个token,模型可以在组合输出之前减少、保留或放大单个头的贡献。Softplus 函数保持这些门为正,同时允许值超过1,因此有用的注意力头可以被增强,而不仅仅是打开或关闭。
它使用了交错推理。模型可以进行推理、发出工具调用、接收工具结果,并在选择另一个操作之前恢复推理。
Poolside 还提供了一个 DFlash 草稿模型 (https://huggingface.co/poolside/Laguna-S-2.1-DFlash) 用于推测解码。这些模型生成候选token,主模型可以并行验证,从而有可能提高输出速度。
训练和运行 DFlash 推测解码 (https://kaitchup.substack.com/p/train-and-run-dflash-speculative)
vLLM 0.25.0 或更新版本已记录支持 Laguna:
``
uv pip install -U "vllm>=0.25.0"
``
该模型可以在单块 B300 GPU 上运行:
``
vllm serve poolside/Laguna-S-2.1 \
--enable-auto-tool-choice \
--tool-call-parser poolside_v1 \
--reasoning-parser poolside_v1 \
--default-chat-template-kwargs '{"enable_thinking": true}'
``
NVFP4 (https://huggingface.co/poolside/Laguna-S-2.1-NVFP4) 和 INT4 (https://huggingface.co/poolside/Laguna-S-2.1-INT4) 版本消耗少于80 GB,但你需要一块96 GB GPU,例如 RTX Pro 6000,才能充分利用该模型的上下文长度。
``
vllm serve poolside/Laguna-S-2.1-INT4 \
--enable-auto-tool-choice \
--tool-call-parser poolside_v1 \
--reasoning-parser poolside_v1 \
--default-chat-template-kwargs '{"enable_thinking": true}'
``
对于编码智能体工作负载,Poolside 也建议在对话历史中保留先前的 `reasoning_content`。
至于 KV 缓存的内存消耗,256K tokens 大约需要 24 GB。
Laguna S2.1 比 Nanbeige 更专业化。
它的主要目标是长期软件工程。这包括仓库级别的错误修复、终端交互、基于Shell的工作流、多语言代码维护、代码库探索以及回答需要理解大型软件仓库的问题。
Laguna 的稀疏架构和编码聚焦训练对于终端交互、仓库级推理和多语言软件工程特别有效。
看起来它是一个非常好的模型,但到目前为止,我发现社区的反馈褒贬不一。
benchmarks (https://substackcdn.com/image/fetch/$s_!8N_3!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F5d6b9f39-833b-40ba-9ce8-a34b84e635c5_699x1102.svg)
*参考:Introducing Laguna S 2.1 (https://poolside.ai/blog/introducing-laguna-s-2-1)*
我会花些时间研究 Nanbeige 和 Laguna。如果一切顺利,我可能会写一篇关于使用它们进行智能体编码的文章。
> ### **尝试Verda GPU的50美元优惠券**
> 与 Verda (https://verda.com/?utm_source=kaitchup.substack.com) 合作,我分享一张**50美元优惠券**,您可以在Verda账户中充值5美元后进行兑换,以试用他们的GPU(B200, B300, RTX Pro 6000, ...)。
> **优惠券代码:** `KAITCHUP-50`
> 按照以下说明 (https://docs.verda.com/resources/obtaining-free-credits/how-to-redeem-credits/) 进行兑换。
> *注:我分享这张优惠券是因为我真的认为这是一个好交易。我未从Verda收到任何形式的补偿或使用信息。Verda也为我的部分文章提供计算赞助。*
本周就到这里。
如果您喜欢阅读 The Kaitchup,请考虑与朋友和同事分享(团体订阅可享20%折扣):
分享 The Kaitchup – AI on a Budget (https://kaitchup.substack.com/?utm_source=substack&utm_medium=email&utm_content=share&action=share)
祝周末愉快!
相似文章
Nanbeige/Nanbeige4.2-3B
Nanbeige4.2-3B 是一款紧凑型智能体模型,采用循环Transformer架构,在3B规模下展现出强大的智能体任务和推理基准性能,超越了Qwen3.5-9B和Gemma4-12B等更大规模的模型。
Nanbeige4.2-3B:在紧凑模式下释放智能体能力
Nanbeige4.2-3B 是一个紧凑的 3B 参数通用智能体模型,采用 Looped Transformer 从零开始预训练,在智能体和推理任务上表现出色,在多个基准测试中超越了更大的模型。该模型和代码均已开源。
XHToken/Spark-X2.5-4B vs inclusionAI/Ling-3.0-tiny vs Nanbeige/Nanbeige4.2-3B
本文探讨了哪些小型人工智能模型最具实用性,并介绍了同一尺寸级别中的三款竞争模型。
新模型:Nanbeige4.2-3B(Looped Transformer,性能超越4倍规模模型)
Nanbeige4.2-3B是一个新的3B参数AI模型,采用Looped Transformer架构,性能超越其4倍规模的模型。
Sakana Fugu(三分钟阅读)
Sakana AI 推出 AB-MCTS,一种推理时缩放算法,使多个前沿 AI 模型(Gemini 2.5 Pro、o4-mini、DeepSeek-R1-0528)协同工作,在 ARC-AGI-2 基准测试中显著优于单个模型。