# 推出 Laguna XS 2.1
今天我们发布 Laguna XS 2.1,这是我们 Laguna XS.2 模型的升级版本。
Laguna XS 2.1 是一个总参数量为 33B 的混合专家(MoE)模型,每个 token 激活 3B 参数,专为本地机器上的智能体编码和长周期工作而设计。它与 XS.2 采用相同架构,但在 SWE-bench Multilingual 上有显著改进,并且在终端风格任务上表现更强。
## XS 2.1 与 XS.2 对比
XS 2.1 在智能体编码基准测试的关键领域相比 XS.2 有所提升。最大的进步在于 SWE-bench Multilingual,提升了 5.4 个百分点,达到 63.1%。
- Laguna XS 2.133B-A3B
- Laguna XS.233B-A3B
- Qwen3.635B-A3B
- North Mini Code (Cohere)30B
- MAI-Code-1-Flash137B
- gpt-oss-120b120B
- Claude Haiku 4.5-
- GPT-5.4 Nano-
SWE-bench Verified在 SWE-bench Verified 上的已解决任务。
SWE-bench Multilingual在 SWE-bench Multilingual 上的已解决任务。
SWE-Bench Pro在 SWE-Bench Pro 上的已解决任务。
Terminal-Bench 2.0在 Terminal-Bench 2.0 上的已解决任务。
基准测试截至 2026 年 7 月 2 日。† 我们选择包含激活参数量更大的稠密模型,以突出 MoE 模型的相对效率。
## 更好的本地体验
XS 2.1 支持 vLLM、SGLang、NVIDIA TensorRT-LLM、HF transformers 和 Ollama,llama.cpp 支持即将推出。我们还提供了三个量化检查点——FP8、INT4 和 NVFP4——使得 XS 2.1 可以在 VRAM 和计算资源更紧张的环境中部署。我们计划在近期推出原生 llama.cpp 支持的同时,提供量化的 GGUF 检查点。
我们还为每个 XS 2.1 检查点开源了 DFlash 推测模型。我们训练这些推测模型是为了平衡开销与接受率。在我们的测试中,这些推测模型使 tok/s 翻倍,让 XS 2.1 的本地推理速度比之前更快。
我们正在通过我们的 API 和 OpenRouter 以 256K 上下文长度提供该模型。
## 更开放的许可协议
我们将 Laguna XS 2.1 的许可协议更改为 OpenMDW-1.1。
我们做出这一改变是为了支持社区对开放模型的发布。OpenMDW-1.1 是完全许可性的,专为模型及相关工件设计,为开发者和组织使用、修改和部署开放模型提供了更一致的框架。
我们很高兴支持 NVIDIA 和 Linux 基金会针对 OpenMDW 所采取的方向。我们认为这是减少开放模型发布许可摩擦的有益一步。
## 开始使用
- **下载权重**,从 Hugging Face 上的 Laguna XS 2.1 合集获取——包括 BF16、FP8、NVFP4 和 INT4 格式。
- **使用模型**,在 OpenRouter(poolside/laguna-xs-2.1)或通过我们的 API 体验。提供免费和付费端点,付费定价与 XS.2 一致,为每 1M 输入/输出/缓存读取 tokens 分别收取 $0.10 / $0.20 / $0.05。
- **本地运行**,使用 Ollama、llama.cpp、TRT-LLM、vLLM 或 SGLang,并添加 DFlash 草稿模型以获得更快推理。
- **安装 pool**,我们的终端智能体编码工具,以获得该模型的最佳智能体体验。
我们希望看到大家用 XS 2.1 构建什么,也期待你的反馈。请并排试用这两个模型,并告诉我们 2.1 在哪些方面更好,哪些方面不如人意。加入我们的 Discord 分享你的发现并直接与团队交流,或通过
[email protected] 或 X 联系我们。
*Laguna XS.2 将在 1 周后从我们的 API 上下线。XS.2 将继续作为 Baseten 模型库的一部分用于专用部署。*
**脚注**
所有 Laguna XS 2.1 的基准测试均使用 Laude Institute 的 Harbor 框架及我们的智能体工具完成,最大步骤为 500 步,并在沙盒环境中执行。所有 Laguna XS 2.1 基准测试使用相同的采样参数:temperature=1.0,top_k=20,top_p=1,开启思考模式,上下文长度为 256K tokens。所有任务均在各自沙盒中运行,使用 8 GB RAM/2 CPU,Terminal-Bench 2.0 除外,它使用 48 GB RAM/32 CPU。
部分基础任务镜像和验证器已打补丁,以修复任务设置中固有的基础设施可靠性问题,例如验证器使用的外部注册表中第三方依赖的速率限制。所有四个智能体基准测试均使用打过补丁的镜像运行。我们还对 Laguna XS 2.1 的评估运行进行了事后奖励黑客检查,经过联合审查和人工审查后未发现显著的奖励黑客行为。
- SWE-bench Verified:每个任务四次尝试的平均 pass@1
- SWE-bench Multilingual:每个任务四次尝试的平均 pass@1
- SWE-Bench Pro:每个任务两次尝试的平均 pass@1
- Terminal-Bench 2.0:每个任务五次尝试的平均 pass@1;48 GB RAM/32 CPU
\* 我们为每个基准测试中的所有对比模型使用了公开可查的最高分数。这些分数均为发布博文或同等材料中公布的官方分数,但 gpt-oss-120b 和 Claude Haiku 4.5 的 SWE-Bench Pro 和 Terminal-Bench 2.0 最高(已验证)分数来自各自的官方排行榜。