介绍 Laguna XS 2.1(5分钟阅读)

TLDR AI 模型

摘要

Poolside 发布 Laguna XS 2.1,这是一个 33B 参数的混合专家模型,每个 token 激活 3B 参数,专为智能编码设计,在 SWE-bench Multilingual 及其他基准测试上有所改进,现已在宽松的 OpenMDW-1.1 许可证下提供。

Laguna XS 2.1 是一个 33B 参数的混合专家模型,针对智能编码和长期任务进行了优化,在 SWE-bench Multilingual 上提升了 5.4 个百分点,达到 63.1%。它支持多种平台,并提供三个量化检查点,便于资源高效的部署。在 OpenMDW-1.1 许可证下,它允许开放的模型分发,并可通过 Hugging Face 下载或通过 API 获取。
查看原文
查看缓存全文

缓存时间: 2026/07/03 17:22

# 推出 Laguna XS 2.1 今天我们发布 Laguna XS 2.1,这是我们 Laguna XS.2 模型的升级版本。 Laguna XS 2.1 是一个总参数量为 33B 的混合专家(MoE)模型,每个 token 激活 3B 参数,专为本地机器上的智能体编码和长周期工作而设计。它与 XS.2 采用相同架构,但在 SWE-bench Multilingual 上有显著改进,并且在终端风格任务上表现更强。 ## XS 2.1 与 XS.2 对比 XS 2.1 在智能体编码基准测试的关键领域相比 XS.2 有所提升。最大的进步在于 SWE-bench Multilingual,提升了 5.4 个百分点,达到 63.1%。 - Laguna XS 2.133B-A3B - Laguna XS.233B-A3B - Qwen3.635B-A3B - North Mini Code (Cohere)30B - MAI-Code-1-Flash137B - gpt-oss-120b120B - Claude Haiku 4.5- - GPT-5.4 Nano- SWE-bench Verified在 SWE-bench Verified 上的已解决任务。 SWE-bench Multilingual在 SWE-bench Multilingual 上的已解决任务。 SWE-Bench Pro在 SWE-Bench Pro 上的已解决任务。 Terminal-Bench 2.0在 Terminal-Bench 2.0 上的已解决任务。 基准测试截至 2026 年 7 月 2 日。† 我们选择包含激活参数量更大的稠密模型,以突出 MoE 模型的相对效率。 ## 更好的本地体验 XS 2.1 支持 vLLM、SGLang、NVIDIA TensorRT-LLM、HF transformers 和 Ollama,llama.cpp 支持即将推出。我们还提供了三个量化检查点——FP8、INT4 和 NVFP4——使得 XS 2.1 可以在 VRAM 和计算资源更紧张的环境中部署。我们计划在近期推出原生 llama.cpp 支持的同时,提供量化的 GGUF 检查点。 我们还为每个 XS 2.1 检查点开源了 DFlash 推测模型。我们训练这些推测模型是为了平衡开销与接受率。在我们的测试中,这些推测模型使 tok/s 翻倍,让 XS 2.1 的本地推理速度比之前更快。 我们正在通过我们的 API 和 OpenRouter 以 256K 上下文长度提供该模型。 ## 更开放的许可协议 我们将 Laguna XS 2.1 的许可协议更改为 OpenMDW-1.1。 我们做出这一改变是为了支持社区对开放模型的发布。OpenMDW-1.1 是完全许可性的,专为模型及相关工件设计,为开发者和组织使用、修改和部署开放模型提供了更一致的框架。 我们很高兴支持 NVIDIA 和 Linux 基金会针对 OpenMDW 所采取的方向。我们认为这是减少开放模型发布许可摩擦的有益一步。 ## 开始使用 - **下载权重**,从 Hugging Face 上的 Laguna XS 2.1 合集获取——包括 BF16、FP8、NVFP4 和 INT4 格式。 - **使用模型**,在 OpenRouter(poolside/laguna-xs-2.1)或通过我们的 API 体验。提供免费和付费端点,付费定价与 XS.2 一致,为每 1M 输入/输出/缓存读取 tokens 分别收取 $0.10 / $0.20 / $0.05。 - **本地运行**,使用 Ollama、llama.cpp、TRT-LLM、vLLM 或 SGLang,并添加 DFlash 草稿模型以获得更快推理。 - **安装 pool**,我们的终端智能体编码工具,以获得该模型的最佳智能体体验。 我们希望看到大家用 XS 2.1 构建什么,也期待你的反馈。请并排试用这两个模型,并告诉我们 2.1 在哪些方面更好,哪些方面不如人意。加入我们的 Discord 分享你的发现并直接与团队交流,或通过 [email protected] 或 X 联系我们。 *Laguna XS.2 将在 1 周后从我们的 API 上下线。XS.2 将继续作为 Baseten 模型库的一部分用于专用部署。* **脚注** 所有 Laguna XS 2.1 的基准测试均使用 Laude Institute 的 Harbor 框架及我们的智能体工具完成,最大步骤为 500 步,并在沙盒环境中执行。所有 Laguna XS 2.1 基准测试使用相同的采样参数:temperature=1.0,top_k=20,top_p=1,开启思考模式,上下文长度为 256K tokens。所有任务均在各自沙盒中运行,使用 8 GB RAM/2 CPU,Terminal-Bench 2.0 除外,它使用 48 GB RAM/32 CPU。 部分基础任务镜像和验证器已打补丁,以修复任务设置中固有的基础设施可靠性问题,例如验证器使用的外部注册表中第三方依赖的速率限制。所有四个智能体基准测试均使用打过补丁的镜像运行。我们还对 Laguna XS 2.1 的评估运行进行了事后奖励黑客检查,经过联合审查和人工审查后未发现显著的奖励黑客行为。 - SWE-bench Verified:每个任务四次尝试的平均 pass@1 - SWE-bench Multilingual:每个任务四次尝试的平均 pass@1 - SWE-Bench Pro:每个任务两次尝试的平均 pass@1 - Terminal-Bench 2.0:每个任务五次尝试的平均 pass@1;48 GB RAM/32 CPU \* 我们为每个基准测试中的所有对比模型使用了公开可查的最高分数。这些分数均为发布博文或同等材料中公布的官方分数,但 gpt-oss-120b 和 Claude Haiku 4.5 的 SWE-Bench Pro 和 Terminal-Bench 2.0 最高(已验证)分数来自各自的官方排行榜。

相似文章

poolside/Laguna-M.1 · Hugging Face - 225B-A23B

Reddit r/LocalLLaMA

Poolside 发布了 Laguna M.1,这是一个 225B 参数的混合专家模型,每个 token 激活 23B 参数,专为代理编程和长周期任务设计。它在 SWE-bench 基准测试上取得了有竞争力的结果,并采用 Apache 2.0 许可证发布。

Laguna S 2.1

Hacker News Top

Poolside发布Laguna S 2.1,一个总参数量118B的混合专家(MoE)模型,每个token激活8B参数,支持长达100万token的上下文,在长周期编程基准测试中取得了有竞争力的成绩,并被誉为同重量级中最具能力的自主编程模型。

poolside/Laguna-S-2.1-NVFP4

Hugging Face Models Trending

Poolside发布了Laguna S 2.1,这是一个1176亿参数的混合专家(MoE)模型,其中85亿参数被激活,专为智能体编程设计,具备滑动窗口注意力、原生推理支持和本地部署能力。

poolside/Laguna-XS.2

Hugging Face Models Trending

Poolside 发布 Laguna XS.2,这是一个拥有 33B 总参数、3B 激活参数的 MoE 模型,专为智能体编码设计,可在配备 36GB RAM 的 Mac 上本地部署。