Laguna S 2.1 发布:比 Deepseek v4 Flash 更便宜,比 V4 Pro 更优

Reddit r/LocalLLaMA 模型

摘要

Poolside 发布 Laguna S 2.1,这是一个 118B MoE 模型,每个 token 激活 8B 参数,针对智能体编码进行了优化。据称,其性能优于 DeepSeek V4 Pro,同时价格低于 DeepSeek V4 Flash,拥有 1M 上下文窗口和开源许可证。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/07/21 18:46

poolside/Laguna-S-2.1 · Hugging Face

来源:https://huggingface.co/poolside/Laguna-S-2.1 poolside-banner

在 OpenRouter 上使用 (https://openrouter.ai/poolside/laguna-s-2.1)·在 Vercel AI Gateway 上使用 (https://vercel.com/ai-gateway/models/laguna-s-2.1)·发布博客文章 (https://poolside.ai/blog/introducing-laguna-s-2-1)

Laguna S 2.1 是一个总参数量 118B 的混合专家模型,每个令牌激活约 8B 参数,专为代理编码和长周期任务设计。它位于 Laguna 系列中的 Laguna XS 2.1 (https://huggingface.co/poolside/Laguna-XS-2.1)(33B-A3B)和 Laguna M.1(225B-A23B)之间,并共享家族配方:一个采用 Softplus 门控的令牌选择路由器,包含 256 个路由专家和 1 个共享专家,分组查询注意力,以及交错的全局/滑动窗口注意力。

https://huggingface.co/poolside/Laguna-S-2.1#highlights亮点

  • 混合 SWA 与全局注意力布局:48 层,全局与滑动窗口注意力层比例为 1:3(12 层全局注意力,36 层滑动窗口注意力,窗口大小 512),采用 Softplus 注意力门控和按层类型的旋转位置编码缩放
  • 1M 上下文:1,048,576 令牌的上下文窗口
  • 原生推理支持:工具调用之间交错的思考过程,通过 enable_thinking 实现按请求控制
  • 推测解码:提供训练好的 DFlash 草稿模型 (https://huggingface.co/poolside/Laguna-S-2.1-DFlash),用于低延迟服务
  • 量化变体:FP8 (https://huggingface.co/poolside/Laguna-S-2.1-FP8)、NVFP4 (https://huggingface.co/poolside/Laguna-S-2.1-NVFP4)、INT4 (https://huggingface.co/poolside/Laguna-S-2.1-INT4) 和 GGUF (https://huggingface.co/poolside/Laguna-S-2.1-GGUF)
  • OpenMDW-1.1 许可:允许免费用于商业和非商业目的,自由使用和修改模型及相关材料(了解更多关于 OpenMDW (https://openmdw.ai/) 的信息)

https://huggingface.co/poolside/Laguna-S-2.1#model-overview模型概览

  • 参数量:118B 总参数,每个令牌约激活 8B
  • 层数:48(12 层全局注意力,36 层滑动窗口注意力)
  • 专家:256 个路由专家(选 top-10)加 1 个共享专家
  • 注意力:分组查询注意力,8 个 KV 头,头维度 128;每头 Softplus 输出门控
  • 滑动窗口:512 令牌
  • 上下文窗口:1,048,576 令牌
  • 词汇表:100,352 令牌(Laguna 系列令牌化器)
  • 模态:文本到文本
  • 推理:交错的思考过程并保留思考内容

https://huggingface.co/poolside/Laguna-S-2.1#benchmark-results基准测试结果

基准测试

模型尺寸Terminal-Bench 2.1SWE-bench 多语言SWE-Bench Pro(公共数据集)DeepSWESWE Atlas(代码库问答)Toolathlon Verified
Laguna S 2.1118B-A8B70.2%78.5%59.4%40.4%46.2%49.7%
Tencent Hy3295B-A21B71.7%75.8%57.9%---
Inkling975B-A41B63.8%-54.3%--45.5%*
Nemotron 3 Ultra550B-A55B56.4%67.7%---34.3%*
DeepSeek-V4-Pro Max1.6T-A49B64.0%*76.2%55.4%9.0%*27.2%*55.9%*
Kimi K32800B-A50B88.3%--69%--
Qwen 3.7 Max-74.5%*78.3%60.6%---
Muse Spark 1.1-80%-61.5%53.3%42.2%*75.6%
Claude Fable 5-88%-80.3%70%--

基准测试数据截至 2026 年 7 月 21 日。Laguna S 2.1 以粗体标出;破折号(-)表示该模型未在该基准上评估。标有 * 的分数由第三方报告:Terminal-Bench 2.1 和 DeepSWE 来自 Artificial Analysis,SWE Atlas 来自 Scale AI 的官方排行榜,Toolathlon Verified 来自其官方排行榜。完整评估轨迹:trajectories.poolside.ai (https://trajectories.poolside.ai/)。

https://huggingface.co/poolside/Laguna-S-2.1#usage使用

Laguna S 2.1 使用与 Laguna XS 2.1 相同的 laguna 架构,因此相同的引擎集成(vLLM、SGLang、Transformers、TRT-LLM、llama.cpp)均适用。118B 参数的 BF16 检查点需要多个 GPU(约 236GB 权重);量化变体可大幅减少。

https://huggingface.co/poolside/Laguna-S-2.1#vllmvLLM

vllm serve \ --model poolside/Laguna-S-2.1 \ --tensor-parallel-size 4 \ --tool-call-parser poolside_v1 \ --reasoning-parser poolside_v1 \ --enable-auto-tool-choice \ --served-model-name laguna \ --default-chat-template-kwargs '{"enable_thinking": true}'

可选:使用 DFlash 进行推测解码。 搭配 Laguna S 2.1 DFlash 草稿模型 (https://huggingface.co/poolside/Laguna-S-2.1-DFlash),添加 \-\-speculative\-config '\{"model":"poolside/Laguna\-S\-2\.1\-DFlash","num\_speculative\_tokens":7,"method":"dflash"\}'

https://huggingface.co/poolside/Laguna-S-2.1#sglangSGLang

python -m sglang.launch_server \ --model-path poolside/Laguna-S-2.1 \ --tp-size 4 \ --reasoning-parser poolside_v1 \ --tool-call-parser poolside_v1 \ --trust-remote-code

https://huggingface.co/poolside/Laguna-S-2.1#trt-llmTRT-LLM

trtllm-serve poolside/Laguna-S-2.1 --trust-remote-code \ --tool_parser poolside_v1 --reasoning_parser laguna

注意参数名称与 vLLM 不同(\-\-tool\_parser,并且推理解析器是 laguna,而不是 poolside\_v1)。

https://huggingface.co/poolside/Laguna-S-2.1#llamacppllama.cpp

GGUF 转换版本可在 poolside/Laguna-S-2.1-GGUF (https://huggingface.co/poolside/Laguna-S-2.1-GGUF) 获取。使用 poolside 的 llama.cpp 分支(分支 laguna (https://github.com/poolsideai/llama.cpp/tree/laguna))进行服务,该分支包含完整的 Laguna 支持,包括 DFlash 推测解码。(基础 Laguna 支持也在上游审查中:ggml-org/llama.cpp#25165 (https://github.com/ggml-org/llama.cpp/pull/25165)。)

`` git clone –branch laguna https://github.com/poolsideai/llama.cpp cd llama.cpp && cmake -B build && cmake –build build -j

./build/bin/llama-server -m laguna-s-2.1-Q4_K_M.gguf –jinja –port 8000

使用 DFlash 推测解码:

./build/bin/llama-server -m laguna-s-2.1-Q4_K_M.gguf
-md laguna-s-2.1-DFlash-BF16.gguf
–spec-type draft-dflash –spec-draft-n-max 15 -fa on –jinja –port 8000 ``

https://huggingface.co/poolside/Laguna-S-2.1#controlling-reasoning控制推理

Laguna S 2.1 具有原生推理支持,并且与保留思考过程配合最佳:在消息历史中保留之前助手消息中的 reasoning_content。模型通常会在调用工具之前和工具调用之间进行推理,如果之前的思考块被丢弃,则在后续步骤中可能会停止推理。

通过聊天模板按请求控制思考:

extra_body={"chat_template_kwargs": {"enable_thinking": False}}

或在服务器级别使用 \-\-default\-chat\-template\-kwargs '\{"enable\_thinking": true\}'。对于代理编码用例,我们建议启用思考并在消息历史中保留推理内容。

https://huggingface.co/poolside/Laguna-S-2.1#license许可协议

本模型根据 OpenMDW-1.1 许可协议 (https://huggingface.co/poolside/Laguna-S-2.1/blob/main/LICENSE.md) 授权。

https://huggingface.co/poolside/Laguna-S-2.1#intended-and-responsible-use预期用途与负责任使用

Laguna S 2.1 专为软件工程和代理编码用例设计,您有责任确认其适用于您的预期应用。Laguna S 2.1 受 OpenMDW-1.1 许可协议 (https://huggingface.co/poolside/Laguna-S-2.1/blob/main/LICENSE.md) 约束,并且应与 Poolside 的可接受使用政策 (https://poolside.ai/legal/acceptable-use-policy) 一致使用。我们建议不要绕过 Laguna S 2.1 的安全护栏,除非您实施了适合您用例的、实质等效的缓解措施。

请将安全漏洞或安全问题报告至 [email protected]

相似文章

poolside/Laguna-S-2.1-NVFP4

Hugging Face Models Trending

Poolside发布了Laguna S 2.1,这是一个1176亿参数的混合专家(MoE)模型,其中85亿参数被激活,专为智能体编程设计,具备滑动窗口注意力、原生推理支持和本地部署能力。

Laguna S 2.1

Hacker News Top

Poolside发布Laguna S 2.1,一个总参数量118B的混合专家(MoE)模型,每个token激活8B参数,支持长达100万token的上下文,在长周期编程基准测试中取得了有竞争力的成绩,并被誉为同重量级中最具能力的自主编程模型。

Laguna S 2.1 循环修复即将到来

Reddit r/LocalLLaMA

Poolside 发布了 Laguna S 2.1,这是他们最擅长处理长周期任务的模型,同时在 Hugging Face 上提供了多种量化变体(FP8、NVFP4、INT4、DFlash、GGUF)。

poolside/Laguna-XS.2

Hugging Face Models Trending

Poolside 发布 Laguna XS.2,这是一个拥有 33B 总参数、3B 激活参数的 MoE 模型,专为智能体编码设计,可在配备 36GB RAM 的 Mac 上本地部署。