Laguna S 2.1 发布:比 Deepseek v4 Flash 更便宜,比 V4 Pro 更优
摘要
Poolside 发布 Laguna S 2.1,这是一个 118B MoE 模型,每个 token 激活 8B 参数,针对智能体编码进行了优化。据称,其性能优于 DeepSeek V4 Pro,同时价格低于 DeepSeek V4 Flash,拥有 1M 上下文窗口和开源许可证。
查看缓存全文
缓存时间: 2026/07/21 18:46
poolside/Laguna-S-2.1 · Hugging Face
来源:https://huggingface.co/poolside/Laguna-S-2.1 poolside-banner
在 OpenRouter 上使用 (https://openrouter.ai/poolside/laguna-s-2.1)·在 Vercel AI Gateway 上使用 (https://vercel.com/ai-gateway/models/laguna-s-2.1)·发布博客文章 (https://poolside.ai/blog/introducing-laguna-s-2-1)
Laguna S 2.1 是一个总参数量 118B 的混合专家模型,每个令牌激活约 8B 参数,专为代理编码和长周期任务设计。它位于 Laguna 系列中的 Laguna XS 2.1 (https://huggingface.co/poolside/Laguna-XS-2.1)(33B-A3B)和 Laguna M.1(225B-A23B)之间,并共享家族配方:一个采用 Softplus 门控的令牌选择路由器,包含 256 个路由专家和 1 个共享专家,分组查询注意力,以及交错的全局/滑动窗口注意力。
https://huggingface.co/poolside/Laguna-S-2.1#highlights亮点
- 混合 SWA 与全局注意力布局:48 层,全局与滑动窗口注意力层比例为 1:3(12 层全局注意力,36 层滑动窗口注意力,窗口大小 512),采用 Softplus 注意力门控和按层类型的旋转位置编码缩放
- 1M 上下文:1,048,576 令牌的上下文窗口
- 原生推理支持:工具调用之间交错的思考过程,通过
enable_thinking实现按请求控制 - 推测解码:提供训练好的 DFlash 草稿模型 (https://huggingface.co/poolside/Laguna-S-2.1-DFlash),用于低延迟服务
- 量化变体:FP8 (https://huggingface.co/poolside/Laguna-S-2.1-FP8)、NVFP4 (https://huggingface.co/poolside/Laguna-S-2.1-NVFP4)、INT4 (https://huggingface.co/poolside/Laguna-S-2.1-INT4) 和 GGUF (https://huggingface.co/poolside/Laguna-S-2.1-GGUF)
- OpenMDW-1.1 许可:允许免费用于商业和非商业目的,自由使用和修改模型及相关材料(了解更多关于 OpenMDW (https://openmdw.ai/) 的信息)
https://huggingface.co/poolside/Laguna-S-2.1#model-overview模型概览
- 参数量:118B 总参数,每个令牌约激活 8B
- 层数:48(12 层全局注意力,36 层滑动窗口注意力)
- 专家:256 个路由专家(选 top-10)加 1 个共享专家
- 注意力:分组查询注意力,8 个 KV 头,头维度 128;每头 Softplus 输出门控
- 滑动窗口:512 令牌
- 上下文窗口:1,048,576 令牌
- 词汇表:100,352 令牌(Laguna 系列令牌化器)
- 模态:文本到文本
- 推理:交错的思考过程并保留思考内容
https://huggingface.co/poolside/Laguna-S-2.1#benchmark-results基准测试结果
基准测试
| 模型 | 尺寸 | Terminal-Bench 2.1 | SWE-bench 多语言 | SWE-Bench Pro(公共数据集) | DeepSWE | SWE Atlas(代码库问答) | Toolathlon Verified |
|---|---|---|---|---|---|---|---|
| Laguna S 2.1 | 118B-A8B | 70.2% | 78.5% | 59.4% | 40.4% | 46.2% | 49.7% |
| Tencent Hy3 | 295B-A21B | 71.7% | 75.8% | 57.9% | - | - | - |
| Inkling9 | 75B-A41B | 63.8% | - | 54.3% | - | - | 45.5%* |
| Nemotron 3 Ultra | 550B-A55B | 56.4% | 67.7% | - | - | - | 34.3%* |
| DeepSeek-V4-Pro Max | 1.6T-A49B | 64.0%* | 76.2% | 55.4% | 9.0%* | 27.2%* | 55.9%* |
| Kimi K3 | 2800B-A50B | 88.3% | - | - | 69% | - | - |
| Qwen 3.7 Max | - | 74.5%* | 78.3% | 60.6% | - | - | - |
| Muse Spark 1.1 | - | 80% | - | 61.5% | 53.3% | 42.2%* | 75.6% |
| Claude Fable 5 | - | 88% | - | 80.3% | 70% | - | - |
基准测试数据截至 2026 年 7 月 21 日。Laguna S 2.1 以粗体标出;破折号(-)表示该模型未在该基准上评估。标有 * 的分数由第三方报告:Terminal-Bench 2.1 和 DeepSWE 来自 Artificial Analysis,SWE Atlas 来自 Scale AI 的官方排行榜,Toolathlon Verified 来自其官方排行榜。完整评估轨迹:trajectories.poolside.ai (https://trajectories.poolside.ai/)。
https://huggingface.co/poolside/Laguna-S-2.1#usage使用
Laguna S 2.1 使用与 Laguna XS 2.1 相同的 laguna 架构,因此相同的引擎集成(vLLM、SGLang、Transformers、TRT-LLM、llama.cpp)均适用。118B 参数的 BF16 检查点需要多个 GPU(约 236GB 权重);量化变体可大幅减少。
https://huggingface.co/poolside/Laguna-S-2.1#vllmvLLM
vllm serve \ --model poolside/Laguna-S-2.1 \ --tensor-parallel-size 4 \ --tool-call-parser poolside_v1 \ --reasoning-parser poolside_v1 \ --enable-auto-tool-choice \ --served-model-name laguna \ --default-chat-template-kwargs '{"enable_thinking": true}'
可选:使用 DFlash 进行推测解码。 搭配 Laguna S 2.1 DFlash 草稿模型 (https://huggingface.co/poolside/Laguna-S-2.1-DFlash),添加
\-\-speculative\-config '\{"model":"poolside/Laguna\-S\-2\.1\-DFlash","num\_speculative\_tokens":7,"method":"dflash"\}'。
https://huggingface.co/poolside/Laguna-S-2.1#sglangSGLang
python -m sglang.launch_server \ --model-path poolside/Laguna-S-2.1 \ --tp-size 4 \ --reasoning-parser poolside_v1 \ --tool-call-parser poolside_v1 \ --trust-remote-code
https://huggingface.co/poolside/Laguna-S-2.1#trt-llmTRT-LLM
trtllm-serve poolside/Laguna-S-2.1 --trust-remote-code \ --tool_parser poolside_v1 --reasoning_parser laguna
注意参数名称与 vLLM 不同(\-\-tool\_parser,并且推理解析器是 laguna,而不是 poolside\_v1)。
https://huggingface.co/poolside/Laguna-S-2.1#llamacppllama.cpp
GGUF 转换版本可在 poolside/Laguna-S-2.1-GGUF (https://huggingface.co/poolside/Laguna-S-2.1-GGUF) 获取。使用 poolside 的 llama.cpp 分支(分支 laguna (https://github.com/poolsideai/llama.cpp/tree/laguna))进行服务,该分支包含完整的 Laguna 支持,包括 DFlash 推测解码。(基础 Laguna 支持也在上游审查中:ggml-org/llama.cpp#25165 (https://github.com/ggml-org/llama.cpp/pull/25165)。)
`` git clone –branch laguna https://github.com/poolsideai/llama.cpp cd llama.cpp && cmake -B build && cmake –build build -j
./build/bin/llama-server -m laguna-s-2.1-Q4_K_M.gguf –jinja –port 8000
使用 DFlash 推测解码:
./build/bin/llama-server -m laguna-s-2.1-Q4_K_M.gguf
-md laguna-s-2.1-DFlash-BF16.gguf
–spec-type draft-dflash –spec-draft-n-max 15 -fa on –jinja –port 8000
``
https://huggingface.co/poolside/Laguna-S-2.1#controlling-reasoning控制推理
Laguna S 2.1 具有原生推理支持,并且与保留思考过程配合最佳:在消息历史中保留之前助手消息中的 reasoning_content。模型通常会在调用工具之前和工具调用之间进行推理,如果之前的思考块被丢弃,则在后续步骤中可能会停止推理。
通过聊天模板按请求控制思考:
extra_body={"chat_template_kwargs": {"enable_thinking": False}}
或在服务器级别使用 \-\-default\-chat\-template\-kwargs '\{"enable\_thinking": true\}'。对于代理编码用例,我们建议启用思考并在消息历史中保留推理内容。
https://huggingface.co/poolside/Laguna-S-2.1#license许可协议
本模型根据 OpenMDW-1.1 许可协议 (https://huggingface.co/poolside/Laguna-S-2.1/blob/main/LICENSE.md) 授权。
https://huggingface.co/poolside/Laguna-S-2.1#intended-and-responsible-use预期用途与负责任使用
Laguna S 2.1 专为软件工程和代理编码用例设计,您有责任确认其适用于您的预期应用。Laguna S 2.1 受 OpenMDW-1.1 许可协议 (https://huggingface.co/poolside/Laguna-S-2.1/blob/main/LICENSE.md) 约束,并且应与 Poolside 的可接受使用政策 (https://poolside.ai/legal/acceptable-use-policy) 一致使用。我们建议不要绕过 Laguna S 2.1 的安全护栏,除非您实施了适合您用例的、实质等效的缓解措施。
请将安全漏洞或安全问题报告至 [email protected]。
相似文章
@cline: Laguna S 2.1 在小模型性能上取得突破,击败了体积是其三倍的模型。仅118b参数,它击败了Dee…
Poolside 发布了 Laguna S 2.1,这是一个 118B 参数的混合专家模型,每个 token 激活 8B 参数,拥有 1M 上下文窗口,声称可以击败体积是其三倍的模型,例如 DeepSeek v4 Pro、Gemini 3.6 Flash 和 Thinking Machines Inkling。
poolside/Laguna-S-2.1-NVFP4
Poolside发布了Laguna S 2.1,这是一个1176亿参数的混合专家(MoE)模型,其中85亿参数被激活,专为智能体编程设计,具备滑动窗口注意力、原生推理支持和本地部署能力。
Laguna S 2.1
Poolside发布Laguna S 2.1,一个总参数量118B的混合专家(MoE)模型,每个token激活8B参数,支持长达100万token的上下文,在长周期编程基准测试中取得了有竞争力的成绩,并被誉为同重量级中最具能力的自主编程模型。
Laguna S 2.1 循环修复即将到来
Poolside 发布了 Laguna S 2.1,这是他们最擅长处理长周期任务的模型,同时在 Hugging Face 上提供了多种量化变体(FP8、NVFP4、INT4、DFlash、GGUF)。
poolside/Laguna-XS.2
Poolside 发布 Laguna XS.2,这是一个拥有 33B 总参数、3B 激活参数的 MoE 模型,专为智能体编码设计,可在配备 36GB RAM 的 Mac 上本地部署。