Unsloth 推出的 Laguna S 2.1 量化版本已发布
摘要
Unsloth 发布了 Laguna S 2.1 Mixture-of-Experts 模型的 GGUF 量化版本。该模型是一个拥有 118B 参数(8B 激活参数)的编码模型,具备 1M 上下文窗口和智能体能力。量化版本支持高效的本地部署。
查看缓存全文
缓存时间: 2026/07/22 04:17
unsloth/Laguna-S-2.1-GGUF · Hugging Face
来源:https://huggingface.co/unsloth/Laguna-S-2.1-GGUF
使用 llama.cpp(PR #25165)运行 Unsloth 的 UD-Q4_K_XL 量化版本
本仓库中的 GGUF 文件是使用 Unsloth Dynamic 2.0(https://docs.unsloth.ai/basics/unsloth-dynamic-2.0-ggufs)量化格式(经 imatrix 校准)生成的。对 Laguna 的支持尚未进入已标记的 llama.cpp 版本,因此需要从 ggml-org/llama.cpp#25165(https://github.com/ggml-org/llama.cpp/pull/25165)构建 llama.cpp:
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
gh pr checkout 25165
# 使用 CUDA 构建(移除 -DGGML_CUDA=ON 可得到仅 CPU 版本)
cmake -B build -DGGML_CUDA=ON
cmake --build build -j --config Release --target llama-cli llama-server
cd ..
下载 UD-Q4_K_XL 分片(约 40GB,分为 3 个文件):
huggingface-cli download unsloth/Laguna-S-2.1-GGUF \
--include "UD-Q4_K_XL/*" \
--local-dir Laguna-S-2.1-GGUF
使用 llama-server 提供服务(仅传入第一个分片;其余分片会自动加载):
./llama.cpp/build/bin/llama-server \
--model Laguna-S-2.1-GGUF/UD-Q4_K_XL/Laguna-S-2.1-UD-Q4_K_XL-00001-of-00003.gguf \
--jinja -fa on -ngl 99 --ctx-size 16384 --port 8000
或使用 llama-cli 进行一次性生成:
./llama.cpp/build/bin/llama-cli \
--model Laguna-S-2.1-GGUF/UD-Q4_K_XL/Laguna-S-2.1-UD-Q4_K_XL-00001-of-00003.gguf \
--jinja -ngl 99 -p "用 Python 编写一个 Flappy Bird 游戏。"
-ngl 99将所有层卸载到 GPU;如果显存不足,请降低(或移除)此值。UD-Q4_K_XL约为 40GB,因此可以放在单个 48GB+ 的 GPU 上,或跨多个 GPU 分布。
poolside-banner
在 OpenRouter 上使用(https://openrouter.ai/poolside/laguna-s-2.1)·在 Vercel AI Gateway 上使用(https://vercel.com/ai-gateway/models/laguna-s-2.1)·发布博客文章(https://poolside.ai/blog/introducing-laguna-s-2-1)
Laguna S 2.1 是一个拥有 118B 总参数、每个 token 激活 8B 参数的专家混合(MoE)模型,专为智能体编码和长周期任务设计。它在 Laguna 系列中介于 Laguna XS 2.1(https://huggingface.co/poolside/Laguna-XS-2.1)(33B-A3B)和 Laguna M.1(225B-A23B)之间,并共享相同的架构配方:一个使用 softplus 门控的 token 选择路由器,包含 256 个路由专家和 1 个共享专家,分组查询注意力机制,以及交错的全局/滑动窗口注意力。
主要亮点
- 混合 SWA 和全局注意力布局:48 层,全局注意力与 SWA 比例为 1:3(12 个全局注意力层,36 个滑动窗口层,窗口大小为 512),使用 softplus 注意力门控和每层类型的旋转缩放。
- 1M 上下文:1,048,576 token 的上下文窗口。
- 原生推理支持:在工具调用之间交错思考,通过
enable_thinking实现每个请求的控制。 - 推测解码:提供经过训练的 DFlash 草稿模型(https://huggingface.co/poolside/Laguna-S-2.1-DFlash),可实现更低延迟的服务。
- 量化变体:FP8(https://huggingface.co/poolside/Laguna-S-2.1-FP8)、NVFP4(https://huggingface.co/poolside/Laguna-S-2.1-NVFP4)、INT4(https://huggingface.co/poolside/Laguna-S-2.1-INT4)和 GGUF(https://huggingface.co/poolside/Laguna-S-2.1-GGUF)。
- OpenMDW-1.1 许可证:允许自由地将模型及其相关材料用于商业和非商业目的(了解关于 OpenMDW(https://openmdw.ai/)的更多信息)。
模型概述
- 参数量:总共 118B,每个 Token 激活约 8B
- 层数:48(12 个全局注意力层,36 个滑动窗口注意力层)
- 专家数:256 个路由专家(取 top-10)加 1 个共享专家
- 注意力机制:分组查询,8 个 KV 头,头维度 128;每头 softplus 输出门控
- 滑动窗口:512 个 Token
- 上下文窗口:1,048,576 个 Token
- 词表:100,352 个 Token(Laguna 系列分词器)
- 模态:文本到文本
- 推理:交错思考并保留思考过程
基准测试结果
| 模型 | 大小 | Terminal-Bench 2.1 | SWE-bench Multilingual | SWE-Bench Pro (Public Dataset) | DeepSWE | SWE Atlas (代码库问答) | Toolathlon Verified |
|---|---|---|---|---|---|---|---|
| Laguna S 2.1 | 118B-A8B | 70.2% | 78.5% | 59.4% | 40.4% | 46.2% | 49.7% |
| Tencent Hy3 | 295B-A21B | 71.7% | 75.8% | 57.9% | - | - | - |
| Inkling9 | 75B-A41B | 63.8% | - | 54.3% | - | - | 45.5%* |
| Nemotron 3 Ultra | 550B-A55B | 56.4% | 67.7% | - | - | - | 34.3%* |
| DeepSeek-V4-Pro Max | 1.6T-A49B | 64.0%* | 76.2% | 55.4% | 9.0%* | 27.2%* | 55.9%* |
| Kimi K3 | 2800B-A50B | 88.3% | - | - | - | 69% | - |
| Qwen 3.7 Max | - | 74.5%* | 78.3% | 60.6% | - | - | - |
| Muse Spark 1.1 | - | 80% | - | 61.5% | 53.3% | 42.2%* | 75.6% |
| Claude Fable 5 | - | 88% | - | 80.3% | 70% | - | - |
基准测试截至 2026 年 7 月 21 日。Laguna S 2.1 以粗体显示;破折号(-)表示该模型未在该基准上进行评估。标有 * 的分数由第三方报告:Terminal-Bench 2.1 和 DeepSWE 来自 Artificial Analysis,SWE Atlas 来自 Scale AI 的官方排行榜,Toolathlon Verified 来自其官方排行榜。完整评估轨迹:trajectories.poolside.ai(https://trajectories.poolside.ai/)。
使用方法
Laguna S 2.1 使用与 Laguna XS 2.1 相同的 laguna 架构,因此引擎集成方式相同(vLLM、SGLang、Transformers、TRT-LLM、llama.cpp)。对于 118B 参数规模的 BF16 检查点,需要多个 GPU(约 236GB 权重);量化变体可大幅降低此需求。
vLLM
vllm serve \
--model poolside/Laguna-S-2.1 \
--tensor-parallel-size 4 \
--tool-call-parser poolside_v1 \
--reasoning-parser poolside_v1 \
--enable-auto-tool-choice \
--served-model-name laguna \
--default-chat-template-kwargs '{"enable_thinking": true}'
可选:使用 DFlash 进行推测解码。 通过添加
--speculative-config '{"model":"poolside/Laguna-S-2.1-DFlash","num_speculative_tokens":7,"method":"dflash"}'来搭配 Laguna S 2.1 DFlash 草稿模型(https://huggingface.co/poolside/Laguna-S-2.1-DFlash)使用。
SGLang
python -m sglang.launch_server \
--model-path poolside/Laguna-S-2.1 \
--tp-size 4 \
--reasoning-parser poolside_v1 \
--tool-call-parser poolside_v1 \
--trust-remote-code
TRT-LLM
trtllm-serve poolside/Laguna-S-2.1 --trust-remote-code \
--tool_parser poolside_v1 --reasoning_parser laguna
注意,标志名称与 vLLM 不同(--tool_parser,推理解析器是 laguna,而非 poolside_v1)。
llama.cpp
GGUF 转换版本可在 poolside/Laguna-S-2.1-GGUF(https://huggingface.co/poolside/Laguna-S-2.1-GGUF)处获取。使用 poolside 的 llama.cpp 分支(分支 laguna(https://github.com/poolsideai/llama.cpp/tree/laguna))提供服务,该分支包含完整的 Laguna 支持,包括 DFlash 推测解码。(基础的 Laguna 支持也正在上游审查中:ggml-org/llama.cpp#25165(https://github.com/ggml-org/llama.cpp/pull/25165)。)
git clone --branch laguna https://github.com/poolsideai/llama.cpp
cd llama.cpp && cmake -B build && cmake --build build -j
./build/bin/llama-server -m laguna-s-2.1-Q4_K_M.gguf --jinja --port 8000
# 使用 DFlash 推测解码:
./build/bin/llama-server -m laguna-s-2.1-Q4_K_M.gguf \
-md laguna-s-2.1-DFlash-BF16.gguf \
--spec-type draft-dflash --spec-draft-n-max 15 -fa on --jinja --port 8000
控制推理行为
Laguna S 2.1 具有原生推理支持,并且在使用保留思考的情况下效果最佳:在消息历史中保留先前助手消息中的 reasoning_content。模型通常会在调用工具之前以及工具调用之间进行推理,如果丢弃了先前的思考块,模型可能会在后续步骤中停止推理。
通过聊天模板在每个请求中控制思考行为:
extra_body={"chat_template_kwargs": {"enable_thinking": False}}
或在服务器级别使用 --default-chat-template-kwargs '{"enable_thinking": true}'。对于智能体编码用例,我们建议启用思考功能并在消息历史中保留推理内容。
许可证
本模型使用 OpenMDW-1.1 许可证(https://huggingface.co/poolside/Laguna-S-2.1/blob/main/LICENSE.md)授权。
预期与责任使用
Laguna S 2.1 专为软件工程和智能体编码用例设计,您有责任确认其适合您的预期应用。Laguna S 2.1 受 OpenMDW-1.1 许可证(https://huggingface.co/poolside/Laguna-S-2.1/blob/main/LICENSE.md)约束,并应与 Poolside 的可接受使用政策(https://poolside.ai/legal/acceptable-use-policy)一致使用。我们建议不要绕过 Laguna S 2.1 的安全护栏,除非您针对您的用例实施了实质等效的缓解措施。
请将安全漏洞或安全问题报告至 [email protected]。
相似文章
poolside/Laguna-S-2.1-GGUF
Poolside发布了Laguna S 2.1 AI模型的GGUF量化版本,包括一个DFlash投机解码草稿模型,支持通过llama.cpp进行高效的本地推理。
介绍 Laguna XS 2.1(5分钟阅读)
Poolside 发布 Laguna XS 2.1,这是一个 33B 参数的混合专家模型,每个 token 激活 3B 参数,专为智能编码设计,在 SWE-bench Multilingual 及其他基准测试上有所改进,现已在宽松的 OpenMDW-1.1 许可证下提供。
Laguna S 2.1
Poolside发布Laguna S 2.1,一个总参数量118B的混合专家(MoE)模型,每个token激活8B参数,支持长达100万token的上下文,在长周期编程基准测试中取得了有竞争力的成绩,并被誉为同重量级中最具能力的自主编程模型。
poolside/Laguna-S-2.1-NVFP4
Poolside发布了Laguna S 2.1,这是一个1176亿参数的混合专家(MoE)模型,其中85亿参数被激活,专为智能体编程设计,具备滑动窗口注意力、原生推理支持和本地部署能力。
Laguna S 2.1 循环修复即将到来
Poolside 发布了 Laguna S 2.1,这是他们最擅长处理长周期任务的模型,同时在 Hugging Face 上提供了多种量化变体(FP8、NVFP4、INT4、DFlash、GGUF)。