Unsloth 推出的 Laguna S 2.1 量化版本已发布

Reddit r/LocalLLaMA 模型

摘要

Unsloth 发布了 Laguna S 2.1 Mixture-of-Experts 模型的 GGUF 量化版本。该模型是一个拥有 118B 参数(8B 激活参数)的编码模型,具备 1M 上下文窗口和智能体能力。量化版本支持高效的本地部署。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/07/22 04:17

unsloth/Laguna-S-2.1-GGUF · Hugging Face

来源:https://huggingface.co/unsloth/Laguna-S-2.1-GGUF

使用 llama.cpp(PR #25165)运行 Unsloth 的 UD-Q4_K_XL 量化版本

本仓库中的 GGUF 文件是使用 Unsloth Dynamic 2.0(https://docs.unsloth.ai/basics/unsloth-dynamic-2.0-ggufs)量化格式(经 imatrix 校准)生成的。对 Laguna 的支持尚未进入已标记的 llama.cpp 版本,因此需要从 ggml-org/llama.cpp#25165(https://github.com/ggml-org/llama.cpp/pull/25165)构建 llama.cpp:

git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
gh pr checkout 25165
# 使用 CUDA 构建(移除 -DGGML_CUDA=ON 可得到仅 CPU 版本)
cmake -B build -DGGML_CUDA=ON
cmake --build build -j --config Release --target llama-cli llama-server
cd ..

下载 UD-Q4_K_XL 分片(约 40GB,分为 3 个文件):

huggingface-cli download unsloth/Laguna-S-2.1-GGUF \
  --include "UD-Q4_K_XL/*" \
  --local-dir Laguna-S-2.1-GGUF

使用 llama-server 提供服务(仅传入第一个分片;其余分片会自动加载):

./llama.cpp/build/bin/llama-server \
    --model Laguna-S-2.1-GGUF/UD-Q4_K_XL/Laguna-S-2.1-UD-Q4_K_XL-00001-of-00003.gguf \
    --jinja -fa on -ngl 99 --ctx-size 16384 --port 8000

或使用 llama-cli 进行一次性生成:

./llama.cpp/build/bin/llama-cli \
    --model Laguna-S-2.1-GGUF/UD-Q4_K_XL/Laguna-S-2.1-UD-Q4_K_XL-00001-of-00003.gguf \
    --jinja -ngl 99 -p "用 Python 编写一个 Flappy Bird 游戏。"

-ngl 99 将所有层卸载到 GPU;如果显存不足,请降低(或移除)此值。UD-Q4_K_XL 约为 40GB,因此可以放在单个 48GB+ 的 GPU 上,或跨多个 GPU 分布。

poolside-banner

在 OpenRouter 上使用(https://openrouter.ai/poolside/laguna-s-2.1)·在 Vercel AI Gateway 上使用(https://vercel.com/ai-gateway/models/laguna-s-2.1)·发布博客文章(https://poolside.ai/blog/introducing-laguna-s-2-1)

Laguna S 2.1 是一个拥有 118B 总参数、每个 token 激活 8B 参数的专家混合(MoE)模型,专为智能体编码和长周期任务设计。它在 Laguna 系列中介于 Laguna XS 2.1(https://huggingface.co/poolside/Laguna-XS-2.1)(33B-A3B)和 Laguna M.1(225B-A23B)之间,并共享相同的架构配方:一个使用 softplus 门控的 token 选择路由器,包含 256 个路由专家和 1 个共享专家,分组查询注意力机制,以及交错的全局/滑动窗口注意力。

主要亮点

  • 混合 SWA 和全局注意力布局:48 层,全局注意力与 SWA 比例为 1:3(12 个全局注意力层,36 个滑动窗口层,窗口大小为 512),使用 softplus 注意力门控和每层类型的旋转缩放。
  • 1M 上下文:1,048,576 token 的上下文窗口。
  • 原生推理支持:在工具调用之间交错思考,通过 enable_thinking 实现每个请求的控制。
  • 推测解码:提供经过训练的 DFlash 草稿模型(https://huggingface.co/poolside/Laguna-S-2.1-DFlash),可实现更低延迟的服务。
  • 量化变体:FP8(https://huggingface.co/poolside/Laguna-S-2.1-FP8)、NVFP4(https://huggingface.co/poolside/Laguna-S-2.1-NVFP4)、INT4(https://huggingface.co/poolside/Laguna-S-2.1-INT4)和 GGUF(https://huggingface.co/poolside/Laguna-S-2.1-GGUF)。
  • OpenMDW-1.1 许可证:允许自由地将模型及其相关材料用于商业和非商业目的(了解关于 OpenMDW(https://openmdw.ai/)的更多信息)。

模型概述

  • 参数量:总共 118B,每个 Token 激活约 8B
  • 层数:48(12 个全局注意力层,36 个滑动窗口注意力层)
  • 专家数:256 个路由专家(取 top-10)加 1 个共享专家
  • 注意力机制:分组查询,8 个 KV 头,头维度 128;每头 softplus 输出门控
  • 滑动窗口:512 个 Token
  • 上下文窗口:1,048,576 个 Token
  • 词表:100,352 个 Token(Laguna 系列分词器)
  • 模态:文本到文本
  • 推理:交错思考并保留思考过程

基准测试结果

模型大小Terminal-Bench 2.1SWE-bench MultilingualSWE-Bench Pro (Public Dataset)DeepSWESWE Atlas (代码库问答)Toolathlon Verified
Laguna S 2.1118B-A8B70.2%78.5%59.4%40.4%46.2%49.7%
Tencent Hy3295B-A21B71.7%75.8%57.9%---
Inkling975B-A41B63.8%-54.3%--45.5%*
Nemotron 3 Ultra550B-A55B56.4%67.7%---34.3%*
DeepSeek-V4-Pro Max1.6T-A49B64.0%*76.2%55.4%9.0%*27.2%*55.9%*
Kimi K32800B-A50B88.3%---69%-
Qwen 3.7 Max-74.5%*78.3%60.6%---
Muse Spark 1.1-80%-61.5%53.3%42.2%*75.6%
Claude Fable 5-88%-80.3%70%--

基准测试截至 2026 年 7 月 21 日。Laguna S 2.1 以粗体显示;破折号(-)表示该模型未在该基准上进行评估。标有 * 的分数由第三方报告:Terminal-Bench 2.1 和 DeepSWE 来自 Artificial Analysis,SWE Atlas 来自 Scale AI 的官方排行榜,Toolathlon Verified 来自其官方排行榜。完整评估轨迹:trajectories.poolside.ai(https://trajectories.poolside.ai/)。

使用方法

Laguna S 2.1 使用与 Laguna XS 2.1 相同的 laguna 架构,因此引擎集成方式相同(vLLM、SGLang、Transformers、TRT-LLM、llama.cpp)。对于 118B 参数规模的 BF16 检查点,需要多个 GPU(约 236GB 权重);量化变体可大幅降低此需求。

vLLM

vllm serve \
    --model poolside/Laguna-S-2.1 \
    --tensor-parallel-size 4 \
    --tool-call-parser poolside_v1 \
    --reasoning-parser poolside_v1 \
    --enable-auto-tool-choice \
    --served-model-name laguna \
    --default-chat-template-kwargs '{"enable_thinking": true}'

可选:使用 DFlash 进行推测解码。 通过添加 --speculative-config '{"model":"poolside/Laguna-S-2.1-DFlash","num_speculative_tokens":7,"method":"dflash"}' 来搭配 Laguna S 2.1 DFlash 草稿模型(https://huggingface.co/poolside/Laguna-S-2.1-DFlash)使用。

SGLang

python -m sglang.launch_server \
  --model-path poolside/Laguna-S-2.1 \
  --tp-size 4 \
  --reasoning-parser poolside_v1 \
  --tool-call-parser poolside_v1 \
  --trust-remote-code

TRT-LLM

trtllm-serve poolside/Laguna-S-2.1 --trust-remote-code \
    --tool_parser poolside_v1 --reasoning_parser laguna

注意,标志名称与 vLLM 不同(--tool_parser,推理解析器是 laguna,而非 poolside_v1)。

llama.cpp

GGUF 转换版本可在 poolside/Laguna-S-2.1-GGUF(https://huggingface.co/poolside/Laguna-S-2.1-GGUF)处获取。使用 poolside 的 llama.cpp 分支(分支 laguna(https://github.com/poolsideai/llama.cpp/tree/laguna))提供服务,该分支包含完整的 Laguna 支持,包括 DFlash 推测解码。(基础的 Laguna 支持也正在上游审查中:ggml-org/llama.cpp#25165(https://github.com/ggml-org/llama.cpp/pull/25165)。)

git clone --branch laguna https://github.com/poolsideai/llama.cpp
cd llama.cpp && cmake -B build && cmake --build build -j

./build/bin/llama-server -m laguna-s-2.1-Q4_K_M.gguf --jinja --port 8000

# 使用 DFlash 推测解码:
./build/bin/llama-server -m laguna-s-2.1-Q4_K_M.gguf \
  -md laguna-s-2.1-DFlash-BF16.gguf \
  --spec-type draft-dflash --spec-draft-n-max 15 -fa on --jinja --port 8000

控制推理行为

Laguna S 2.1 具有原生推理支持,并且在使用保留思考的情况下效果最佳:在消息历史中保留先前助手消息中的 reasoning_content。模型通常会在调用工具之前以及工具调用之间进行推理,如果丢弃了先前的思考块,模型可能会在后续步骤中停止推理。

通过聊天模板在每个请求中控制思考行为:

extra_body={"chat_template_kwargs": {"enable_thinking": False}}

或在服务器级别使用 --default-chat-template-kwargs '{"enable_thinking": true}'。对于智能体编码用例,我们建议启用思考功能并在消息历史中保留推理内容。

许可证

本模型使用 OpenMDW-1.1 许可证(https://huggingface.co/poolside/Laguna-S-2.1/blob/main/LICENSE.md)授权。

预期与责任使用

Laguna S 2.1 专为软件工程和智能体编码用例设计,您有责任确认其适合您的预期应用。Laguna S 2.1 受 OpenMDW-1.1 许可证(https://huggingface.co/poolside/Laguna-S-2.1/blob/main/LICENSE.md)约束,并应与 Poolside 的可接受使用政策(https://poolside.ai/legal/acceptable-use-policy)一致使用。我们建议不要绕过 Laguna S 2.1 的安全护栏,除非您针对您的用例实施了实质等效的缓解措施。

请将安全漏洞或安全问题报告至 [email protected]

相似文章

poolside/Laguna-S-2.1-GGUF

Hugging Face Models Trending

Poolside发布了Laguna S 2.1 AI模型的GGUF量化版本,包括一个DFlash投机解码草稿模型,支持通过llama.cpp进行高效的本地推理。

介绍 Laguna XS 2.1(5分钟阅读)

TLDR AI

Poolside 发布 Laguna XS 2.1,这是一个 33B 参数的混合专家模型,每个 token 激活 3B 参数,专为智能编码设计,在 SWE-bench Multilingual 及其他基准测试上有所改进,现已在宽松的 OpenMDW-1.1 许可证下提供。

Laguna S 2.1

Hacker News Top

Poolside发布Laguna S 2.1,一个总参数量118B的混合专家(MoE)模型,每个token激活8B参数,支持长达100万token的上下文,在长周期编程基准测试中取得了有竞争力的成绩,并被誉为同重量级中最具能力的自主编程模型。

poolside/Laguna-S-2.1-NVFP4

Hugging Face Models Trending

Poolside发布了Laguna S 2.1,这是一个1176亿参数的混合专家(MoE)模型,其中85亿参数被激活,专为智能体编程设计,具备滑动窗口注意力、原生推理支持和本地部署能力。

Laguna S 2.1 循环修复即将到来

Reddit r/LocalLLaMA

Poolside 发布了 Laguna S 2.1,这是他们最擅长处理长周期任务的模型,同时在 Hugging Face 上提供了多种量化变体(FP8、NVFP4、INT4、DFlash、GGUF)。