poolside/Laguna-S-2.1-GGUF
摘要
Poolside发布了Laguna S 2.1 AI模型的GGUF量化版本,包括一个DFlash投机解码草稿模型,支持通过llama.cpp进行高效的本地推理。
查看缓存全文
缓存时间: 2026/07/22 14:18
poolside/Laguna-S-2.1-GGUF · Hugging Face
Source: https://huggingface.co/poolside/Laguna-S-2.1-GGUF poolside-banner
在 OpenRouter 上使用 (https://openrouter.ai/poolside/laguna-s-2.1) · 在 Vercel AI Gateway 上使用 (https://vercel.com/ai-gateway/models/laguna-s-2.1) · 发布博客文章 (https://poolside.ai/blog/introducing-laguna-s-2-1)
这是为 llama.cpp 准备的 Laguna S 2.1 (https://huggingface.co/poolside/Laguna-S-2.1) 的 GGUF 转换版本,还包括 DFlash 推测解码草稿模型。有关架构细节、许可证和使用指导,请参阅基础模型卡片 (https://huggingface.co/poolside/Laguna-S-2.1)。
https://huggingface.co/poolside/Laguna-S-2.1-GGUF#filesFiles
文件大小备注laguna\-s\-2\.1\-F16\.gguf235 GB全精度laguna\-s\-2\.1\-Q8\_0\.gguf128 GBlaguna\-s\-2\.1\-Q4\_K\_M\.gguf75 GBimatrix 量化laguna\-s\-2\.1\-DFlash\-BF16\.gguf2.2 GB用于推测解码的 DFlash 草稿模型laguna\-s\-2\.1\.imatrix0.4 GB用于 K 量化的重要性矩阵
https://huggingface.co/poolside/Laguna-S-2.1-GGUF#servingServing
服务
使用 Poolside 的 llama.cpp 分支 laguna (https://github.com/poolsideai/llama.cpp/tree/laguna) 提供服务,该分支完全支持 Laguna,包括 DFlash 推测解码。(基础 Laguna 支持也正在上游审查中:ggml-org/llama.cpp#25165 (https://github.com/ggml-org/llama.cpp/pull/25165)。)
git clone --branch laguna https://github.com/poolsideai/llama.cpp
cd llama.cpp && cmake -B build && cmake --build build -j
./build/bin/llama-server -m laguna-s-2.1-Q4_K_M.gguf --jinja --port 8000
# 使用 DFlash 推测解码:
./build/bin/llama-server -m laguna-s-2.1-Q4_K_M.gguf \
-md laguna-s-2.1-DFlash-BF16.gguf \
--spec-type draft-dflash --spec-draft-n-max 15 -fa on --jinja --port 8000
https://huggingface.co/poolside/Laguna-S-2.1-GGUF#context-lengthContext length
上下文长度
这些 GGUF 文件默认配置为 262,144 个 token(256K)的上下文窗口。这是我们推荐以获得最佳输出质量的配置。
权重本身是原生 1M 检查点:训练包含一个长达 1,048,576 个 token 的长上下文扩展阶段。要在 llama.cpp 中使用超过 256K 的上下文,请在加载时覆盖 rope 配置:
--ctx-size 1048576 --rope-scaling yarn --rope-scale 128 --yarn-orig-ctx 8192
使用 1M 配置时可能会遇到质量下降。如果使用,我们建议使用 --temp 0.7 --top-p 0.95 进行采样。
此版本还修正了嵌入的 yarn_attn_factor 元数据(现为 1.0;llama.cpp 内部计算 YaRN 注意力缩放)。
相似文章
poolside/Laguna-S-2.1-NVFP4
Poolside发布了Laguna S 2.1,这是一个1176亿参数的混合专家(MoE)模型,其中85亿参数被激活,专为智能体编程设计,具备滑动窗口注意力、原生推理支持和本地部署能力。
Laguna S 2.1 循环修复即将到来
Poolside 发布了 Laguna S 2.1,这是他们最擅长处理长周期任务的模型,同时在 Hugging Face 上提供了多种量化变体(FP8、NVFP4、INT4、DFlash、GGUF)。
Unsloth 推出的 Laguna S 2.1 量化版本已发布
Unsloth 发布了 Laguna S 2.1 Mixture-of-Experts 模型的 GGUF 量化版本。该模型是一个拥有 118B 参数(8B 激活参数)的编码模型,具备 1M 上下文窗口和智能体能力。量化版本支持高效的本地部署。
poolside/Laguna-S-2.1 发布!终于出现了一个令人瞩目的120B参数竞争者!
poolside发布了Laguna-S-2.1,一个拥有1200亿参数的新语言模型,在大语言模型领域成为强有力的竞争者。
poolside/Laguna-XS.2
Poolside 发布 Laguna XS.2,这是一个拥有 33B 总参数、3B 激活参数的 MoE 模型,专为智能体编码设计,可在配备 36GB RAM 的 Mac 上本地部署。