poolside/Laguna-S-2.1-NVFP4
摘要
Poolside发布了Laguna S 2.1,这是一个1176亿参数的混合专家(MoE)模型,其中85亿参数被激活,专为智能体编程设计,具备滑动窗口注意力、原生推理支持和本地部署能力。
任务:text-generation
标签:vllm, safetensors, laguna, laguna-s-2.1, text-generation, conversational, custom_code, base_model:poolside/Laguna-S-2.1, base_model:quantized:poolside/Laguna-S-2.1, license:openmdw-1.1, 8-bit, compressed-tensors, region:us
查看缓存全文
缓存时间: 2026/07/22 14:18
poolside/Laguna-S-2.1-NVFP4 · Hugging Face 来源:https://huggingface.co/poolside/Laguna-S-2.1-NVFP4 poolside-banner 在 OpenRouter 上使用 (https://openrouter.ai/poolside/laguna-s-2.1)·在 Vercel AI Gateway 上使用 (https://vercel.com/ai-gateway/models/laguna-s-2.1)·发布博客文章 (https://poolside.ai/blog/introducing-laguna-s-2-1) Laguna S 2.1-NVFP4 是一个总参数量为 117.6B 的混合专家(Mixture-of-Experts)模型,每个 token 激活 8.5B 参数,专为本地机器上的代理编码和长周期任务设计。它在 48 层中的 36 层使用了每头门控的滑动窗口注意力,以实现快速推理和较低的 KV 缓存需求。 ## https://huggingface.co/poolside/Laguna-S-2.1-NVFP4#highlights亮点 - 混合 SWA 与全局注意力布局:Laguna S 2.1 使用 softplus 门控和逐层旋转缩放,在 48 层中以 3:1 的比例混合了 SWA(滑动窗口注意力)和全局注意力层 - FP8 格式的 KV 缓存:KV 缓存量化至 FP8,减少了每个 token 的内存占用 - 原生推理支持:支持在工具调用之间交错思考,并可按请求启用或禁用思考 - 本地部署就绪:总参数量 117.6B,激活 8.5B,NVFP4 权重约为 71 GB。可在Ollama (https://ollama.com/laguna-s-2.1)和llama.cpp (https://github.com/ggml-org/llama.cpp/pull/25165)上使用(仅 BF16 和 Q4_K_M) - OpenMDW-1.1 许可证:允许自由地将模型及相关材料用于商业和非商业目的(了解更多关于 OpenMDW (https://openmdw.ai/)) — ## https://huggingface.co/poolside/Laguna-S-2.1-NVFP4#model-overview模型概述 - 训练:预训练、后训练和强化学习阶段 - 参数数量:总参数量 117.6B,每个 token 激活 8.5B - 优化器:Muon - 层数:48 层(12 层全局注意力,36 层滑动窗口注意力) - 专家数量:256 个专家,其中 1 个共享专家 - 滑动窗口:512 个 token - 模态:文本到文本 - 上下文窗口:262,144 个 token - 推理支持:保留推理过程的交错思考 ## https://huggingface.co/poolside/Laguna-S-2.1-NVFP4#benchmark-results基准测试结果 benchmarks模型尺寸Terminal-Bench 2.1SWE-bench MultilingualSWE-Bench Pro (Public Dataset)DeepSWESWE Atlas (Codebase QnA)Toolathlon VerifiedLaguna S 2.1118B-A8B70.2%****78.5%****59.4%****40.4%****46.2%****49.7%Tencent Hy3295B-A21B71.7%75.8%57.9%---Inkling975B-A41B63.8%-54.3%--45.5%*Nemotron 3 Ultra550B-A55B56.4%67.7%---34.3%*DeepSeek-V4-Pro Max1.6T-A49B64.0%*76.2%55.4%9.0%*27.2%*55.9%*Kimi K32800B-A50B88.3%--69%--Qwen 3.7 Max-74.5%*78.3%60.6%---Muse Spark 1.1-80%-61.5%53.3%42.2%*75.6%Claude Fable 5-88%-80.3%70%-- 基准测试数据截至 2026 年 7 月 21 日。Laguna S 2.1 以粗体显示;短划线(-)表示该模型未在该基准上进行评估。带 * 的分数由第三方报告:Terminal-Bench 2.1 和 DeepSWE 来自 Artificial Analysis,SWE Atlas 来自 Scale AI 的官方排行榜,Toolathlon Verified 来自其官方排行榜。完整的评估轨迹:trajectories.poolside.ai (https://trajectories.poolside.ai/)。 ## https://huggingface.co/poolside/Laguna-S-2.1-NVFP4#usage用法 ### https://huggingface.co/poolside/Laguna-S-2.1-NVFP4#context-length上下文长度 此检查点配置为 262,144 token(256K)的上下文窗口。这是我们为达到最佳输出质量而推荐的配置。权重本身支持原生 1M 上下文:训练阶段包含了长达 1,048,576 token 的长上下文扩展阶段,并且量化是在 1M 配置下校准的。如果您需要超过 256K 的上下文,可以通过编辑 config.json 恢复 1M 配置: "rope_parameters": { "full_attention": { "factor": 128.0, "attention_factor": 1.4852030263919618 } }, "max_position_embeddings": 1048576 使用 1M 配置时,您可能会遇到质量下降。如果使用此配置,我们建议使用 temperature <= 0.7 和 top_p <= 0.95 进行采样。 ### https://huggingface.co/poolside/Laguna-S-2.1-NVFP4#recommended-sampling推荐采样 为了在质量和可靠性之间取得最佳平衡,我们建议使用 temperature 0.7 和 top_p 0.95 进行采样。 ### https://huggingface.co/poolside/Laguna-S-2.1-NVFP4#local-deployment本地部署 感谢 NVIDIA 团队的支持,Laguna S 2.1-NVFP4 在 vLLM、SGLang、Transformers 和 TRT-LLM 中均受支持。 请在本地机器上使用 Ollama(支持 MLX)或 Llama.cpp(仅 BF16 和 Q4_K_M)以获得最佳效果。 #### https://huggingface.co/poolside/Laguna-S-2.1-NVFP4#vllmvLLM > 服务需要 vLLM 0.25.0 或更高版本。完整的配方请参见主 Laguna S 2.1 模型卡。完整的 vLLM 配方位于主 Laguna S 2.1 模型卡和 vLLM 配方页面上。量化会从此检查点的 quantization_config 中自动检测,因此使用 poolside/Laguna-S-2.1-NVFP4 替换模型 ID 即可使用相同的命令。无需额外标志。 > 可选:使用 DFlash 进行推测解码。 通过添加 --speculative-config '{"model":"poolside/Laguna-S-2.1-DFlash-NVFP4","num_speculative_tokens":15,"method":"dflash"}' 到服务命令中,与量化匹配的草稿模型配合使用。 #### https://huggingface.co/poolside/Laguna-S-2.1-NVFP4#dgx-spark–mac-studioDGX Spark & Mac Studio Ollama 是在单个 128 GB 设备(无论是 NVIDIA DGX Spark(GB10)还是 Apple Silicon Mac Studio)上运行 Laguna S 2.1 的最快方式: ollama run laguna-s-2.1 它会拉取 Q4_K_M GGUF(约 75 GB)并在 Spark 的 GB10 GPU 上或 Mac 的 Metal 上运行,无需构建步骤。我们测量到在 Spark 上约为 12.6 token/s,在 Apple Silicon 上约为 17.6 token/s。 - 您需要大约 128 GB 的统一内存;Q4_K_M 权重本身约为 75 GB。 - 首次加载会从磁盘读取 75 GB,可能会超过 Ollama 默认的 5 分钟超时。如果发生这种情况,请设置 OLLAMA_LOAD_TIMEOUT=20m。 - 默认启用推理。在请求中传递 "think": false 可将其关闭。 - 更高保真度的标签需要更大的设备:laguna-s-2.1:q8_0 约为 128 GB(因此需要 192 GB 的 Mac Studio),laguna-s-2.1:f16 约为 235 GB(需要 256 GB 或更多)。在 Spark 的 128 GB 上,请坚持使用 Q4_K_M。Apple Silicon 也可以通过 MLX 运行它。 - Ollama 基于 llama.cpp 构建。如果您想自行构建运行时,poolside 的 llama.cpp 的 laguna 分支提供了相同的 GGUF 文件。 在 DGX Spark 上实现最大性能(原生 NVFP4 + DFlash) 为了在 Spark 上获得最快的设置,请改为使用 vLLM 服务此检查点。这将提供原生 NVFP4 内核和 DFlash 推测解码。 一次性设置: # Python 头文件:Triton JIT 需要它们,而 DGX 操作系统未附带它们。 # 如果没有这个,第一次服务器启动会在 triton/runtime/build.py 中失败。 sudo apt install -y python3.12-dev curl -LsSf https://astral.sh/uv/install.sh | sh uv venv ~/venvs/vllm025 -p 3.12 # vLLM 0.25.1 with CUDA-13 torch (aarch64 wheels are on PyPI) uv pip install -p ~/venvs/vllm025 vllm==0.25.1 --torch-backend=cu130 # FlashInfer nightly trio: without flashinfer-python the NVFP4 path is not # native; the jit-cache wheel avoids most first-start JIT compilation. uv pip install -p ~/venvs/vllm025 \ "flashinfer-python==0.6.15.dev20260712" \ "flashinfer-cubin==0.6.15.dev20260712" \ "flashinfer-jit-cache==0.6.15.dev20260712" \ --extra-index-url https://flashinfer.ai/whl/nightly/ \ --extra-index-url https://flashinfer.ai/whl/nightly/cu130/ \ --index-strategy unsafe-best-match hf download poolside/Laguna-S-2.1-NVFP4 hf download poolside/Laguna-S-2.1-DFlash-NVFP4 # 73 GB total 服务: export CUTE_DSL_ARCH=sm_121a # FP4 内核 JIT 的架构字符串 export PATH=/usr/local/cuda/bin:$PATH # nvcc for JIT export MAX_JOBS=4 # 限制 JIT 的并发数;参见下面的警告 source ~/venvs/vllm025/bin/activate vllm serve poolside/Laguna-S-2.1-NVFP4 \ --speculative-config '{"model":"poolside/Laguna-S-2.1-DFlash-NVFP4","num_speculative_tokens":15}' \ --enable-auto-tool-choice \ --tool-call-parser poolside_v1 \ --reasoning-parser poolside_v1 \ --override-generation-config '{"temperature":0.7,"top_p":0.95}' \ --max-num-seqs 32 \ --max-model-len 262144 \ --gpu-memory-utilization 0.85 \ --host 0.0.0.0 --port 8000 - 您不需要后端标志:自动选择会选取 FlashInferCutlass,它在 sm_121 上原生运行。不要在 0.25.1 上设置 --linear-backend flashinfer_b12x;该选项在此版本中存在缺陷,并且速度更慢。 - 保留 --override-generation-config。许多客户端不发送采样参数,原始的默认值会在 NVFP4 量化上降低输出质量。模型的 generation_config.json 设置了 top_k 20(经过评估认证的截断),可以处理这种情况。不要添加 min_p:vLLM 会在推测解码下拒绝 min_p 和 logit_bias,因此将其放入默认值会在每次采样请求时返回 400 错误。 - --max-num-seqs 32 是必需的:DFlash 在默认的 256 下会导致 vLLM 崩溃。 - 第一次启动大约需要 15 分钟(从 NVMe 加载权重、JIT 和图捕获)。 > 切勿在冷 ~/.cache/flashinfer 上取消设置 MAX_JOBS=4。未限制的 nvcc 并发可能会耗尽 128 GB 的统一内存并使整个机器宕机。预热缓存后,该设置变为无操作,但在配置或形状更改后缓存会再次变冷。 Prefill 运行速度约为 600-800 tok/s,解码在散文上约为 15 tok/s,在代码上约为 22-24 tok/s,DFlash 每步接受 2.9-3.1 个 token。在 256K 设置下,您将获得 830-870K 的 KV token。同时处理两个请求大约会使总吞吐量翻倍。在没有推测的情况下,解码在 GB10 上我们尝试的每个引擎上都停留在 13-14 tok/s,这是该模型的内存带宽上限。推测是突破这一限制的方法。 针对设备的 pool CLI: POOLSIDE_STANDALONE_BASE_URL=http://:8000/v1 \ POOLSIDE_STANDALONE_MODEL=poolside/Laguna-S-2.1-NVFP4 \ POOLSIDE_STANDALONE_CONTEXT_LENGTH=262144 \ POOLSIDE_API_KEY=dummy pool 使用设备的 IPv4 地址而不是 .local mDNS 名称:Go 的解析器可能选择链路本地 IPv6 并因“没有到主机的路由”而失败。在 macOS 上,终端应用需要本地网络权限,系统 curl 不受此检查限制,因此如果 curl 工作但 pool 不工作,则是权限问题而非网络问题。 #### https://huggingface.co/poolside/Laguna-S-2.1-NVFP4#sglangSGLang Laguna S 2.1 在 SGLang 中通过 sgl-project/sglang#24204 得到支持。量化会从 quantization_config 自动检测,因此无需额外标志。请参阅 SGLang cookbook 条目和主 Laguna S 2.1 模型卡以获取服务配方。 #### https://huggingface.co/poolside/Laguna-S-2.1-NVFP4#transformersTransformers 完整的 Transformers 配方位于主 Laguna S 2.1 模型卡上。将模型 ID 替换为 poolside/Laguna-S-2.1-NVFP4;量化会从 quantization_config 自动检测。 #### https://huggingface.co/poolside/Laguna-S-2.1-NVFP4#trt-llmTRT-LLM Laguna S 2.1 支持随 TensorRT-LLM >=1.3.0rc16 提供;有关安装配方,请参见主 Laguna S 2.1 模型卡。将模型 ID 替换为 poolside/Laguna-S-2.1-NVFP4;量化会从 quantization_config 自动检测,无需额外标志。 from tensorrt_llm import LLM llm = LLM(model="poolside/Laguna-S-2.1-NVFP4", trust_remote_code=True) #### https://huggingface.co/poolside/Laguna-S-2.1-NVFP4#ollamaOllama 在 Ollama 库上可用。 ## https://huggingface.co/poolside/Laguna-S-2.1-NVFP4#controlling-reasoning控制推理 Laguna S 2.1-NVFP4 使用与基础模型相同的推理控制方式(交错思考、保留推理过程和 enable_thinking 标志)。请参见主 Laguna S 2.1 模型卡的“控制推理”部分。 ## https://huggingface.co/poolside/Laguna-S-2.1-NVFP4#license许可证 本模型基于 OpenMDW-1.1 许可证授权。 ## https://huggingface.co/poolside/Laguna-S-2.1-NVFP4#intended-and-responsible-use预期与负责任的使用 Laguna S 2.1-NVFP4 专为软件工程和代理编码用例而设计,您有责任确认它是否适合您的预期应用。Laguna S 2.1-NVFP4 受 OpenMDW-1.1 许可证约束,并且应与 Poolside 的可接受使用政策一致使用。我们建议不要在没有为您的用例实施相当有效的缓解措施的情况下绕过 Laguna S 2.1-NVFP4 的安全护栏。请将安全漏洞或安全问题报告至 [email protected]。
相似文章
Laguna S 2.1
Poolside发布Laguna S 2.1,一个总参数量118B的混合专家(MoE)模型,每个token激活8B参数,支持长达100万token的上下文,在长周期编程基准测试中取得了有竞争力的成绩,并被誉为同重量级中最具能力的自主编程模型。
poolside/Laguna-M.1 · Hugging Face - 225B-A23B
Poolside 发布了 Laguna M.1,这是一个 225B 参数的混合专家模型,每个 token 激活 23B 参数,专为代理编程和长周期任务设计。它在 SWE-bench 基准测试上取得了有竞争力的结果,并采用 Apache 2.0 许可证发布。
介绍 Laguna XS 2.1(5分钟阅读)
Poolside 发布 Laguna XS 2.1,这是一个 33B 参数的混合专家模型,每个 token 激活 3B 参数,专为智能编码设计,在 SWE-bench Multilingual 及其他基准测试上有所改进,现已在宽松的 OpenMDW-1.1 许可证下提供。
poolside/Laguna-XS.2
Poolside 发布 Laguna XS.2,这是一个拥有 33B 总参数、3B 激活参数的 MoE 模型,专为智能体编码设计,可在配备 36GB RAM 的 Mac 上本地部署。
poolside/Laguna-S-2.1-GGUF
Poolside发布了Laguna S 2.1 AI模型的GGUF量化版本,包括一个DFlash投机解码草稿模型,支持通过llama.cpp进行高效的本地推理。