Laguna-S-2.1 运行在我6年前的旧游戏电脑上!
摘要
Laguna-S-2.1 是一个量化AI模型,运行在配备RTX 3080的6年前旧游戏电脑上,解码速度达到10 token/秒,占用8.3 GB显存和52.2 GB主机内存。
Laguna-S-2.1 运行在我2020年的电脑上(RTX 3080 10GB,Ryzen 9 3950X,64 GB RAM)。但实际只能过夜使用。我呼吸都不敢用力,否则显存和主机内存都会爆满。剩余的内存刚好够运行我交给它的任意编程项目的编译和单元测试。IQ4_XS,128k q8/q8 上下文,所有密集张量放在显存,没有 DFlash(放不下)。120 token/秒 预填充,10 token/秒 解码,8.3 GB 显存,52.2 GB 主机内存。我还没做全面测试,但思考功能开箱即用。当支持进入 beellama(大约一个月后?)时,我可以切换到 kvarn,显存压力将变得可控得多(希望如此。kvarn 与 Gemma 不兼容;不知道这个模型怎么样)。llamacpp CUDA @ https://github.com/poolsideai/llama.cpp/pull/3 hf = unsloth/Laguna-S-2.1-GGUF:UD-IQ4_XS ngl = 99 n-cpu-moe = 99 ctx-size = 131072 jinja = true flash-attn = on cache-type-k = q8_0 cache-type-v = q8_0 mlock = true no-mmap = true
相似文章
@TheAhmadOsman: Laguna S 2.1 118B-A8B 在 DGX Station 上使用 - NVFP4 - FP8 KV 缓存,可运行 10 个并行代理,每个拥有 256k 上下文…
Laguna S 2.1 118B-A8B 模型在 DGX Station 上使用 NVFP4 和 FP8 KV 缓存运行,对于 10 个并行代理(每个拥有 256k 上下文)达到约 1k tokens/秒 的速度。
Laguna S 2.1 给我留下了深刻印象
Laguna S 2.1 是一款 120B 类模型,它通过使用长思考令牌解决了 Julia 中的一个复杂编码问题,给我留下了深刻印象。在一个内存受限的重排任务中,它的表现超过了 Qwen 模型。
Laguna S 2.1 循环修复即将到来
Poolside 发布了 Laguna S 2.1,这是他们最擅长处理长周期任务的模型,同时在 Hugging Face 上提供了多种量化变体(FP8、NVFP4、INT4、DFlash、GGUF)。
我使用RTX Pro 6000 (96GB)对Laguna-S-2.1和Qwen3.5-122B进行了我的私有智能体评估。这是我所测试过的最快的100B+模型,且工具调用能力最佳,但在压力下会编造事实。
在RTX Pro 6000上对Laguna-S-2.1与Qwen3.5-122B的评估显示,它是所测试过的最快的100B+模型,工具调用能力最佳,但在压力下容易编造事实。
poolside/Laguna-S-2.1-GGUF
Poolside发布了Laguna S 2.1 AI模型的GGUF量化版本,包括一个DFlash投机解码草稿模型,支持通过llama.cpp进行高效的本地推理。