Laguna-S-2.1 运行在我6年前的旧游戏电脑上!

Reddit r/LocalLLaMA 模型

摘要

Laguna-S-2.1 是一个量化AI模型,运行在配备RTX 3080的6年前旧游戏电脑上,解码速度达到10 token/秒,占用8.3 GB显存和52.2 GB主机内存。

Laguna-S-2.1 运行在我2020年的电脑上(RTX 3080 10GB,Ryzen 9 3950X,64 GB RAM)。但实际只能过夜使用。我呼吸都不敢用力,否则显存和主机内存都会爆满。剩余的内存刚好够运行我交给它的任意编程项目的编译和单元测试。IQ4_XS,128k q8/q8 上下文,所有密集张量放在显存,没有 DFlash(放不下)。120 token/秒 预填充,10 token/秒 解码,8.3 GB 显存,52.2 GB 主机内存。我还没做全面测试,但思考功能开箱即用。当支持进入 beellama(大约一个月后?)时,我可以切换到 kvarn,显存压力将变得可控得多(希望如此。kvarn 与 Gemma 不兼容;不知道这个模型怎么样)。llamacpp CUDA @ https://github.com/poolsideai/llama.cpp/pull/3 hf = unsloth/Laguna-S-2.1-GGUF:UD-IQ4_XS ngl = 99 n-cpu-moe = 99 ctx-size = 131072 jinja = true flash-attn = on cache-type-k = q8_0 cache-type-v = q8_0 mlock = true no-mmap = true
查看原文

相似文章

Laguna S 2.1 给我留下了深刻印象

Reddit r/LocalLLaMA

Laguna S 2.1 是一款 120B 类模型,它通过使用长思考令牌解决了 Julia 中的一个复杂编码问题,给我留下了深刻印象。在一个内存受限的重排任务中,它的表现超过了 Qwen 模型。

Laguna S 2.1 循环修复即将到来

Reddit r/LocalLLaMA

Poolside 发布了 Laguna S 2.1,这是他们最擅长处理长周期任务的模型,同时在 Hugging Face 上提供了多种量化变体(FP8、NVFP4、INT4、DFlash、GGUF)。

poolside/Laguna-S-2.1-GGUF

Hugging Face Models Trending

Poolside发布了Laguna S 2.1 AI模型的GGUF量化版本,包括一个DFlash投机解码草稿模型,支持通过llama.cpp进行高效的本地推理。