标签
Laguna S 2.1 118B-A8B 模型在 DGX Station 上使用 NVFP4 和 FP8 KV 缓存运行,对于 10 个并行代理(每个拥有 256k 上下文)达到约 1k tokens/秒 的速度。
Laguna S 2.1 是一款 120B 类模型,它通过使用长思考令牌解决了 Julia 中的一个复杂编码问题,给我留下了深刻印象。在一个内存受限的重排任务中,它的表现超过了 Qwen 模型。
文章报告称,Laguna S 2.1 AI模型中的无限思考循环很可能是由量化伪影引起的。切换到MoE感知的APEX量化(例如Myric/Laguna-S-2.1-APEX-GGUF)并使用默认采样设置(温度0.7,top_p 0.95,top_k 20)解决了大多数情况下的循环问题。此外,将提示框定在工具调用周围可以防止过度思考。
Laguna S-2.1模型已更新,修复了yarn_attn_factor(已修正为1.0),并改进了聊天模板,修复了损坏的思维过程、保留了思维链,并支持工具调用。建议用户使用官方仓库中更新的GGUF文件。
Poolside 发布了 Laguna S 2.1,这是他们最擅长处理长周期任务的模型,同时在 Hugging Face 上提供了多种量化变体(FP8、NVFP4、INT4、DFlash、GGUF)。
Poolside发布了Laguna S 2.1,用户购入了3块AMD V620 GPU,总计96 GB显存。
Unsloth 发布了 Laguna S 2.1 Mixture-of-Experts 模型的 GGUF 量化版本。该模型是一个拥有 118B 参数(8B 激活参数)的编码模型,具备 1M 上下文窗口和智能体能力。量化版本支持高效的本地部署。