标签
报告了 Laguna S 2.1 中的一个 bug:当 preserve_thinking 被禁用时,推理阶段会失败,并建议对比 Qwen 27B 的聊天模板来修复此问题。
Laguna-S-2.1 是一个量化AI模型,运行在配备RTX 3080的6年前旧游戏电脑上,解码速度达到10 token/秒,占用8.3 GB显存和52.2 GB主机内存。