ThinkingCap-Qwen3.6-27B 值得一看

Reddit r/LocalLLaMA 模型

摘要

用户报告称,与 Qwen3.5-27B 相比,ThinkingCap-Qwen3.6-27B 的每秒 token 数(tps)有所提升,且质量未受影响,建议将其作为日常主力模型使用,直至 Qwen 推出下一个版本。

我才将工作流完全从 Qwen3.5-27B F16 切换到 ThinkingCap-Qwen3.6-27B F16 两天。之前我的 tps 在 30-40 范围内(取决于上下文大小),现在明确地达到了 35-45 范围。你可能会说提升不大,但我没有注意到任何质量下降。他们声称减少了 token 使用量。或许这就是 tps 提高的原因。关键是他们没有搞乱模型的核心能力。聊天模板是 froggeric。我被说服了。在 Qwen 发布下一个版本之前,我会一直使用这个模型。spec-draft-n-max 4 效果最好,我尝试过 1 到 6。以下是我的 llama 脚本: CUDA_VISIBLE_DEVICES=3,2,1,0 ~/llama.cpp/build/bin/llama-server \ -m ~/models/ThinkingCap-Qwen3.6-27B/ThinkingCap-Qwen3.6-27B-f16.gguf \ --port 8000 \ -c 262144 -b 4096 -ub 512 -np 2 -ctk f16 -ctv f16 -ctkd f16 -ctvd f16 \ -fa on \ -ts 1,1,1,1 \ --spec-type draft-mtp \ --spec-draft-n-max 4 \ --reasoning on \ --temp 0.6 \ --top-p 0.95 \ --top-k 20 \ --min-p 0.0 \ --repeat-penalty 1.1 \ --presence-penalty 0.1 \ --alias Unsloth/ThinkingCap-Qwen3.6-27B-f16 \ --host 0.0.0.0 \ --no-ui --jinja --chat-template-file ~/models/Qwen3.6/chat_template.jinja 希望得到关于如何修改以获得更高 tps 的建议。
查看原文

相似文章

bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF

Hugging Face Models Trending

ThinkingCap-Qwen3.6-27B 是 Qwen3.6-27B 的精调版本,平均使用少 50% 的思考令牌,同时保持答案质量。此仓库提供 GGUF 量化格式,用于在 llama.cpp 上进行本地推理。

Qwen 3.6 27B 太牛了

Reddit r/LocalLLaMA

一位用户分享了在本地使用 Qwen 3.6 27B 进行复杂研究和编程的积极体验,发现它在职业建议和移民研究方面优于 Gemini Pro,同时也提到 Gemma 4 31B 存在性能问题。