ThinkingCap-Qwen3.6-27B 值得一看
摘要
用户报告称,与 Qwen3.5-27B 相比,ThinkingCap-Qwen3.6-27B 的每秒 token 数(tps)有所提升,且质量未受影响,建议将其作为日常主力模型使用,直至 Qwen 推出下一个版本。
我才将工作流完全从 Qwen3.5-27B F16 切换到 ThinkingCap-Qwen3.6-27B F16 两天。之前我的 tps 在 30-40 范围内(取决于上下文大小),现在明确地达到了 35-45 范围。你可能会说提升不大,但我没有注意到任何质量下降。他们声称减少了 token 使用量。或许这就是 tps 提高的原因。关键是他们没有搞乱模型的核心能力。聊天模板是 froggeric。我被说服了。在 Qwen 发布下一个版本之前,我会一直使用这个模型。spec-draft-n-max 4 效果最好,我尝试过 1 到 6。以下是我的 llama 脚本:
CUDA_VISIBLE_DEVICES=3,2,1,0 ~/llama.cpp/build/bin/llama-server \
-m ~/models/ThinkingCap-Qwen3.6-27B/ThinkingCap-Qwen3.6-27B-f16.gguf \
--port 8000 \
-c 262144 -b 4096 -ub 512 -np 2 -ctk f16 -ctv f16 -ctkd f16 -ctvd f16 \
-fa on \
-ts 1,1,1,1 \
--spec-type draft-mtp \
--spec-draft-n-max 4 \
--reasoning on \
--temp 0.6 \
--top-p 0.95 \
--top-k 20 \
--min-p 0.0 \
--repeat-penalty 1.1 \
--presence-penalty 0.1 \
--alias Unsloth/ThinkingCap-Qwen3.6-27B-f16 \
--host 0.0.0.0 \
--no-ui --jinja --chat-template-file ~/models/Qwen3.6/chat_template.jinja
希望得到关于如何修改以获得更高 tps 的建议。
相似文章
@_akhaliq: bottlecapai/ThinkingCap-Qwen3.6-27B —— Qwen3.6-27B 具备平均减少50%思考令牌、最佳情况减少90%以上的能力
bottlecapai 发布了 ThinkingCap-Qwen3.6-27B,这是 Qwen3.6-27B 的微调版本,平均减少50%的思考令牌,最佳情况下减少90%,提升了效率。
bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF
ThinkingCap-Qwen3.6-27B 是 Qwen3.6-27B 的精调版本,平均使用少 50% 的思考令牌,同时保持答案质量。此仓库提供 GGUF 量化格式,用于在 llama.cpp 上进行本地推理。
Qwen 3.6 27B 太牛了
一位用户分享了在本地使用 Qwen 3.6 27B 进行复杂研究和编程的积极体验,发现它在职业建议和移民研究方面优于 Gemini Pro,同时也提到 Gemma 4 31B 存在性能问题。
Qwen 3.6 35B A3B 与 Qwen 3.5 122B A10B 对比
用户反馈,尽管基准测试表现亮眼,Qwen 3.5 122B 在多步任务上大幅领先 Qwen 3.6 35B,怀疑是量化或部署配置问题。
我无法让Qwen3.6 27B超越Qwen-Coder-Next,不确定原因
用户报告称,Qwen-Coder-Next 在实际测试和合成基准测试中均优于 Qwen3.6 27B,尽管其他人称赞 27B,用户寻求关于可能设置问题的建议。