ThinkingCap-Qwen3.6-27B 值得一看
摘要
用户报告称,与 Qwen3.5-27B 相比,ThinkingCap-Qwen3.6-27B 的每秒 token 数(tps)有所提升,且质量未受影响,建议将其作为日常主力模型使用,直至 Qwen 推出下一个版本。
我才将工作流完全从 Qwen3.5-27B F16 切换到 ThinkingCap-Qwen3.6-27B F16 两天。之前我的 tps 在 30-40 范围内(取决于上下文大小),现在明确地达到了 35-45 范围。你可能会说提升不大,但我没有注意到任何质量下降。他们声称减少了 token 使用量。或许这就是 tps 提高的原因。关键是他们没有搞乱模型的核心能力。聊天模板是 froggeric。我被说服了。在 Qwen 发布下一个版本之前,我会一直使用这个模型。spec-draft-n-max 4 效果最好,我尝试过 1 到 6。以下是我的 llama 脚本:
CUDA_VISIBLE_DEVICES=3,2,1,0 ~/llama.cpp/build/bin/llama-server \
-m ~/models/ThinkingCap-Qwen3.6-27B/ThinkingCap-Qwen3.6-27B-f16.gguf \
--port 8000 \
-c 262144 -b 4096 -ub 512 -np 2 -ctk f16 -ctv f16 -ctkd f16 -ctvd f16 \
-fa on \
-ts 1,1,1,1 \
--spec-type draft-mtp \
--spec-draft-n-max 4 \
--reasoning on \
--temp 0.6 \
--top-p 0.95 \
--top-k 20 \
--min-p 0.0 \
--repeat-penalty 1.1 \
--presence-penalty 0.1 \
--alias Unsloth/ThinkingCap-Qwen3.6-27B-f16 \
--host 0.0.0.0 \
--no-ui --jinja --chat-template-file ~/models/Qwen3.6/chat_template.jinja
希望得到关于如何修改以获得更高 tps 的建议。
相似文章
@_akhaliq: bottlecapai/ThinkingCap-Qwen3.6-27B —— Qwen3.6-27B 具备平均减少50%思考令牌、最佳情况减少90%以上的能力
bottlecapai 发布了 ThinkingCap-Qwen3.6-27B,这是 Qwen3.6-27B 的微调版本,平均减少50%的思考令牌,最佳情况下减少90%,提升了效率。
ThinkingCap 3.8-27B 对比 Swift 3.8-27B 对比 Qwen 3.8-27B 基准测试
文章对ThinkingCap-Qwen3.8-27B和Swift-Qwen3.8-27B与原始Qwen3.8-27B进行了基准测试,结果显示两个微调模型都减少了约40%的推理令牌,性能损失极小,但在特定语言结果和令牌使用模式上存在差异。
Qwen 3.8 27B 比预期更快
一位用户报告称,Qwen 3.8 27B 模型在双 5060 TI 显卡上达到了 50-60 个令牌每秒的速度,显示出比之前版本(如 Qwen 3.6)更令人意外的速度提升。
Qwen 3.8 27B 表现优异,但默认启用过度推理模式
Qwen 3.8 27B 是阿里巴巴通义千问实验室推出的一款强大的开源270亿参数多模态大语言模型。它在基准测试中表现突出,但被批评默认启用过度推理模式,这在消费级硬件上拖慢了运行速度。
Qwen3.8-27B:更慢的词元,更快更好的结果
Qwen3.8-27B 是一款新型人工智能模型,强调实际运行时间而非词元生成速度,能在配备32GB显存的消费级硬件上本地部署,并提供卓越的智能表现。