ThinkingCap-Qwen3.6-27B 值得一看

Reddit r/LocalLLaMA 模型

摘要

用户报告称,与 Qwen3.5-27B 相比,ThinkingCap-Qwen3.6-27B 的每秒 token 数(tps)有所提升,且质量未受影响,建议将其作为日常主力模型使用,直至 Qwen 推出下一个版本。

我才将工作流完全从 Qwen3.5-27B F16 切换到 ThinkingCap-Qwen3.6-27B F16 两天。之前我的 tps 在 30-40 范围内(取决于上下文大小),现在明确地达到了 35-45 范围。你可能会说提升不大,但我没有注意到任何质量下降。他们声称减少了 token 使用量。或许这就是 tps 提高的原因。关键是他们没有搞乱模型的核心能力。聊天模板是 froggeric。我被说服了。在 Qwen 发布下一个版本之前,我会一直使用这个模型。spec-draft-n-max 4 效果最好,我尝试过 1 到 6。以下是我的 llama 脚本: CUDA_VISIBLE_DEVICES=3,2,1,0 ~/llama.cpp/build/bin/llama-server \ -m ~/models/ThinkingCap-Qwen3.6-27B/ThinkingCap-Qwen3.6-27B-f16.gguf \ --port 8000 \ -c 262144 -b 4096 -ub 512 -np 2 -ctk f16 -ctv f16 -ctkd f16 -ctvd f16 \ -fa on \ -ts 1,1,1,1 \ --spec-type draft-mtp \ --spec-draft-n-max 4 \ --reasoning on \ --temp 0.6 \ --top-p 0.95 \ --top-k 20 \ --min-p 0.0 \ --repeat-penalty 1.1 \ --presence-penalty 0.1 \ --alias Unsloth/ThinkingCap-Qwen3.6-27B-f16 \ --host 0.0.0.0 \ --no-ui --jinja --chat-template-file ~/models/Qwen3.6/chat_template.jinja 希望得到关于如何修改以获得更高 tps 的建议。
查看原文

相似文章

Qwen 3.8 27B 比预期更快

Reddit r/LocalLLaMA

一位用户报告称,Qwen 3.8 27B 模型在双 5060 TI 显卡上达到了 50-60 个令牌每秒的速度,显示出比之前版本(如 Qwen 3.6)更令人意外的速度提升。

Qwen 3.8 27B 表现优异,但默认启用过度推理模式

Simon Willison's Blog

Qwen 3.8 27B 是阿里巴巴通义千问实验室推出的一款强大的开源270亿参数多模态大语言模型。它在基准测试中表现突出,但被批评默认启用过度推理模式,这在消费级硬件上拖慢了运行速度。

Qwen3.8-27B:更慢的词元,更快更好的结果

Reddit r/LocalLLaMA

Qwen3.8-27B 是一款新型人工智能模型,强调实际运行时间而非词元生成速度,能在配备32GB显存的消费级硬件上本地部署,并提供卓越的智能表现。