Qwen 3.6 27B 在 llama.cpp 中的标志/设置
摘要
一位用户分享了他们在 RTX 5090 上运行 Qwen 3.6 27B 的 llama.cpp 服务器配置,达到了 80-100 t/s 的速度,并向社区询问其他设置和技巧。
我在 5090 上运行以下配置,对它的性能还算满意,大多数情况下速度在 80-100 t/s,不过在全 262k 上下文时可能会慢下来——有时大约 40 t/s。我主要把它用于应用开发任务。这刚好勉强塞进 5090,没有视觉模型,几乎没有剩余空间。一开始我把批次大小(-b / -ub)设成了完全不同的数值,但通过区间测试我的编码任务,最终确定了这些值,以获得最佳性能和最佳输出。我看到很多人把这个值设得高得多,但在这里似乎没什么帮助。推理预算(reasoning budget)是另一个我和大多数人设置不同的地方,我把它设得比我在其他地方看到的人高不少,但似乎也还行?虽然很难用评估来量化,但感觉值设低了更容易迷失方向。说实话,我并没有深入研究所有设置,因为 token 生成速度飞快,我已经很满意了。但我想看看:你们有没有把这些该死的东西改成别的值?如果有的话:为什么,你他妈的在搞什么?别光说 token,把实情倒出来。去他妈的 spez. llama-server \
-m '/ai/models--unsloth--Qwen3.6-27B-MTP-GGUF/snapshots/5cb35eb3dcbf52dbce5f87dbc64df6aaffadcace/Qwen3.6-27B-Q6_K.gguf' \
-c 262144 \
-b 512 \
-ub 128 \
--gpu-layers all \
--spec-draft-ngl all \
--fit off \
--parallel 1 \
--flash-attn on \
--no-context-shift \
--cache-type-k q8_0 \
--cache-type-v q8_0 \
--spec-type draft-mtp \
--spec-draft-n-max 3 \
--spec-draft-p-min 0.2 \
--cache-ram 16384 \
--ctx-checkpoints 32 \
--checkpoint-min-step 8192 \
--jinja \
--reasoning on \
--reasoning-budget 16384 \
--no-reasoning-preserve \
--load-mode none \
--no-mmproj \
--alias 'unsloth/Qwen3.6-27B-MTP-GGUF' \
--metrics \
--perf \
--host 0.0.0.0 \
--port 1234
相似文章
Qwen3.6 27b / llama.cpp / opencode 最佳配置
社区讨论帖,分享在多 GPU 环境下运行 27B Qwen3.6 GGUF 模型、支持 100K-512K 长上下文的 llama.cpp 优化启动命令。
48GB VRAM + Qwen 3.6 27B 的最佳设置
一位用户分享了在双GPU配置(RTX 4090 + RTX 3090)上使用llama.cpp运行Qwen3.6 27B (Q8_0)的优化设置,在250k上下文下实现了75-100 t/s和1500 pp。
在24GB显存环境中运行Qwen 3.6 27B的配置:后端对比、量化选择与设置(llama.cpp, ik_llama.cpp, BeeLlama, vllm)
本文对比了在RTX 3090 24GB上运行Qwen 3.6 27B使用的llama.cpp后端,发现搭配IQ4_KS量化的ik_llama.cpp性能最佳(预填充1261 tok/s,解码72.9 tok/s)。
帮助优化 llama.cpp + Qwen 27B 在 RTX PRO 6000 Blackwell 上用于编码代理的配置
用户详细介绍了他们在 RTX PRO 6000 Blackwell 上使用 llama.cpp 运行 Qwen 27B 进行本地编码代理的设置,与 Claude 模型进行了性能对比,并请求帮助解决频繁崩溃和响应格式错误的问题。
Qwen3.6-35B-A3B Q4 262k上下文,8GB 3070 Ti上可达+30tps
作者分享了在8GB RTX 3070 Ti上使用llama.cpp运行Qwen3.6-35B-A3B MoE模型,实现高达262k上下文、30+tps的详细调优技巧,并指出从Windows切换到Ubuntu Server后速度提升了25%。