Qwen 3.6 27B 在 llama.cpp 中的标志/设置

Reddit r/LocalLLaMA 工具

摘要

一位用户分享了他们在 RTX 5090 上运行 Qwen 3.6 27B 的 llama.cpp 服务器配置,达到了 80-100 t/s 的速度,并向社区询问其他设置和技巧。

我在 5090 上运行以下配置,对它的性能还算满意,大多数情况下速度在 80-100 t/s,不过在全 262k 上下文时可能会慢下来——有时大约 40 t/s。我主要把它用于应用开发任务。这刚好勉强塞进 5090,没有视觉模型,几乎没有剩余空间。一开始我把批次大小(-b / -ub)设成了完全不同的数值,但通过区间测试我的编码任务,最终确定了这些值,以获得最佳性能和最佳输出。我看到很多人把这个值设得高得多,但在这里似乎没什么帮助。推理预算(reasoning budget)是另一个我和大多数人设置不同的地方,我把它设得比我在其他地方看到的人高不少,但似乎也还行?虽然很难用评估来量化,但感觉值设低了更容易迷失方向。说实话,我并没有深入研究所有设置,因为 token 生成速度飞快,我已经很满意了。但我想看看:你们有没有把这些该死的东西改成别的值?如果有的话:为什么,你他妈的在搞什么?别光说 token,把实情倒出来。去他妈的 spez. llama-server \ -m '/ai/models--unsloth--Qwen3.6-27B-MTP-GGUF/snapshots/5cb35eb3dcbf52dbce5f87dbc64df6aaffadcace/Qwen3.6-27B-Q6_K.gguf' \ -c 262144 \ -b 512 \ -ub 128 \ --gpu-layers all \ --spec-draft-ngl all \ --fit off \ --parallel 1 \ --flash-attn on \ --no-context-shift \ --cache-type-k q8_0 \ --cache-type-v q8_0 \ --spec-type draft-mtp \ --spec-draft-n-max 3 \ --spec-draft-p-min 0.2 \ --cache-ram 16384 \ --ctx-checkpoints 32 \ --checkpoint-min-step 8192 \ --jinja \ --reasoning on \ --reasoning-budget 16384 \ --no-reasoning-preserve \ --load-mode none \ --no-mmproj \ --alias 'unsloth/Qwen3.6-27B-MTP-GGUF' \ --metrics \ --perf \ --host 0.0.0.0 \ --port 1234
查看原文

相似文章

48GB VRAM + Qwen 3.6 27B 的最佳设置

Reddit r/LocalLLaMA

一位用户分享了在双GPU配置(RTX 4090 + RTX 3090)上使用llama.cpp运行Qwen3.6 27B (Q8_0)的优化设置,在250k上下文下实现了75-100 t/s和1500 pp。