大家在 Qwen3.6 27b 上跑出来的速度是多少?

Reddit r/LocalLLaMA 工具

摘要

用户基准测试 Qwen3.6-27B-Q8_0,在 3 块混合 GPU 上通过 llama.cpp 以约 13 tokens/sec 运行 128k 上下文,询问该性能是否典型。

我在 Q8_0 量化下大约得到 ~13 tps,上下文窗口为 128000,K 缓存 Q8_0,V 缓存 Q8_0。这是在三块 GPU 上运行的(1 块 2060 Super 8GB + 2 块 5060 Ti 16GB),通过 llama.cpp 运行。不确定这个速度是偏慢还是属于正常预期? 启动命令: ```bash */llama-server --port 8080 --model */llama.cpp/Qwen3.6-27B-Q8_0/Qwen3.6-27B-Q8_0.gguf -mm */Qwen3.6-27B-Q8_0/mmproj-BF16.gguf -np 1 --temperature 1.0 --top-p 0.95 --top-k 20 --min-p 0.0 --presence-penalty 1.5 --repeat-penalty 1.0 --chat-template-kwargs '{"preserve_thinking": true}' --cache-type-k q8_0 --cache-type-v q8_0 -c 128000 --fit-target 1536 ``` (`--fit-target 1536` 是为了给视觉功能留出一些空间)
查看原文

相似文章

Qwen 3.6 27B 在 llama.cpp 中的标志/设置

Reddit r/LocalLLaMA

一位用户分享了他们在 RTX 5090 上运行 Qwen 3.6 27B 的 llama.cpp 服务器配置,达到了 80-100 t/s 的速度,并向社区询问其他设置和技巧。

48GB VRAM + Qwen 3.6 27B 的最佳设置

Reddit r/LocalLLaMA

一位用户分享了在双GPU配置(RTX 4090 + RTX 3090)上使用llama.cpp运行Qwen3.6 27B (Q8_0)的优化设置,在250k上下文下实现了75-100 t/s和1500 pp。