大家在 Qwen3.6 27b 上跑出来的速度是多少?

Reddit r/LocalLLaMA 工具

摘要

用户基准测试 Qwen3.6-27B-Q8_0,在 3 块混合 GPU 上通过 llama.cpp 以约 13 tokens/sec 运行 128k 上下文,询问该性能是否典型。

我在 Q8_0 量化下大约得到 ~13 tps,上下文窗口为 128000,K 缓存 Q8_0,V 缓存 Q8_0。这是在三块 GPU 上运行的(1 块 2060 Super 8GB + 2 块 5060 Ti 16GB),通过 llama.cpp 运行。不确定这个速度是偏慢还是属于正常预期? 启动命令: ```bash */llama-server --port 8080 --model */llama.cpp/Qwen3.6-27B-Q8_0/Qwen3.6-27B-Q8_0.gguf -mm */Qwen3.6-27B-Q8_0/mmproj-BF16.gguf -np 1 --temperature 1.0 --top-p 0.95 --top-k 20 --min-p 0.0 --presence-penalty 1.5 --repeat-penalty 1.0 --chat-template-kwargs '{"preserve_thinking": true}' --cache-type-k q8_0 --cache-type-v q8_0 -c 128000 --fit-target 1536 ``` (`--fit-target 1536` 是为了给视觉功能留出一些空间)
查看原文

相似文章

Qwen 3.8 27B 比预期更快

Reddit r/LocalLLaMA

一位用户报告称,Qwen 3.8 27B 模型在双 5060 TI 显卡上达到了 50-60 个令牌每秒的速度,显示出比之前版本(如 Qwen 3.6)更令人意外的速度提升。