两块旧款RTX 2080 Ti,每块22GB显存,运行Qwen3.6 27B,使用f16 KV缓存达到38 token/s
摘要
一位用户分享其配置:使用两块改装版RTX 2080 Ti GPU(每块22GB显存)通过llama.cpp以38 token/s运行Qwen 3.6 27B,并包含关于功耗限制、张量分割模式和KV缓存设置的技巧。
请记住,我的两张显卡都限制功耗为150W(我讨厌噪音)
\------- 只是想分享一下我当前的设置,可能对某些用户有帮助...
services:
llama-server:
image: ghcr.io/ggml-org/llama.cpp:full-cuda12-b9128
container_name: llama-server
restart: unless-stopped
ports:
- "16384:8080"
volumes:
- ./models:/models:ro
command: >
--server --model /models/Qwen3.6-27B-IQ4_XS-uc.gguf --alias "Qwen3.6 27B" --temp 0.6 --top-p 0.95 --min-p 0.00 --top-k 20 --port 8080 --host 0.0.0.0 --cache-type-k f16 --cache-type-v f16 --fit on --presence-penalty 1.32 --repeat-penalty 1.0 --jinja --chat-template-file /models/Qwen3.6.jinja --mmproj /models/Qwen3.6-27B-mmproj-BF16.gguf --webui --spec-default --chat-template-kwargs '{"preserve_thinking": true}' --reasoning-budget 8192 --reasoning-budget-message "... thinking budget exceeded, let's answer now.\n" --split-mode tensor
user: "1000:1000"
deploy:
resources:
reservations:
devices:
- driver: nvidia
count: all
capabilities: [gpu]
environment:
- NVIDIA_VISIBLE_DEVICES=all
这是我确切的配置,我的两块非常老的2080Ti显卡在中国升级为每块22GB显存... 我在eBay上买了一个NVLINK桥(我不建议购买,因为没有任何可测量的差异)
我运行的量化是IQ4\_XS。如果我将KV缓存改为q8\_0,在长时间的编码会话中有时会出现模型循环问题,这就是我运行kv-cache@f16的原因,自那以后再也没有出现过这个问题。
我使用的是hauhaucs的qwen3.6无审查模型,采用IQ4矩阵量化。
你还可以忽略MTP,因为这些显卡是计算密集型而非带宽密集型。
最大的提升来自于--split-mode tensor,这使速度从14 token/s提高到38 token/s。我认为如果没有功耗限制,我们应该能达到45 token/s。
另外我从未考虑过的是--fit on... 我一直手动声明上下文长度,效果很好,但看起来始终使用95%显存并不是个好主意。--fit on也略微提升了token生成速度。
顺便说一下,这套配置不到1000美元,峰值功耗400瓦,与hermes和opencode配合得很好。
我使用的jinja模板是这个: [https://huggingface.co/froggeric/Qwen-Fixed-Chat-Templates](https://huggingface.co/froggeric/Qwen-Fixed-Chat-Templates) (在这个设置中模板11,我还没有测试更新的模板)
https://preview.redd.it/gasb8yo8ga1h1.png?width=476&format=png&auto=webp&s=0450efcae279b0bcbd33f9d6d4f7241d8e3581d4
相似文章
2 x 5070ti Qwen 27B 完整配置/统计
技术帖分享了在 2x RTX 5070 Ti GPU 上使用 vLLM cu129-nightly 运行 Qwen 27B 的性能数据,解码速度最高可达 94-87 tps,GPU KV 缓存达 170k。
48GB VRAM + Qwen 3.6 27B 的最佳设置
一位用户分享了在双GPU配置(RTX 4090 + RTX 3090)上使用llama.cpp运行Qwen3.6 27B (Q8_0)的优化设置,在250k上下文下实现了75-100 t/s和1500 pp。
@malikwas1f:在 2× RTX 3090 上聚合吞吐量 308 tok/s — 无 NVLink,Qwen3.8-27B 在 vLLM 上运行,32 个并发流。足够支撑一整个集群……
一份性能报告和指南,介绍如何在双 RTX 3090 GPU 上使用 vLLM 运行 Qwen3.8-27B 模型,实现每秒 308 个令牌的吞吐量,支持 32 个并发流,并提供 GitHub 仓库用于本地部署配置。
@sachindetrax: 262K 上下文长度,运行于 16GB RTX 5070 Ti 显卡上。Qwen 3.8 27B Q3 模型达到约 25 tok/s,同时一个自适应 llama.cpp 分支在 RAM 和 VRAM 之间流式传输 KV 缓存…
llama.cpp 的一个自适应 KV 缓存流式传输分支,使得在 16GB RTX 5070 Ti GPU 上运行 Qwen 3.8 27B 模型并支持 262K 上下文成为可能,通过在内存与显存间高效管理,实现了约 25 tok/s 的速度。
双3090配置:Qwen 3.6 27B 上从 400 pp tokens/s 提升到 1600 pp tokens/s... 但 tps 略降。
使用双 RTX 3090 配置的用户发现,llama.cpp 的 `--split-mode tensor` 会在 CPU 上运行提示处理(约 400 t/s),而切换到 `--split-mode layer` 则可解锁 GPU 提示处理,速度超过 1600 t/s,且 token 生成速度仅略有下降。