双Radeon R9700——在llama.cpp上运行Qwen 3.6 27B Q8 MTP
摘要
关于在使用ROCm的llama.cpp上,于双AMD Radeon R9700配置下运行Qwen 3.6 27B Q8模型的技术报告,包括性能基准测试和配置详情。
关于使用R9700的多GPU设置的信息不多,所以我写这篇文章,希望能帮助到遇到同样情况的人。以下是我的设置、运行过的测试以及服务器日志中的数字。
设置:ThinkStation P7,Xeon w7-3455,128 GB RDIMM,2× Gigabyte Radeon AI PRO R9700 32 GB(总计64 GB显存),Ubuntu 24.04 LTS,Docker 29.5.3,容器通过Komodo(komo.do)管理,ROCm 7.2.1,镜像:llamacpp-rocm:gfx1201,模型:unsloth/Qwen3.6-27B-MTP-GGUF/Qwen3.6-27B-Q8_0.gguf,上下文长度131072
测试:根据Markdown规范生成代码:用Python、Go和PHP搭建同一个应用。长文本处理:处理2000–3000行的输入(医学文本、思科手册、文学作品),进行翻译、重新格式化和纠错。记忆检查:总结一个长混合会话,看它是否保持主题连贯并能回忆早期内容。
解码(令牌生成)
上下文填充 解码(t/s) MTP草稿接受率
~3–6k 46–61 0.36–0.54
~10–13k 64–67 0.60–0.61
~17k ~59 0.54
~33k ~49 0.45
~96k ~40 0.42
~102k ~44 0.50
~125k ~45 —
预填充吞吐量
提示大小 吞吐量
<10k ~1,200–1,500 t/s
~30k ~1,175 t/s
~63k ~617 t/s
~100k+ ~410–435 t/s
MTP草稿接受率:所有运行中为0.33–0.61。
--spec-draft-n-max:还在试验这个参数。降低它会提高高上下文时的令牌生成速率,所以我会继续测试不同的值。提示缓存:服务器会保留滚动KV检查点(最多32个,每个约150–580 MiB),并在新轮次与缓存的前缀大部分相同时,在约60–300毫秒内恢复它们,而不是重新处理整个提示。PCIe带宽(Intel PCM):解码期间每个方向低于200 MB/s;预填充期间峰值达到5–7 GB/s。
Compose yaml服务配置:
llamacpp-qwen36-27b:
image: llamacpp-rocm:gfx1201
pull_policy: never
container_name: llamacpp-qwen36-27b
network_mode: host
ipc: host
privileged: true
security_opt:
- seccomp=unconfined
group_add:
- "44"
- "993"
devices:
- /dev/kfd:/dev/kfd
- /dev/dri:/dev/dri
ulimits:
memlock: -1
stack: 67108864
environment:
- HIP_VISIBLE_DEVICES=0,1
- ROCR_VISIBLE_DEVICES=0,1
volumes:
- /data/models_ai:/models:ro
command:
- --model
- /models/unsloth/Qwen3.6-27B-MTP-GGUF/Qwen3.6-27B-Q8_0.gguf
- --host
- 0.0.0.0
- --port
- "8002"
- --alias
- qwen36-27b
- --n-gpu-layers
- "999"
- --ctx-size
- "131072"
- --split-mode
- tensor
- --kv-unified
- --cache-type-k
- f16
- --cache-type-v
- f16
- --batch-size
- "2048"
- --ubatch-size
- "1024"
- --parallel
- "1"
- --cont-batching
- --flash-attn
- "on"
- --threads
- "8"
- --spec-type
- draft-mtp
- --spec-draft-n-max
- "5"
- --reasoning-budget
- "0"
- --temp
- "1.0"
- --top-k
- "20"
- --top-p
- "0.95"
- --jinja
相似文章
Qwen 3.5 122B Heretic ROCmFP4 iMatrix
Qwen 3.5 122B 模型的一种紧凑型、重要性校准的 ROCmFP4 量化版本,适用于高内存 AMD 系统,实现了更优的质量(KLD 降低 14%)和性能(28.45 tok/s)。需要 ROCmFPX 运行时,不兼容标准 llama.cpp。
Qwen 3.5 122B MoE OC 在单张 3090 上以 35 t/s 运行——完整本地堆栈解析
在单张 RTX 3090 上使用定制版 llama.cpp(ik_llama.cpp)以 35 t/s 运行 Qwen 3.5 122B MoE 的详细解析,其中采用了融合 MoE 操作和专家层卸载到 CPU 内存的技术,性能显著优于原版 llama.cpp MTP。
48GB VRAM + Qwen 3.6 27B 的最佳设置
一位用户分享了在双GPU配置(RTX 4090 + RTX 3090)上使用llama.cpp运行Qwen3.6 27B (Q8_0)的优化设置,在250k上下文下实现了75-100 t/s和1500 pp。
Qwen 3.6 27B 在 llama.cpp 中的标志/设置
一位用户分享了他们在 RTX 5090 上运行 Qwen 3.6 27B 的 llama.cpp 服务器配置,达到了 80-100 t/s 的速度,并向社区询问其他设置和技巧。
在24GB显存环境中运行Qwen 3.6 27B的配置:后端对比、量化选择与设置(llama.cpp, ik_llama.cpp, BeeLlama, vllm)
本文对比了在RTX 3090 24GB上运行Qwen 3.6 27B使用的llama.cpp后端,发现搭配IQ4_KS量化的ik_llama.cpp性能最佳(预填充1261 tok/s,解码72.9 tok/s)。