48GB VRAM + Qwen 3.6 27B 的最佳设置
摘要
一位用户分享了在双GPU配置(RTX 4090 + RTX 3090)上使用llama.cpp运行Qwen3.6 27B (Q8_0)的优化设置,在250k上下文下实现了75-100 t/s和1500 pp。
大家好,我一直在使用带tensor split的llama.cpp在RTX 4090 + RTX 3090配置上运行Qwen3.6 27B (Q8_0),想分享一下对我而言目前效果最好的设置。看看是否有人有更好的设置。
硬件:
RTX 4090 (24GB) + RTX 3090 (24GB),总计48GB VRAM
操作系统:
Arch Linux(使用核显显示)
设置:
量化:Q8_0
拆分模式:tensor
GPU层数:-ngl 999
上下文:250k (-c 250000)
投机解码:--spec-type draft-mtp --spec-draft-n-max 4
并行请求:-np 3
统一KV缓存:-kvu
聊天模板:--chat-template-kwargs '{"preserve_thinking": true}'
标志:--no-mmap -fa on --jinja -fit off --no-op-offload
视觉:mmproj-F16 with --no-mmproj-offload
这使我在250k未量化上下文、视觉和MTP下获得了75-100 t/s的生成速度和1500 pp。
相似文章
两块旧款RTX 2080 Ti,每块22GB显存,运行Qwen3.6 27B,使用f16 KV缓存达到38 token/s
一位用户分享其配置:使用两块改装版RTX 2080 Ti GPU(每块22GB显存)通过llama.cpp以38 token/s运行Qwen 3.6 27B,并包含关于功耗限制、张量分割模式和KV缓存设置的技巧。
Qwen3.6 27b / llama.cpp / opencode 最佳配置
社区讨论帖,分享在多 GPU 环境下运行 27B Qwen3.6 GGUF 模型、支持 100K-512K 长上下文的 llama.cpp 优化启动命令。
Qwen 3.6 27B 在 llama.cpp 中的标志/设置
一位用户分享了他们在 RTX 5090 上运行 Qwen 3.6 27B 的 llama.cpp 服务器配置,达到了 80-100 t/s 的速度,并向社区询问其他设置和技巧。
在 Qwen 3.8 27B 上处理超过 100 万 token 后,以下是我针对 16GB 显存(73k 上下文长度,智能体编码场景)调校出的 llama.cpp 最佳配置。
本文分享了针对16GB显存、73k上下文窗口优化的llama.cpp配置方案,用于运行Qwen 3.8 27B模型,并通过实际软件工程项目展示了该配置在智能编码工作流中的性能表现。
在 8GB 显存和 32GB 内存上运行 Qwen3.6 35b a3b,~190k 上下文
作者分享了一种高性能的本地推理配置,使用支持 TurboQuant 的修改版 llama.cpp,在硬件受限(8GB 显存、32GB 内存)的情况下运行 Qwen3.6 35B A3B,实现了 ~37-51 tok/sec 的生成速度,并支持 ~190k 上下文。