4090 + 5060 Ti + 64GB RAM:35B-A3B 达 206 t/s,122B 达 37 t/s
摘要
一位用户分享了在双 GPU(RTX 4090 和 RTX 5060 Ti)上运行大语言模型(Qwen 27B-122B)的基准测试结果,实现了极高的 token 生成速度(例如 35B-A3B 达到 206 t/s,122B 达到 37-41 t/s)。帖子包含配置详情以及指向 GitHub 仓库的链接,其中包含脚本和原始数据。
过去几周我一直在测试一套双卡系统,有些数字至今仍让我惊叹不已,所以干脆把它们晒出来。配置:RTX 4090(24GB)+ RTX 5060 Ti(16GB),i9-13900K,64GB DDR5。WSL2 分配给虚拟机 47GB,CUDA 12.8(特别注意是 12.8,13.1 会在 Blackwell 上导致 llama.cpp 的 MMQ 内核出现段错误,并静默回退到 cuBLAS,这让我在发现之前花了大约 6 倍的时间处理提示词)。llama.cpp 针对 89;120 编译。以下所有测试均采用 131K 上下文和 q8_0 KV 缓存,在短代码生成场景下测量。
模型放置 MTP 开启 MTP 关闭
Qwen3.6-27B 密集模型,Q4_K_XL 仅 4090 101–118 t/s 44 t/s
Qwen3.6-27B 密集模型,Q6_K_XL 双卡,分层 64 t/s -
Qwen3.6-35B-A3B,Q4_K_XL 4090 + 6 个专家层溢出 206 t/s 113 t/s
Qwen3.5-122B-A10B,IQ3_S 4090 + 5060 Ti + 约 15GB 内存 37–41 t/s 24 t/s
122B 那个结果我反复看了好几遍。这是一个 1220 亿参数的模型,其中 17 层驻留在系统内存中,生成速度居然比大多数人的 8B 系统还快。我跑之前自己粗略估算的是 20–30 t/s,还觉得已经很乐观了。脚本和所有原始数据都放在我创建的一个仓库里(github.com/04RR/qServer)。只是我自己的一些东西,主要是 llama.cpp 启动参数和回归检查,没什么高深的,但 RESULTS 和 LEARNINGS 文件里有完整的扫描记录,想看细节的话可以瞅瞅(当然是用 Claude code 生成的)。
相似文章
@rumgewieselt:现在变得疯狂了……三块 1080 Ti(Pascal架构,33GB VRAM)Qwen 3.6 27B MTP 搭配 196K TurboQuant,持续 ~28-30 t/s
一位用户成功在三个 GTX 1080 Ti GPU 上对 27B 参数的 Qwen 模型进行本地推理,通过 TurboQuant 优化达到了约 28-30 tokens/秒的速度。
双3090配置:Qwen 3.6 27B 上从 400 pp tokens/s 提升到 1600 pp tokens/s... 但 tps 略降。
使用双 RTX 3090 配置的用户发现,llama.cpp 的 `--split-mode tensor` 会在 CPU 上运行提示处理(约 400 t/s),而切换到 `--split-mode layer` 则可解锁 GPU 提示处理,速度超过 1600 t/s,且 token 生成速度仅略有下降。
两块旧款RTX 2080 Ti,每块22GB显存,运行Qwen3.6 27B,使用f16 KV缓存达到38 token/s
一位用户分享其配置:使用两块改装版RTX 2080 Ti GPU(每块22GB显存)通过llama.cpp以38 token/s运行Qwen 3.6 27B,并包含关于功耗限制、张量分割模式和KV缓存设置的技巧。
@ItsmeAjayKV: 3090 更新:现在使用 Qwen 3.6-35b-a3b MoE (q6_k_xl)。首次突破 90 t/s,尚未启用 MTP,预填充速度…
用户报告使用 llama.cpp 在 RTX 3090 上运行 Qwen 3.6-35b-a3b MoE 模型,实现了超过 90 tokens/s 的推理速度,预填充速度超过 1000 t/s,表明在消费级硬件上本地部署大型语言模型是可行的。
双RTX 4060 Ti上Qwen3.6 q4xl达到125 tok/s,性价比惊人
有用户报告称,在两张RTX 4060 Ti显卡上运行Qwen3.6 q4xl达到了每秒125个token,强调性价比出色,并想知道进一步优化是否能达到150 tok/s。