4090 + 5060 Ti + 64GB RAM:35B-A3B 达 206 t/s,122B 达 37 t/s
摘要
一位用户分享了在双 GPU(RTX 4090 和 RTX 5060 Ti)上运行大语言模型(Qwen 27B-122B)的基准测试结果,实现了极高的 token 生成速度(例如 35B-A3B 达到 206 t/s,122B 达到 37-41 t/s)。帖子包含配置详情以及指向 GitHub 仓库的链接,其中包含脚本和原始数据。
过去几周我一直在测试一套双卡系统,有些数字至今仍让我惊叹不已,所以干脆把它们晒出来。配置:RTX 4090(24GB)+ RTX 5060 Ti(16GB),i9-13900K,64GB DDR5。WSL2 分配给虚拟机 47GB,CUDA 12.8(特别注意是 12.8,13.1 会在 Blackwell 上导致 llama.cpp 的 MMQ 内核出现段错误,并静默回退到 cuBLAS,这让我在发现之前花了大约 6 倍的时间处理提示词)。llama.cpp 针对 89;120 编译。以下所有测试均采用 131K 上下文和 q8_0 KV 缓存,在短代码生成场景下测量。
模型放置 MTP 开启 MTP 关闭
Qwen3.6-27B 密集模型,Q4_K_XL 仅 4090 101–118 t/s 44 t/s
Qwen3.6-27B 密集模型,Q6_K_XL 双卡,分层 64 t/s -
Qwen3.6-35B-A3B,Q4_K_XL 4090 + 6 个专家层溢出 206 t/s 113 t/s
Qwen3.5-122B-A10B,IQ3_S 4090 + 5060 Ti + 约 15GB 内存 37–41 t/s 24 t/s
122B 那个结果我反复看了好几遍。这是一个 1220 亿参数的模型,其中 17 层驻留在系统内存中,生成速度居然比大多数人的 8B 系统还快。我跑之前自己粗略估算的是 20–30 t/s,还觉得已经很乐观了。脚本和所有原始数据都放在我创建的一个仓库里(github.com/04RR/qServer)。只是我自己的一些东西,主要是 llama.cpp 启动参数和回归检查,没什么高深的,但 RESULTS 和 LEARNINGS 文件里有完整的扫描记录,想看细节的话可以瞅瞅(当然是用 Claude code 生成的)。
相似文章
@rumgewieselt:现在变得疯狂了……三块 1080 Ti(Pascal架构,33GB VRAM)Qwen 3.6 27B MTP 搭配 196K TurboQuant,持续 ~28-30 t/s
一位用户成功在三个 GTX 1080 Ti GPU 上对 27B 参数的 Qwen 模型进行本地推理,通过 TurboQuant 优化达到了约 28-30 tokens/秒的速度。
双3090配置:Qwen 3.6 27B 上从 400 pp tokens/s 提升到 1600 pp tokens/s... 但 tps 略降。
使用双 RTX 3090 配置的用户发现,llama.cpp 的 `--split-mode tensor` 会在 CPU 上运行提示处理(约 400 t/s),而切换到 `--split-mode layer` 则可解锁 GPU 提示处理,速度超过 1600 t/s,且 token 生成速度仅略有下降。
实验:Qwen3.8-2.4T-A95B 在 RTX 5090 + RTX 5060 Ti 上本地运行,约 0.80 tok/s
一个实验,使用 llama.cpp 在双消费级 GPU(RTX 5090 + 5060 Ti)上本地运行 Qwen3.8-2.4T-A95B MoE 模型,启用 MTP 推测解码后达到约 0.8 tok/s。
在 RTX 3060 + 5060 Ti 上成功运行 Qwen 3.8 27B EXL3
一名用户成功运行了 Qwen 3.8 27B AI 模型在 RTX 3060 和 5060 Ti GPU 的混合设置上,使用 exllamav3 的张量并行技术,在启用 MTP 的情况下达到约每秒 50 个令牌的速度。
我将 Qwen3.8-27B 在 RTX 3090 上优化至单请求 99 tps 和批量请求 1150 tps
作者在 RTX 3090 GPU 上优化了 Qwen3.8-27B 模型的推理,通过各种量化和优化技术,实现了单请求高达 99 tps 和批量处理 1150 tps 的性能,并在 GitHub 上发布了更新的代码。