4090 + 5060 Ti + 64GB RAM:35B-A3B 达 206 t/s,122B 达 37 t/s

Reddit r/LocalLLaMA 新闻

摘要

一位用户分享了在双 GPU(RTX 4090 和 RTX 5060 Ti)上运行大语言模型(Qwen 27B-122B)的基准测试结果,实现了极高的 token 生成速度(例如 35B-A3B 达到 206 t/s,122B 达到 37-41 t/s)。帖子包含配置详情以及指向 GitHub 仓库的链接,其中包含脚本和原始数据。

过去几周我一直在测试一套双卡系统,有些数字至今仍让我惊叹不已,所以干脆把它们晒出来。配置:RTX 4090(24GB)+ RTX 5060 Ti(16GB),i9-13900K,64GB DDR5。WSL2 分配给虚拟机 47GB,CUDA 12.8(特别注意是 12.8,13.1 会在 Blackwell 上导致 llama.cpp 的 MMQ 内核出现段错误,并静默回退到 cuBLAS,这让我在发现之前花了大约 6 倍的时间处理提示词)。llama.cpp 针对 89;120 编译。以下所有测试均采用 131K 上下文和 q8_0 KV 缓存,在短代码生成场景下测量。 模型放置 MTP 开启 MTP 关闭 Qwen3.6-27B 密集模型,Q4_K_XL 仅 4090 101–118 t/s 44 t/s Qwen3.6-27B 密集模型,Q6_K_XL 双卡,分层 64 t/s - Qwen3.6-35B-A3B,Q4_K_XL 4090 + 6 个专家层溢出 206 t/s 113 t/s Qwen3.5-122B-A10B,IQ3_S 4090 + 5060 Ti + 约 15GB 内存 37–41 t/s 24 t/s 122B 那个结果我反复看了好几遍。这是一个 1220 亿参数的模型,其中 17 层驻留在系统内存中,生成速度居然比大多数人的 8B 系统还快。我跑之前自己粗略估算的是 20–30 t/s,还觉得已经很乐观了。脚本和所有原始数据都放在我创建的一个仓库里(github.com/04RR/qServer)。只是我自己的一些东西,主要是 llama.cpp 启动参数和回归检查,没什么高深的,但 RESULTS 和 LEARNINGS 文件里有完整的扫描记录,想看细节的话可以瞅瞅(当然是用 Claude code 生成的)。
查看原文

相似文章