2 x 5070ti Qwen 27B 完整配置/统计
摘要
技术帖分享了在 2x RTX 5070 Ti GPU 上使用 vLLM cu129-nightly 运行 Qwen 27B 的性能数据,解码速度最高可达 94-87 tps,GPU KV 缓存达 170k。
继续昨天关于在 2 张 16GB 显卡上运行大家最爱的模型并最大化性能和 KV 缓存的帖子。之前帖子中的数据使用的是已废弃的 Cu130 VLLM 镜像。这里的统计基于 cu129-nightly,该版本包含 KV 缓存连接器修复和性能改进。亮点:2 个并发线程可以流畅运行,且生成速度没有下降。解码速度在 0-120k 上下文下提升到 94-87 tps,预填充为 4.6k-2.4k。你可以获得 170k GPU KV 缓存,并且额外使用 8GB 内存还能再获得 246k。这使得它非常适合本地智能体工作。附上完整的 compose 文件链接,其中包含大量关于内存使用等的额外信息。希望即将推出的 Qwen 3.8 小模型也能适应这个配置!
相似文章
两块旧款RTX 2080 Ti,每块22GB显存,运行Qwen3.6 27B,使用f16 KV缓存达到38 token/s
一位用户分享其配置:使用两块改装版RTX 2080 Ti GPU(每块22GB显存)通过llama.cpp以38 token/s运行Qwen 3.6 27B,并包含关于功耗限制、张量分割模式和KV缓存设置的技巧。
48GB VRAM + Qwen 3.6 27B 的最佳设置
一位用户分享了在双GPU配置(RTX 4090 + RTX 3090)上使用llama.cpp运行Qwen3.6 27B (Q8_0)的优化设置,在250k上下文下实现了75-100 t/s和1500 pp。
三元 Qwen3.6 27B 在 3090 上测试!
用户在 RTX 3090 上测试了三元量化版本的 Qwen3.6 27B,使用两个槽位和 100k KV 缓存,占用 21GB 显存,达到了 60 tk/s 的速度,质量良好且工具调用稳定。
Qwen 3.6 27B 投机解码基准测试:单张 RTX 3090 上实现 ~100 TPS
一份详细的基准测试,比较了单张 RTX 3090 上 Qwen 3.6 27B 的投机解码引擎,显示 ik_llama 在代码生成中达到约每秒 100 个 token。结果包括 5 种引擎变体的解码 TPS、TTFT、显存占用和上下文退化情况。
在 2x3090 NVLINK 上对 Qwen 3.6 27B MTP 进行基准测试
对 Qwen 3.6 27B MTP 在 4 张 RTX 3090 GPU 上的基准分析表明,基于 NVLink 的张量并行相较于 PCIe 配置可实现显著的吞吐量提升(最高达 +53%)。