2 x 5070ti Qwen 27B 完整配置/统计

Reddit r/LocalLLaMA 新闻

摘要

技术帖分享了在 2x RTX 5070 Ti GPU 上使用 vLLM cu129-nightly 运行 Qwen 27B 的性能数据,解码速度最高可达 94-87 tps,GPU KV 缓存达 170k。

继续昨天关于在 2 张 16GB 显卡上运行大家最爱的模型并最大化性能和 KV 缓存的帖子。之前帖子中的数据使用的是已废弃的 Cu130 VLLM 镜像。这里的统计基于 cu129-nightly,该版本包含 KV 缓存连接器修复和性能改进。亮点:2 个并发线程可以流畅运行,且生成速度没有下降。解码速度在 0-120k 上下文下提升到 94-87 tps,预填充为 4.6k-2.4k。你可以获得 170k GPU KV 缓存,并且额外使用 8GB 内存还能再获得 246k。这使得它非常适合本地智能体工作。附上完整的 compose 文件链接,其中包含大量关于内存使用等的额外信息。希望即将推出的 Qwen 3.8 小模型也能适应这个配置!
查看原文

相似文章

48GB VRAM + Qwen 3.6 27B 的最佳设置

Reddit r/LocalLLaMA

一位用户分享了在双GPU配置(RTX 4090 + RTX 3090)上使用llama.cpp运行Qwen3.6 27B (Q8_0)的优化设置,在250k上下文下实现了75-100 t/s和1500 pp。

三元 Qwen3.6 27B 在 3090 上测试!

Reddit r/LocalLLaMA

用户在 RTX 3090 上测试了三元量化版本的 Qwen3.6 27B,使用两个槽位和 100k KV 缓存,占用 21GB 显存,达到了 60 tk/s 的速度,质量良好且工具调用稳定。