双RTX 3090 + EPYC主机运行qwen3.8-flash-next,速度约38令牌/秒
摘要
用户描述了一个硬件配置,包括双RTX 3090显卡和AMD EPYC CPU,用于运行Qwen3-Flash-Next模型(使用llama.cpp),单流推理速度达到38令牌/秒。用户寻求建议,是否应该添加第三块GPU或升级CPU以提高性能,特别是对于运行多个并行代理。
我的配置:
- CPU: EPYC 7551 (32c/64T, Zen 1)
- 主板: Supermicro H11SSL-i (SP3), Rev 2.0
- 内存: 128 GB DDR4-2133 (全部8通道已满)
- 显卡: 2x RTX 3090 (总48 GB, PCIe 3.0)
- 1500 W电源
运行软件:
Qwen3-Flash-Next (177B total / ~6B active MoE, IQ4_XS) 在llama.cpp上。专家模型驻留在系统内存中,热模型缓存在显存中。单流推理速度:38令牌/秒。两个并行请求时,每个约降至4令牌/秒。
预算:约800美元。
实际上,这要么是再添加一块RTX 3090,要么是升级CPU(Zen 2 "Rome" EPYC可以插入同一主板)。我认为目前更换新主板超出预算。
对于这个配置,添加第三块3090还是更换为更快/更新的CPU能带来更高的推理速度?更多/更快的内存在这里有影响吗?好奇运行类似配置的人实际测量结果如何。
我也对同时运行多个代理感兴趣,这目前会严重降低速度,因此保持多个并行代理的性能也将是一个巨大提升!
相似文章
Qwen3.8-Flash-Next 将 4xR9700 变成一个本地AI强机!使用优化的vLLM,单请求120 t/s 生成速度和12k t/s 预填充
文章报道,Qwen3.8-Flash-Next 模型在配置了 4 个 AMD R9700 GPU 的系统上,使用优化的 vLLM 和自定义 Docker 镜像,实现了每秒 120 个 token 的生成速度和每秒 12k 个 token 的预填充速度。
Qwen3.8-Flash-Next (UD-IQ4_XS) 在 2x RTX 3060 + 7800X3D 上的基准测试:从初始 36 tps 预填充到 400 tps 及其他基准测试(-sm tensor 陷阱)+ VRAM/RAM 使用情况
本文对 llama.cpp 和 ik_llama.cpp 在双 RTX 3060 硬件上运行 Qwen3.8-Flash-Next 模型进行基准测试,展示了优化 tensor splitting 和 ubatch 设置可以将预填充速度从 36 t/s 大幅提升至 400 t/s,并对比了 RAM 使用情况。
Qwen3.8-Flash-Next 在双 RTX 3090 + DDR4 上:解码速度从 17 提升至 25-29 令牌/秒,使用专家缓存 PR
用户基准测试并详述了 llama.cpp 中的 GPU 常驻专家缓存 PR,该 PR 将 Qwen3.8-Flash-Next 在双 RTX 3090 系统上的解码速度从 17 提升至 25-29 令牌/秒。
在16GB显存的RTX 4080上运行Qwen3.8-27B的提速指南
本指南说明如何配置llama.cpp的DFlash2推测解码,以在配备16GB显存的RTX 4080 GPU上实现Qwen3.8-27B模型最高1.72倍的推理速度提升。
Qwen3.8-Flash 在 RTX3090 + 64GB RAM 上运行(但你只需 12GB VRAM)
本文提供了在 RTX 3090 和 64GB RAM 上运行 Qwen3.8-Flash AI 模型的详细指南,讨论了性能指标、量化设置以及使用 llamacpp 等工具的部署步骤。