双RTX 3090 + EPYC主机运行qwen3.8-flash-next,速度约38令牌/秒

Reddit r/LocalLLaMA 新闻

摘要

用户描述了一个硬件配置,包括双RTX 3090显卡和AMD EPYC CPU,用于运行Qwen3-Flash-Next模型(使用llama.cpp),单流推理速度达到38令牌/秒。用户寻求建议,是否应该添加第三块GPU或升级CPU以提高性能,特别是对于运行多个并行代理。

我的配置: - CPU: EPYC 7551 (32c/64T, Zen 1) - 主板: Supermicro H11SSL-i (SP3), Rev 2.0 - 内存: 128 GB DDR4-2133 (全部8通道已满) - 显卡: 2x RTX 3090 (总48 GB, PCIe 3.0) - 1500 W电源 运行软件: Qwen3-Flash-Next (177B total / ~6B active MoE, IQ4_XS) 在llama.cpp上。专家模型驻留在系统内存中,热模型缓存在显存中。单流推理速度:38令牌/秒。两个并行请求时,每个约降至4令牌/秒。 预算:约800美元。 实际上,这要么是再添加一块RTX 3090,要么是升级CPU(Zen 2 "Rome" EPYC可以插入同一主板)。我认为目前更换新主板超出预算。 对于这个配置,添加第三块3090还是更换为更快/更新的CPU能带来更高的推理速度?更多/更快的内存在这里有影响吗?好奇运行类似配置的人实际测量结果如何。 我也对同时运行多个代理感兴趣,这目前会严重降低速度,因此保持多个并行代理的性能也将是一个巨大提升!
查看原文

相似文章