1x32GB V100 vs 2x16GB V100 vs 5060ti 16GB 运行Qwen 3.8性能对比

Reddit r/LocalLLaMA 新闻

摘要

用户考虑将5060ti 16GB升级为1x32GB V100或2x16GB V100,以在llama.cpp中运行Qwen 3.8模型时获得更好性能,并询问同价位其他选择。

大家好,我正在考虑将目前的5060ti 16GB显卡升级。当前在使用llama.cpp运行Qwen 3.8 IQ3_S HF量化模型、设定130k上下文长度时,速度大约为40 tokens/s。系统运行在Linux上。我的目标是提升上下文容量、使用更优的量化方案,同时将5060ti释放出来用于其他任务。目前考虑的方案包括1x32GB V100和2x16GB V100。理论上,2x16GB方案由于更高的显存带宽,性能应优于5060ti和1x32GB配置。需要解决的一个问题是,我受到CPU与GPU通信带宽的限制——仅有两条PCIe x4通道可用。请问在同等价位区间内,还有什么其他优质选择?
查看原文

相似文章