4张R9700、2张Mi210 或 4张4080S 32G

Reddit r/LocalLLaMA 新闻

摘要

用户正在比较GPU选项,如R9700、Mi210和4080S,以实现128GB VRAM用于并行运行多个AI模型,考虑因素包括成本、性能和兼容性。

我试图达到128GB的VRAM,具备合理的计算能力和带宽,以便并行运行多个模型。DS4 Flash 或 GLM 5.3 在混合模式下使用自定义检查点。但最近有点困惑,因为有很多分支,我只对NVidia的世界略知一二。所以一个选项是使用改装的4080S,大约1.7K货币单位,其优势在于支持CUDA。它具有736 GB/sec的内存带宽,但不支持NVFP4。RTX Pro 4500 太贵了,要2.7K。然后是R9700,内存带宽为640 GB/sec,价格也大约1.5K。但它是ROCm/Vulkan。它似乎发展很快?有没有地方可以阅读关于R9700与类似Intel和Nvidia产品的最新可靠比较?然后是Mi210。PCIe Gen4, HBM2x64G。成本3.5K,所以是线性翻倍。功耗减半,带宽为1600 GB/sec。看起来很棒!但似乎它对新模型格式的支持只是简单地上采样到BF16并用这些运行。我理解得对吗?这基本上就像是用16GB VRAM的卡运行新的NVFP4/MXFP4模型?而用32GB运行FP8模型?或者这才是我应该购买的宝贝?(不,我不会买更多Sparks)。
查看原文

相似文章