4张R9700、2张Mi210 或 4张4080S 32G
摘要
用户正在比较GPU选项,如R9700、Mi210和4080S,以实现128GB VRAM用于并行运行多个AI模型,考虑因素包括成本、性能和兼容性。
我试图达到128GB的VRAM,具备合理的计算能力和带宽,以便并行运行多个模型。DS4 Flash 或 GLM 5.3 在混合模式下使用自定义检查点。但最近有点困惑,因为有很多分支,我只对NVidia的世界略知一二。所以一个选项是使用改装的4080S,大约1.7K货币单位,其优势在于支持CUDA。它具有736 GB/sec的内存带宽,但不支持NVFP4。RTX Pro 4500 太贵了,要2.7K。然后是R9700,内存带宽为640 GB/sec,价格也大约1.5K。但它是ROCm/Vulkan。它似乎发展很快?有没有地方可以阅读关于R9700与类似Intel和Nvidia产品的最新可靠比较?然后是Mi210。PCIe Gen4, HBM2x64G。成本3.5K,所以是线性翻倍。功耗减半,带宽为1600 GB/sec。看起来很棒!但似乎它对新模型格式的支持只是简单地上采样到BF16并用这些运行。我理解得对吗?这基本上就像是用16GB VRAM的卡运行新的NVFP4/MXFP4模型?而用32GB运行FP8模型?或者这才是我应该购买的宝贝?(不,我不会买更多Sparks)。
相似文章
改装版RTX 4090 48GB vs Radeon AI Pro R9700 vs Arc Pro B70:本地编程LLM选哪个?
用户寻求关于在改装版RTX 4090 48GB、双AMD Radeon AI Pro R9700或双Intel Arc Pro B70之间选择的建议,用于运行本地编程LLM,重点比较价格、显存、软件生态和推理速度的权衡。
从双3090升级 - 应该添加什么?(双A6000/5090/48GB 4090?)
关于从双RTX 3090升级到替代方案(如双A6000、RTX 5090或48GB RTX 4090)的讨论,可能用于AI/ML工作负载。
打造预算型 32GB → 48GB 显存家用 AI 服务器:2-3 张 RX 9060 XT 16GB 对比 RTX 5060 Ti 16GB,AM5 还是二手 EPYC?
一位用户正在寻求构建预算型家用 AI 服务器(32-48GB 显存)的建议,正在 AMD RX 9060 XT 和 Nvidia RTX 5060 Ti GPU 之间犹豫,并纠结于使用 AM5 还是二手 EPYC 平台来进行本地 LLM 推理和大型 MoE 模型卸载。
2026年第二季度,在3x3090(72GB显存)配置上最好的模型?
用户分享了在2026年第二季度使用3x3090(72GB显存)配置运行大型LLM的经验,推荐了GPT-OSS 120b、Qwen3.5 122b和GLM Air 4.5 106B等模型,并询问是否有更新的替代方案。
如果你有384GB(4块Blackwell),你会部署什么模型?为什么?
用户向社区询问,在拥有4块RTX PRO 6000 GPU(共384GB)的高端本地设备上,应该部署哪个大型语言模型,主要用于公司内部政策管理和思考任务。