哪些GPU能在DSV4 Flash和类似模型上提供良好速度,而无需运行高度量化的版本?预算约15000美元左右。

Reddit r/LocalLLaMA 新闻

摘要

一位技术论坛用户正在寻求关于GPU的建议,用于本地运行DSV4 Flash等AI模型,以获得良好性能,并在15000美元预算内比较AMD和NVIDIA选项。

我希望自己能花15000美元在家庭实验室硬件上,但不行,这是工作用的,哈哈。正如标题所说,我们希望本地运行DSV4 Flash(和类似级别模型)以获得良好速度,包括token生成和提示处理。对于“良好”,我认为生成速度在40-50+ t/s范围内,提示预填充速度至少1000 t/s,上下文适中。我们也不想运行一个量化过度的版本,所以需要至少128 GB的VRAM。通常一次一个用户,但有时可能有2或3人同时使用,如果那时不会太卡就好了。目前考虑的几个选项:3x AMD MI210 (192 GB) 3x NVidia A40 (144 GB)。有人有这些卡在DSV4 Flash、Qwen3.8-Flash-Next或类似模型上的性能数据吗?我尝试在云租用这些进行性能测试,但目前找不到可用的。当然首选NVIDIA因为CUDA,但如果性能相似,肯定也接受AMD。那些卡上的192 GB比144 GB好得多。尽量控制在3个GPU或更少,因为那样能装进我们的Dell R740,就不必专门搭建新主机了。
查看原文

相似文章

4张R9700、2张Mi210 或 4张4080S 32G

Reddit r/LocalLLaMA

用户正在比较GPU选项,如R9700、Mi210和4080S,以实现128GB VRAM用于并行运行多个AI模型,考虑因素包括成本、性能和兼容性。