哪些GPU能在DSV4 Flash和类似模型上提供良好速度,而无需运行高度量化的版本?预算约15000美元左右。
摘要
一位技术论坛用户正在寻求关于GPU的建议,用于本地运行DSV4 Flash等AI模型,以获得良好性能,并在15000美元预算内比较AMD和NVIDIA选项。
我希望自己能花15000美元在家庭实验室硬件上,但不行,这是工作用的,哈哈。正如标题所说,我们希望本地运行DSV4 Flash(和类似级别模型)以获得良好速度,包括token生成和提示处理。对于“良好”,我认为生成速度在40-50+ t/s范围内,提示预填充速度至少1000 t/s,上下文适中。我们也不想运行一个量化过度的版本,所以需要至少128 GB的VRAM。通常一次一个用户,但有时可能有2或3人同时使用,如果那时不会太卡就好了。目前考虑的几个选项:3x AMD MI210 (192 GB) 3x NVidia A40 (144 GB)。有人有这些卡在DSV4 Flash、Qwen3.8-Flash-Next或类似模型上的性能数据吗?我尝试在云租用这些进行性能测试,但目前找不到可用的。当然首选NVIDIA因为CUDA,但如果性能相似,肯定也接受AMD。那些卡上的192 GB比144 GB好得多。尽量控制在3个GPU或更少,因为那样能装进我们的Dell R740,就不必专门搭建新主机了。
相似文章
4张R9700、2张Mi210 或 4张4080S 32G
用户正在比较GPU选项,如R9700、Mi210和4080S,以实现128GB VRAM用于并行运行多个AI模型,考虑因素包括成本、性能和兼容性。
在128GB内存与约60GB显存(PCIe配置较弱)环境下运行DeepSeek-V4-Flash-0731 q4+量化版本的三次实验:实现可接受的生成速度和提示处理速度
作者在配备128GB内存的系统上实验运行DeepSeek-V4-Flash-0731的4位量化模型,通过内存锁定和提示处理策略等优化手段,达到了可接受的推理速度。
@ciruai:在配备128GB内存的AMD Ryzen AI Max+ 395 Strix Halo上测试DeepSeek v4 Flash。在中等长度上下文中获得约15 TPS……
在配备128GB内存的AMD Ryzen AI Max+ 395上测试DeepSeek v4 Flash,本地运行284B MoE模型(13B活跃参数)可达约15 TPS。成本仅需3000美元,而数据中心配置需25000美元以上,凸显了在消费级硬件上运行大型模型的可行性。
在本地用4张老款RTX 2080 Ti运行DeepSeek-V4(2000美元预算配置)。自定义图灵内核、W8A8量化,以及255个预填充token/秒!
一位开发者成功在四张RTX 2080 Ti GPU上以2500美元预算本地运行DeepSeek-V4-Flash(总计284B,激活13B),通过自定义图灵CUDA内核、W8A8量化和异构推理实现了255个预填充token/秒。该实现已开源。
DeepSeek v4 Flash 在 4090 + DDR5 上的体验
一位用户分享了在 24GB 显卡和 DDR5 内存上运行 DeepSeek v4 Flash 模型的体验,包括性能数据和优化技巧。