CMP170Hx “Spark” 设备
摘要
作者分享了使用CMP170矿卡构建的DIY CUDA设备设置,用于运行AI模型如Qwen Flash Next,实现了出色的推理性能。
我拿到了CMP170显卡并解锁了它们。我想分享我的CUDA设置,因为它可能对其他人有用。首先,我讨厌电子垃圾,而且我们现在处于内存的特殊时期。我想拥有一个DIY CUDA设备,并且我从向一台旧的asus predator预装机添加额外显卡开始,它也有64gb DDR5。为了添加CMP170,我需要更多的CPU通道,而newegg上有一些CPU/主板/等组合的超值优惠。不需要带内存的组合,否则我会在newegg microcenter购买。总之,我买了一个便宜的机箱,一些noctua风扇用于显卡,并转移了内存/固态硬盘。将之前拥有的显卡安装在oculink插槽上,并使用主x16插槽连接到容纳两个CMP170的GPU交换机,这样它们的有效速度是2x16,并且与其他4x4显卡速度相同。结果证明,Qwen Flash Next非常适合这些显卡。还有一个deepseek的仓库,但你需要至少3张64GB显卡来运行它,而且随着价格上涨,购买二手矿卡用于LLM可能难以证明其合理性。然而……到目前为止,这些显卡表现很棒。并发性良好,Flash Next上的提示处理平均速度为4000 tps,单流解码速度为80+。没有添加MTP。第三张图片显示了我现在在这个CUDA设备中运行的三个模型(Flash Next, qwen 27b, gemma 26b)。还有其他人在这些显卡上尝试Flash Next吗?
相似文章
我实测了 CMP170HX
对英伟达 CMP170HX 矿卡改作 64GB 显存 AI 推理加速器的实测基准测试,表明它们能以可用速度运行大型本地 LLM(如 DeepSeek V4-Flash 和 gpt-oss-120B),但存在 Ampere 级吞吐量和 PCIe Gen2 x4 连接方面的注意事项。
在4080与64GB DDR5上运行Qwen Flash Q4_K_M,约8tk/s,98304上下文。
作者演示了如何在4080 GPU和64GB DDR5上运行182B的Qwen模型,通过将ngrams转移到SSD,实现了比27B模型更快、更智能的性能,使大型模型推理在消费级硬件上变得可行。
我fork了Ninfer 3090并将其转换为在CMP170HX上运行 - 使llama.cpp的Qwen3.6-35B性能翻倍
一位用户fork了Ninfer推理引擎以在CMP170HX GPU上运行,使llama.cpp的Qwen3.6-35B模型性能翻倍,并分享了配置细节。
@leopardracer: https://x.com/leopardracer/status/2055341758523883631
一位用户分享了他们搭建双GPU本地AI实验室的经验,使用了RTX 4080 Super和5060 Ti,通过llama.cpp和llama-swap运行Qwen 3.6模型,以降低API成本并实现无限制的实验。
@MinLiBuilds: https://x.com/MinLiBuilds/status/2089338660386992295
本文对比了NVIDIA DGX Spark和魔改RTX 4090在本地部署Qwen3.8-27B和Ling-3.0-flash模型的性能,提供了基准测试数据和购买建议。