我实测了 CMP170HX
摘要
对英伟达 CMP170HX 矿卡改作 64GB 显存 AI 推理加速器的实测基准测试,表明它们能以可用速度运行大型本地 LLM(如 DeepSeek V4-Flash 和 gpt-oss-120B),但存在 Ampere 级吞吐量和 PCIe Gen2 x4 连接方面的注意事项。
关于这些卡的传言和错误信息很多,所以我把其中一些老矿卡拿来实测了一下。我用了 4 张 8GB 卡,每张设置为 64GB。很多模型可以完整地放进单张卡,你也可以在同一张卡上同时运行几个小模型,只要它们的显存总和不超过 64GB。例如 comfyui 占用 10-12GB,qwen 再占 30-40GB,这样的组合在同一张卡上也能正常运行。我没有详尽列出那些几百 t/s 的小型 8B 或 12B 模型的结果,因为运行更大、更聪明的模型更有意义。下面是对近期一些有趣模型所做的多项测试的 AI 总结,以便清晰地展示这些卡的能力。我不是经销商,只是手头有几张在吃灰的卡。如果你是以 200 美元入手的话,那相当于中了大奖。如果你现在正考虑购买,就需要想清楚自己是否满意 30 系列(Ampere)级别的性能。由于显存巨大,它也许值得买,但你可能想等 Hopper 或 Blackwell。我可以确认,8GB 版本在 64GB 下运行良好,10GB 版本在 40GB 下运行良好,且内存吞吐更高。这里我只用了 8G 卡,因为重新上架服务器太麻烦,而且从我的测试来看差异不大。我个人不觉得 x4 PCIE 有什么问题——Gen 1 传输速率为 800MB/s,Gen 2 为 1.6GB/s。唯一让我注意到它的时候是加载大型模型,但我的 SSD 读取速度为 550MB/s,所以在把模型放到 NVMe 之前,我无法跑满 PCIE 链路。x4 PCIE 的好处是,我通过一个 x16 转 4x4 M.2 硬盘适配器(4x4 拆分,M.2 转 PCIE 转接线)安装了这 4 张 GPU,所以如果我在所有 4 个 x16 插槽上都插满 M.2 适配卡,我的小 PC 有可能运行 16 张卡,获得整整 1TB 显存。
在 4 张阉割版 A100 矿卡(GA100,70 个 SM,每张 64GB = 256GB)、约 1215GB/s HBM、PCIe Gen2 ×4、无 NVLink、150W 功耗限制下运行本地 LLM。使用 llama.cpp,-sm layer。数字为单流服务器测量值(tg = 生成 token,pp = 预填充),除非另有说明,均为 f16 KV。
1 张卡 模型 量化 · 激活参数 tg pp 最大上下文 备注
gpt-oss-20B MXFP4 · 3.6B MoE 120 2000 131K 批处理 503 t/s;单流受启动开销限制
gpt-oss-120B MXFP4 · 5.1B MoE 78 1244 131K q8 KV;最快的实用编码模型
Qwen3.6-35B-A3B Q6_K +MTP · 3B MoE 110 1700 262K little-MoE 默认(MTP tg 乐观)
Qwen3.6-27B Q5_K_M +MTP · dense 47 812 262K 无 MTP 时 29 tg
gemma-4-31B Q8_0 · dense 23 767 262K Q8 在速度和质量上都优于 Q6_K
2 张卡 模型 量化 · 激活参数 tg pp 最大上下文 备注
gpt-oss-120B MXFP4 · 5.1B MoE 85 1870 131K 第二张卡只带来 +48% 的 pp,tg 略有提升
Laguna-S 2.1 Q4_K_M · 8B MoE 59 968 262K "开箱即用"的分支,速度快
GLM-4.5-Air Q6_K · 12B MoE 39 1181 131K 聪明的双卡搭档
MiniMax-M2.7 IQ4_XS · 10B MoE 38 800 160K q8 KV;只有 4-bit 能装进 2 张卡
Gemma-4-31B-StyleTune Q8_0 · dense 23 ~760 131K 50 毫秒热启动 TTFT,完整 swa,显存占用大户
Mistral-Medium-3.5 128B Q4_K_XL · dense 128B 9.8 200 262K dense 超过 30B 是死路,太慢
3 张卡 模型 量化 · 激活参数 tg pp 最大上下文 备注
DeepSeek V4-Flash 0731 Q4_K_XL · 13B MoE (MLA) ~29 ~365 1M 普通版无投机解码;巨量上下文,MLA KV 占用极小
MiniMax-M2.7 Q4_K_M · 10B MoE 47 1135 192K 优于 IQ4_XS(pp +29%,质量更好)
Hy3 Q4_K_M · 16B MoE 29.5 315 65K ? 已删除 ? 速度与 V4-Flash 相当,但上下文少 16 倍
DeepSeek + DSpark 草稿模型在 3 张卡上装不下 1M 上下文——显存占用约 99% 能加载,但在大型预填充时 OOM 崩溃(在 262K token 的 16K 处崩溃)。11GB 的草稿模型在 1M 上下文时需要第 4 张卡,或者把上下文限制在约 512-768K。*
4 张卡 模型 量化 · 激活参数 tg pp 最大上下文 备注
DeepSeek V4-Flash 0731 Q4_K_XL · 13B MoE 29 ~450 1M 普通版无投机解码,同上
+ BF16 DSpark 草稿模型投机解码 33 400 1M 37 代码 / 28 散文
*GGUF 来自 unsloth、bartowski、lmstudio-community、poolside。许多模型测试后便被删除(因为质量或有了更好的替代品)
相似文章
PSA:Nvidia的CMP 170HX完全计算和内存(80GB)可能可通过漏洞解锁
Nvidia Falcon安全处理器中的一个潜在漏洞可能允许将性能受限的CMP 170HX加密货币挖矿GPU解锁为完整的A100 80GB,有望使高端AI硬件以不到1000美元的价格获得。
@ciruai:在配备128GB内存的AMD Ryzen AI Max+ 395 Strix Halo上测试DeepSeek v4 Flash。在中等长度上下文中获得约15 TPS……
在配备128GB内存的AMD Ryzen AI Max+ 395上测试DeepSeek v4 Flash,本地运行284B MoE模型(13B活跃参数)可达约15 TPS。成本仅需3000美元,而数据中心配置需25000美元以上,凸显了在消费级硬件上运行大型模型的可行性。
@bdsqlsz: 突发新闻:64GB CMP 170HX NVIDIA GPU(a100 tensor core)在中国二手市场现身,仅售1170美元。…
一款配备A100张量核心的64GB CMP 170HX NVIDIA GPU在中国二手市场以1170美元的价格出现,并且通过一个软件漏洞成功移除了其算力限制。
在本地用4张老款RTX 2080 Ti运行DeepSeek-V4(2000美元预算配置)。自定义图灵内核、W8A8量化,以及255个预填充token/秒!
一位开发者成功在四张RTX 2080 Ti GPU上以2500美元预算本地运行DeepSeek-V4-Flash(总计284B,激活13B),通过自定义图灵CUDA内核、W8A8量化和异构推理实现了255个预填充token/秒。该实现已开源。
台湾公司Skymizer发布HTX301 - 配备384GB内存、功耗约240瓦的PCIE推理卡
Skymizer发布HTX301,一款能够本地运行700B参数大语言模型、拥有高内存和低功耗的PCIE推理卡。