我实测了 CMP170HX

Reddit r/LocalLLaMA 新闻

摘要

对英伟达 CMP170HX 矿卡改作 64GB 显存 AI 推理加速器的实测基准测试,表明它们能以可用速度运行大型本地 LLM(如 DeepSeek V4-Flash 和 gpt-oss-120B),但存在 Ampere 级吞吐量和 PCIe Gen2 x4 连接方面的注意事项。

关于这些卡的传言和错误信息很多,所以我把其中一些老矿卡拿来实测了一下。我用了 4 张 8GB 卡,每张设置为 64GB。很多模型可以完整地放进单张卡,你也可以在同一张卡上同时运行几个小模型,只要它们的显存总和不超过 64GB。例如 comfyui 占用 10-12GB,qwen 再占 30-40GB,这样的组合在同一张卡上也能正常运行。我没有详尽列出那些几百 t/s 的小型 8B 或 12B 模型的结果,因为运行更大、更聪明的模型更有意义。下面是对近期一些有趣模型所做的多项测试的 AI 总结,以便清晰地展示这些卡的能力。我不是经销商,只是手头有几张在吃灰的卡。如果你是以 200 美元入手的话,那相当于中了大奖。如果你现在正考虑购买,就需要想清楚自己是否满意 30 系列(Ampere)级别的性能。由于显存巨大,它也许值得买,但你可能想等 Hopper 或 Blackwell。我可以确认,8GB 版本在 64GB 下运行良好,10GB 版本在 40GB 下运行良好,且内存吞吐更高。这里我只用了 8G 卡,因为重新上架服务器太麻烦,而且从我的测试来看差异不大。我个人不觉得 x4 PCIE 有什么问题——Gen 1 传输速率为 800MB/s,Gen 2 为 1.6GB/s。唯一让我注意到它的时候是加载大型模型,但我的 SSD 读取速度为 550MB/s,所以在把模型放到 NVMe 之前,我无法跑满 PCIE 链路。x4 PCIE 的好处是,我通过一个 x16 转 4x4 M.2 硬盘适配器(4x4 拆分,M.2 转 PCIE 转接线)安装了这 4 张 GPU,所以如果我在所有 4 个 x16 插槽上都插满 M.2 适配卡,我的小 PC 有可能运行 16 张卡,获得整整 1TB 显存。 在 4 张阉割版 A100 矿卡(GA100,70 个 SM,每张 64GB = 256GB)、约 1215GB/s HBM、PCIe Gen2 ×4、无 NVLink、150W 功耗限制下运行本地 LLM。使用 llama.cpp,-sm layer。数字为单流服务器测量值(tg = 生成 token,pp = 预填充),除非另有说明,均为 f16 KV。 1 张卡 模型 量化 · 激活参数 tg pp 最大上下文 备注 gpt-oss-20B MXFP4 · 3.6B MoE 120 2000 131K 批处理 503 t/s;单流受启动开销限制 gpt-oss-120B MXFP4 · 5.1B MoE 78 1244 131K q8 KV;最快的实用编码模型 Qwen3.6-35B-A3B Q6_K +MTP · 3B MoE 110 1700 262K little-MoE 默认(MTP tg 乐观) Qwen3.6-27B Q5_K_M +MTP · dense 47 812 262K 无 MTP 时 29 tg gemma-4-31B Q8_0 · dense 23 767 262K Q8 在速度和质量上都优于 Q6_K 2 张卡 模型 量化 · 激活参数 tg pp 最大上下文 备注 gpt-oss-120B MXFP4 · 5.1B MoE 85 1870 131K 第二张卡只带来 +48% 的 pp,tg 略有提升 Laguna-S 2.1 Q4_K_M · 8B MoE 59 968 262K "开箱即用"的分支,速度快 GLM-4.5-Air Q6_K · 12B MoE 39 1181 131K 聪明的双卡搭档 MiniMax-M2.7 IQ4_XS · 10B MoE 38 800 160K q8 KV;只有 4-bit 能装进 2 张卡 Gemma-4-31B-StyleTune Q8_0 · dense 23 ~760 131K 50 毫秒热启动 TTFT,完整 swa,显存占用大户 Mistral-Medium-3.5 128B Q4_K_XL · dense 128B 9.8 200 262K dense 超过 30B 是死路,太慢 3 张卡 模型 量化 · 激活参数 tg pp 最大上下文 备注 DeepSeek V4-Flash 0731 Q4_K_XL · 13B MoE (MLA) ~29 ~365 1M 普通版无投机解码;巨量上下文,MLA KV 占用极小 MiniMax-M2.7 Q4_K_M · 10B MoE 47 1135 192K 优于 IQ4_XS(pp +29%,质量更好) Hy3 Q4_K_M · 16B MoE 29.5 315 65K ? 已删除 ? 速度与 V4-Flash 相当,但上下文少 16 倍 DeepSeek + DSpark 草稿模型在 3 张卡上装不下 1M 上下文——显存占用约 99% 能加载,但在大型预填充时 OOM 崩溃(在 262K token 的 16K 处崩溃)。11GB 的草稿模型在 1M 上下文时需要第 4 张卡,或者把上下文限制在约 512-768K。* 4 张卡 模型 量化 · 激活参数 tg pp 最大上下文 备注 DeepSeek V4-Flash 0731 Q4_K_XL · 13B MoE 29 ~450 1M 普通版无投机解码,同上 + BF16 DSpark 草稿模型投机解码 33 400 1M 37 代码 / 28 散文 *GGUF 来自 unsloth、bartowski、lmstudio-community、poolside。许多模型测试后便被删除(因为质量或有了更好的替代品)
查看原文

相似文章