你准备好迎接 Le Chaton FAT 了吗?还是继续在 GPU 上浪费钱?

Reddit r/LocalLLaMA 新闻

摘要

作者分享了为本地 AI 推理优化的存储服务器构建,该构建面向传闻中的 26T-a3b 模型“Le Chaton FAT”,并使用高容量 NVMe 驱动器配合 ZFS 来存储模型。

根据(我自己散布的)传闻,Le Chaton FAT 将是 26T-a3b,我已经准备好了。说实话,我买不起那么多 5060Ti,所以我弄了 12 块 Gen 4 3.2 TB(每张卡配两块)。这让我在 30TB 上拥有约 60GB/s 的带宽。我还加了 256GB DDR4 专门用于 KV cache,但我也能把 KV-cache 写进磁盘,这些都是高耐久度驱动器。你准备好迎接本地推理的下一个时代了吗?开个玩笑,这就是我用来当 HF_HOME——模型和数据集存储的东西。我也在设置一些容器,但它不跑任何重型计算任务,CPU 只是 3945WX(12c/24t)。这个池实际上用的是 raidz2,所以我不用担心 agent 删除东西。我只要做 ZFS 快照,就没有什么 `rm -rf foo-bar` 能让我冒汗了。完整规格:CPU: Threadripper 3945WX;CPU 散热器: Arctic Freezer 4U-M Rev. 2;内存: 8x32GB DDR4 ECC REG 2133;GPU: 无;主板: Asrock WRX80 Creator;机箱: Silverstone SST-RM47-502I;电源: 1600W Corsair;存储: 1TB NVMe + 6x Intel SSD D7-P5608 6.4TB。这很大程度上是多次从二手市场“捡漏”的产物。这些 SSD 接在 PCIe x8 接口上,但实际上它被拆成两个 x4 接口,所以每个插槽都需要 x4x4x4x4 的分叉(bifurcation)。
查看原文

相似文章