你准备好迎接 Le Chaton FAT 了吗?还是继续在 GPU 上浪费钱?
摘要
作者分享了为本地 AI 推理优化的存储服务器构建,该构建面向传闻中的 26T-a3b 模型“Le Chaton FAT”,并使用高容量 NVMe 驱动器配合 ZFS 来存储模型。
根据(我自己散布的)传闻,Le Chaton FAT 将是 26T-a3b,我已经准备好了。说实话,我买不起那么多 5060Ti,所以我弄了 12 块 Gen 4 3.2 TB(每张卡配两块)。这让我在 30TB 上拥有约 60GB/s 的带宽。我还加了 256GB DDR4 专门用于 KV cache,但我也能把 KV-cache 写进磁盘,这些都是高耐久度驱动器。你准备好迎接本地推理的下一个时代了吗?开个玩笑,这就是我用来当 HF_HOME——模型和数据集存储的东西。我也在设置一些容器,但它不跑任何重型计算任务,CPU 只是 3945WX(12c/24t)。这个池实际上用的是 raidz2,所以我不用担心 agent 删除东西。我只要做 ZFS 快照,就没有什么 `rm -rf foo-bar` 能让我冒汗了。完整规格:CPU: Threadripper 3945WX;CPU 散热器: Arctic Freezer 4U-M Rev. 2;内存: 8x32GB DDR4 ECC REG 2133;GPU: 无;主板: Asrock WRX80 Creator;机箱: Silverstone SST-RM47-502I;电源: 1600W Corsair;存储: 1TB NVMe + 6x Intel SSD D7-P5608 6.4TB。这很大程度上是多次从二手市场“捡漏”的产物。这些 SSD 接在 PCIe x8 接口上,但实际上它被拆成两个 x4 接口,所以每个插槽都需要 x4x4x4x4 的分叉(bifurcation)。
相似文章
打造预算型 32GB → 48GB 显存家用 AI 服务器:2-3 张 RX 9060 XT 16GB 对比 RTX 5060 Ti 16GB,AM5 还是二手 EPYC?
一位用户正在寻求构建预算型家用 AI 服务器(32-48GB 显存)的建议,正在 AMD RX 9060 XT 和 Nvidia RTX 5060 Ti GPU 之间犹豫,并纠结于使用 AM5 还是二手 EPYC 平台来进行本地 LLM 推理和大型 MoE 模型卸载。
V100四卡AI大模型,Tesla 128G服务器
宣布一款服务器配置,搭载4块Nvidia V100 GPU和128GB Tesla内存,面向AI大模型工作负载。
@andrewchen:体验本地AI模型的主要缺点在于你会买一块GPU,然后另一块,接着又一块……
Andrew Chen分享了他为本地AI实验购买多块GPU的经历,在5090 eGPU上以100 tok/s运行Qwen3.6 27B密集模型,并将其与Sonnet 4.6进行比较。
@RayFernando1337: https://x.com/RayFernando1337/status/2070621713952579990
关于是在本地运行AI模型还是通过API运行的详细分析,涵盖了RTX 5090、RTX PRO 6000和DGX Spark等硬件选项,重点讨论了内存与带宽的权衡、成本考虑以及隐私需求。
@leopardracer: https://x.com/leopardracer/status/2055341758523883631
一位用户分享了他们搭建双GPU本地AI实验室的经验,使用了RTX 4080 Super和5060 Ti,通过llama.cpp和llama-swap运行Qwen 3.6模型,以降低API成本并实现无限制的实验。