3000美元 128GB 显存 + 256GB DDR4 内存服务器

Reddit r/LocalLLaMA 新闻

摘要

一位用户详细介绍了构建一个具有128GB显存和256GB DDR4内存的家庭推理服务器,用于AI工作负载。在使用VLLM分支处理Qwen3.8模型时,尽管最初有设置问题,但取得了令人满意的性能。

我完成了我的家庭推理服务器。首先我尝试了联想p620工作站,虽然整体性价比不错,但联想一大堆专有软件让我很烦,最终我退货了。组件:4xV620 - 1400美元 256GB DDR4 RDIMM 2666 - 610美元 Huanandzhi D12D - 410美元 EPYC 7452 - 170美元 电源 ASRock 1600 - 220美元 SSD 三星 970EVO 1TB - 已有 机箱//风扇//杂项 ~ 200美元 在这样的机器上,功耗确实不低:在Qwen3.8-next-flash Autoround W4A16上,预填充功耗700-900瓦,解码功耗500-600瓦。它能做什么 - 编辑:在vllm分支上使用MTP-2,在128k+上下文中,Qwen3.8-next-flash Autoround W4A16可以达到1.3k预填充和70tg代码/60tg散文。起初我对这台机器和qwen3.8-27b的速度感到失望。但由于Qwen3.8 next运行良好——我感到满意。希望未来有更多的优化。
查看原文

相似文章

2台配备 512GB 内存的 M3 Ultra Mac Studio

Reddit r/LocalLLaMA

硬件投入约 2.5 万美元。告诉我你们希望我在这两台设备上部署什么模型,我会协助测试。目前我已通过 Exo 后端跑通了 DeepSeek v3.2 Q8 版本;当前每台设备均在运行 GLM 5.1 Q4(正在排查为何 Exo 无法加载 Q8 版本)。静候社区完成 Kimi 2.6 针对 MLX/mmap 的优化适配。