3000美元 128GB 显存 + 256GB DDR4 内存服务器
摘要
一位用户详细介绍了构建一个具有128GB显存和256GB DDR4内存的家庭推理服务器,用于AI工作负载。在使用VLLM分支处理Qwen3.8模型时,尽管最初有设置问题,但取得了令人满意的性能。
我完成了我的家庭推理服务器。首先我尝试了联想p620工作站,虽然整体性价比不错,但联想一大堆专有软件让我很烦,最终我退货了。组件:4xV620 - 1400美元 256GB DDR4 RDIMM 2666 - 610美元 Huanandzhi D12D - 410美元 EPYC 7452 - 170美元 电源 ASRock 1600 - 220美元 SSD 三星 970EVO 1TB - 已有 机箱//风扇//杂项 ~ 200美元 在这样的机器上,功耗确实不低:在Qwen3.8-next-flash Autoround W4A16上,预填充功耗700-900瓦,解码功耗500-600瓦。它能做什么 - 编辑:在vllm分支上使用MTP-2,在128k+上下文中,Qwen3.8-next-flash Autoround W4A16可以达到1.3k预填充和70tg代码/60tg散文。起初我对这台机器和qwen3.8-27b的速度感到失望。但由于Qwen3.8 next运行良好——我感到满意。希望未来有更多的优化。
相似文章
2台配备 512GB 内存的 M3 Ultra Mac Studio
硬件投入约 2.5 万美元。告诉我你们希望我在这两台设备上部署什么模型,我会协助测试。目前我已通过 Exo 后端跑通了 DeepSeek v3.2 Q8 版本;当前每台设备均在运行 GLM 5.1 Q4(正在排查为何 Exo 无法加载 Q8 版本)。静候社区完成 Kimi 2.6 针对 MLX/mmap 的优化适配。
使用旧电脑打造家庭服务器并升级GPU。Qwen3.8 27B以每秒约30个令牌运行。
一位用户使用改装的矿卡从旧电脑搭建家庭服务器,通过驱动补丁和硬件升级,实现了Qwen 3.8 27B AI模型每秒约30个令牌的推理速度。
不到一张RTX 6000的价格,搭建768GB显存系统
一名用户使用12张64GB CMP170HX显卡构建了768GB显存系统,成本低于一张RTX 6000 Pro,能够以强劲性能本地推理各种大型AI模型。
V100四卡AI大模型,Tesla 128G服务器
宣布一款服务器配置,搭载4块Nvidia V100 GPU和128GB Tesla内存,面向AI大模型工作负载。
打造预算型 32GB → 48GB 显存家用 AI 服务器:2-3 张 RX 9060 XT 16GB 对比 RTX 5060 Ti 16GB,AM5 还是二手 EPYC?
一位用户正在寻求构建预算型家用 AI 服务器(32-48GB 显存)的建议,正在 AMD RX 9060 XT 和 Nvidia RTX 5060 Ti GPU 之间犹豫,并纠结于使用 AM5 还是二手 EPYC 平台来进行本地 LLM 推理和大型 MoE 模型卸载。