如果你有15万美元预算,要搭建一个服务300人的生产级本地推理服务器,你会买什么?
摘要
一位用户寻求建议,希望以低于15万美元的价格购买一台故障转移推理服务器,用于服务300人,讨论了使用二手H100、RTX Pro 6000和DGX Station等选项来运行vLLM上的122b AWQ模型。
我知道我们平时主要关注家庭实验室的东西,但我现在需要购买一台用于生产推理服务器的故障转移服务器,预算低于15万美元。我们的主生产服务器有4块H100,所以我希望找到一台性能容量相近的设备(如果可能的话)。显然H100已接近产品周期末期,所以我认为应该有更新的产品,性能不差甚至更好,而且价格合理。我明白现在可能是历史上购买硬件最糟糕的时机,但我实在等不起市场好转。我在寻找目前推理领域性价比最高的方案。我曾考虑购买DGX Station用于推理,但至今没找到有售的。于是我想到或许可以买一台SuperMicro机架式服务器,内置4块RTX Pro 6000。这是不是用vLLM服务本地模型给几百人的最佳选择?我们的生产环境在vLLM上运行122b AWQ模型,上下文长度256k,张量并行度为2。所以我需要的是能处理甚至超越这个需求的设备。我们同一台服务器上还运行一个小型嵌入模型。我知道15万美元现在买不了多少东西。这种情况下你们有什么建议?
相似文章
打造预算型 32GB → 48GB 显存家用 AI 服务器:2-3 张 RX 9060 XT 16GB 对比 RTX 5060 Ti 16GB,AM5 还是二手 EPYC?
一位用户正在寻求构建预算型家用 AI 服务器(32-48GB 显存)的建议,正在 AMD RX 9060 XT 和 Nvidia RTX 5060 Ti GPU 之间犹豫,并纠结于使用 AM5 还是二手 EPYC 平台来进行本地 LLM 推理和大型 MoE 模型卸载。
如果你有384GB(4块Blackwell),你会部署什么模型?为什么?
用户向社区询问,在拥有4块RTX PRO 6000 GPU(共384GB)的高端本地设备上,应该部署哪个大型语言模型,主要用于公司内部政策管理和思考任务。
在单个8xA100节点上运行405B模型,热加载多达30个微调专家,切换时间低于200毫秒,这种场景有实际用途吗?
一位开发者分享了他们在单个8xA100节点上运行Llama 3.1 405B(AWQ int4)的经验,可热加载多达30个微调LoRA适配器,切换时间低于200毫秒,在超过60天的无重启运行中,为敏感的健康和法律任务实现了稳定的推理。
为Qwen3 30B模型(Q8量化)搭建本地AI服务器:这个硬件合适吗?
讨论搭建用于Qwen3 30B模型(Q8量化)的本地AI服务器,质疑所选硬件是否合适。
@TheAhmadOsman: 温馨提醒,开始使用本地AI所需的一切就是: - 2x RTX 3090(在r/hardwareswap上花$700-$900入手) -…
提醒一下,两块RTX 3090加上Qwen 3.6 27B或Gemma 4 31B等开源模型,就可以运行强大的本地AI代理,性能堪比Opus 4.5,配合Claude Code、自托管SearXNG等工具使用。