如果你有15万美元预算,要搭建一个服务300人的生产级本地推理服务器,你会买什么?

Reddit r/LocalLLaMA 新闻

摘要

一位用户寻求建议,希望以低于15万美元的价格购买一台故障转移推理服务器,用于服务300人,讨论了使用二手H100、RTX Pro 6000和DGX Station等选项来运行vLLM上的122b AWQ模型。

我知道我们平时主要关注家庭实验室的东西,但我现在需要购买一台用于生产推理服务器的故障转移服务器,预算低于15万美元。我们的主生产服务器有4块H100,所以我希望找到一台性能容量相近的设备(如果可能的话)。显然H100已接近产品周期末期,所以我认为应该有更新的产品,性能不差甚至更好,而且价格合理。我明白现在可能是历史上购买硬件最糟糕的时机,但我实在等不起市场好转。我在寻找目前推理领域性价比最高的方案。我曾考虑购买DGX Station用于推理,但至今没找到有售的。于是我想到或许可以买一台SuperMicro机架式服务器,内置4块RTX Pro 6000。这是不是用vLLM服务本地模型给几百人的最佳选择?我们的生产环境在vLLM上运行122b AWQ模型,上下文长度256k,张量并行度为2。所以我需要的是能处理甚至超越这个需求的设备。我们同一台服务器上还运行一个小型嵌入模型。我知道15万美元现在买不了多少东西。这种情况下你们有什么建议?
查看原文

相似文章