需要说明的是,拥有硬件本身也并不容易!
摘要
一家公司分享了采购和维护用于AI推理的HGX B300的实际困难,包括高昂的成本(110万欧元)、电力与空间需求以及供应有限,并给出了GLM 5.2的吞吐量估算。
我的公司目前正在尝试购买一台用于GLM 5.2的HGX B300。仅购买就需要大约110万欧元——这是我们一个月前收到的报价。然后还需要一个放置它的地方,以及至少0.25到0.5个全职人力维护。它可能能用2到5年,但到今年年底它甚至都不会是最新一代产品。一台HGX B300大约能提供每秒7000个token,而一个活跃用户使用GLM 5.2需要大约每秒40到50个token。实际上,这大约相当于20个并发编程用户,或者120到180个RAG用户。而且B300的供应量不多,所以即使你有钱,也可能买不到!
相似文章
在预算低于2500美元的硬件上运行GLM5.2。
一份指南,展示如何使用二手服务器组件构建一套成本低于2500美元的系统,以便本地运行GLM5.2及其他大型AI模型,代价是速度会有所妥协。
“硬件是唯一的护城河”——我们应该现在购买新硬件还是等待?
文章讨论了硬件作为AI竞争优势日益增长的重要性,指出领先实验室更注重产品竞争力和计算规模,而非纯粹的AGI研究。文章强调了由此导致的消费级GPU供应紧张和硬件升级成本上升的问题。
在中国购买AI加速器/GPU……
用户询问在中国购买用于推理的国产AI加速器/GPU,特别是寻找华为替代英伟达的产品,并希望支持vLLM或Llama.cpp。
数百万美元AI资金背后:企业GPU平均利用率仅5%,推理成本与所有权成本从34%升至41%
急于购买大规模GPU集群部署AI的企业,如今面临低利用率(5%)和成本飙升(推理加所有权成本从34%升至41%)的困境,凸显AI部署中的重大基础设施低效问题。
@julien_c: 什么硬件真正驱动着开源AI?不是基准测试。不是供应商营销。真实世界的社区使用。我们正在…
Hugging Face 推出新的硬件资源,用于追踪开源AI社区中GPU、CPU、VRAM及推理硬件趋势的真实使用情况。