GPU选型指南(每美元显存容量与带宽)
摘要
本文通过每GB成本及带宽指标对各类GPU进行对比,旨在帮助用户优化脚本运行性能。
希望这份指南能对大家有所帮助。我的脚本使用了LocalLLaMA、LowEndLocalAI以及LocalLLM相关论坛中讨论最多的那些GPU。起初我本想列出更多型号,但那样会导致内容过于冗长难以阅读。价格数据来源于ChatGPT,可能存在误差;在有最新价格的情况下会优先使用,否则则参考二手市场价格。虽然这只是一份基础的对比资料,但总比没有好。例如,通过它就能看出某款GPU在理论性能上相比3090是更快还是更慢。
相似文章
我比较了这里使用的主要GPU/机器的所有规格,因为带宽不是一切。你们有些人需要认清现实。
作者比较了用于LLM推理的各种GPU,批判了常见的基准测试,并强调了预填充性能比生成速度更重要,针对不同预算和使用场景给出了建议。
Computable GPU Index (CGI)
Computable GPU Index (CGI) 是一个开源价格指数,它根据各种提供商的租赁费率计算每GPU小时的美元价格。它为基准测试GPU计算成本提供了一种数学上稳健且可重现的方法。
性价比不断提升,成本不断降低
Wafer 证实,AMD MI355X GPU 在推理前沿模型(如 GLM5.2)时,提供了有竞争力的性能,且成本远低于 NVIDIA Blackwell,使用 MXFP4 量化和 sglang 框架,以不到一半的价格实现了 B200 80% 的吞吐量。
如果需要四颗GPU,那么“GPU小时”就不再是商品了(6分钟阅读)
对Vast.ai上GPU租赁价格的分析显示,由于供应限制,多GPU配置的定价与每GPU小时的标价存在显著偏差,较大的集群往往不可用或更昂贵。
@akshay_pachaar:GPU架构详解。普遍的假设是,更快的GPU意味着更强的计算能力,所以一款每秒能执行更多操作的芯片应该每秒能生成更多token……
本文以NVIDIA H100为例,阐明了GPU在AI推理中的性能受限于内存带宽而非算力,并解释了GPU架构及其对token生成速率的影响。