AI GPU 的寿命可能超过三年(6分钟阅读)

TLDR AI 新闻

摘要

一篇文章质疑了 AI GPU 仅能使用三年的说法,指出其来源薄弱,并引用谷歌和 AWS 的反证表明实际使用寿命长得多。

关于 AI GPU 仅能使用三年的说法源于可疑来源,例如一条引用匿名谷歌架构师的推文。
查看原文
查看缓存全文

缓存时间: 2026/06/17 00:53

# AI GPU 的寿命很可能超过三年 来源:https://www.seangoedecke.com/ai-gpus-live-longer-than-three-years/ 那些认为当前AI应用不可持续的人(https://www.wheresyoured.at/ai-is-slowing-down),常常援引这样一个说法(https://www.tomshardware.com/pc-components/gpus/datacenter-gpu-service-life-can-be-surprisingly-short-only-one-to-three-years-is-expected-according-to-unnamed-google-architect):推理用的GPU在高负载下“最多只能撑三年”[1](#fn-1)。其核心逻辑是:一旦AI泡沫的资金枯竭,现有的基础设施很快就会过时,而市场上也不会有足够的资金来购买一大批全新的GPU。这样一来,推理成本就会迅速变得过于高昂,以至于当前的AI产品在财务上毫无意义。 那么,“最多三年”这个说法究竟从何而来?它合理吗? ### 追溯这个说法的出处 Tom's Hardware的原文引用了这条来自Tech Fund的推文(https://x.com/techfund1/status/1849031571421983140)。Tech Fund是一位匿名的前产品经理和科技投资者,他引用了一位匿名的谷歌“GenAI首席架构师”的话:“如果你的利用率很高,持续保持高利用率一两年,我认为寿命最多也就三年。” 推文(https://www.seangoedecke.com/static/9cf90a11e418ecd73f81e5178a9328c2/1b853/tweet.png) 这个截图看起来像是来自某次访谈。是哪次访谈呢?我回溯到2024年10月Tech Fund的推文,看到了大量格式类似的截图(https://x.com/techfund1/status/1828858794480140391?s=20)(https://x.com/techfund1/status/1826875528751534448?s=20),其中一些注明来自Tegus(https://tegus.com/)。Tegus显然是一家商业模式(https://www.reddit.com/r/expertnetworks/comments/1ghe2ls/tegus_analyst_reached_out_to_me/)为联系内部人士(此处指AI公司员工)并支付每小时数百美元的报酬,以回答特定技术问题的公司。这基本上就是一种为*差一点就构成*内幕交易而生的零工经济:你听起来越有见识、越自信,Tegus的分析师就越有可能在未来的面试中选中你。 我确信这条推文的来源确实是一位GenAI首席架构师,因为Tegus在付钱之前很可能要求对方提供某种证明。但很明显,这里的激励导向是:即使对某些问题并不确定,也要说得自信、有权威。基于这一点,那条引文本身读起来也让人生疑。我和许多首席工程师与架构师共事过,深知对他们随口给出的粗略估算需要持保留态度。如果他们真的知道谷歌数据中心里GPU的实际故障率和淘汰率,难道不就直接说出来了? ### 支持更长寿命的证据 我们有一些传闻证据指向相反的方向。谷歌曾公开宣称(https://www.datacenterdynamics.com/en/news/google-says-tpu-demand-is-outstripping-supply-claims-8yr-old-hardware-iterations-have-100-utilization),他们有运行了八年的TPU(谷歌自研的GPU版本)在生产环境中实现“100%利用率”。英伟达仅在2020年至2024年期间生产A100 GPU(https://www.amax.com/nvidia-h100-vs-nvidia-a100/),但在2026年2月,AWS首席执行官声称(https://www.datacenterdynamics.com/en/news/aws-has-never-retired-an-nvidia-a100-server-ceo-matt-garman-claims/),AWS从未淘汰过任何一台A100服务器(而且你仍然可以轻松租到A100用于AI工作)[2](#fn-2)。AI GPU的使用方式与加密货币挖矿GPU并不完全相同,但使用多年的二手加密货币矿卡似乎还能正常使用(https://www.youtube.com/watch?v=UFytB3bb1P8)。此外,我在Hacker News上注意到一条评论(https://news.ycombinator.com/item?id=48456717),有人称其学术机构的GPU集群已经运行了六年,故障率低于20%。 那硬数据呢?要获得AI GPU寿命的具体数据很困难,因为现代AI数据中心也才存在了几年时间。但一个有趣的研究案例是近期的超级计算机集群,例如橡树岭国家实验室的Summit(https://www.datacenterdynamics.com/en/news/oak-ridge-national-laboratory-to-retire-summit-supercomputer-in-november-2024/),该集群从2018年到2024年配备了超过2.7万块英伟达V100 GPU;或者它的前身——Cray Titan(https://christian-engelmann.de/publications/ostrouchov20gpu.pdf)超级计算机,从2012年运行到2019年。我没有找到任何证据表明Summit需要额外购买2.7万块GPU来替换旧卡,而Titan中GPU的故障情况已被仔细研究过(https://christian-engelmann.de/publications/ostrouchov20gpu.pdf): 图10(https://www.seangoedecke.com/static/3922b6bf4aaf6d3202cacd2f472034aa/019a6/figure10.png) 这些GPU笼子是垂直堆叠的,冷空气从底部泵入,这解释了为什么笼子0(底部)的存活率比笼子2(顶部)高。我们来看笼子0,这样我们就只关注GPU本身的寿命,而不是被不当冷却的GPU的寿命。在三年时,超过95%的GPU存活[3](#fn-3)。在六年时,节点2和3(靠近笼子底部的GPU)的存活率仍在90%以上,而最高节点的存活率也超过了60%。 有可能新一代的英伟达GPU不如旧款可靠(它们确实功耗更高),或者AI数据中心存在冷却不足的问题,又或者LLM的利用率对GPU造成的压力比传统GPU数据中心的工作负载更大。但至少这提供了一个旁证,表明GPU可以在负载下运行远超三年的时间。 ### 经济寿命 使问题变得复杂的是,GPU可能有一个较短的*经济*寿命。据称,一块B100 GPU的功耗(https://bizon-tech.com/blog/nvidia-b200-b100-h200-h100-a100-comparison?srsltid=AfmBOoqugX-R8Y9AoVlyxRMheglf4gJ2Xc5hefXVxL6Cv3Htl0P_rHx1)是A100的两倍,但能完成的工作量却是其五倍。对一些AI服务提供商来说,这可能意味着A100只值得运行到能够被B100替换为止(如果你受限于电力,就应该把电全部用在B100上,并淘汰那些过时的A100)。这就是为什么Titan超级计算机被退役,转而使用Summit:它本可以继续运行,但将资金和维护精力投入到新硬件上更为划算。 显而易见,这并不能支持“泡沫破裂后推理成本会更高”的论点。只要A100在*当前*还能盈利,资金紧张的AI提供商就可以继续用它们来盈利地提供推理服务,即使对于那些有资本升级的人来说还存在更高效的选择。 此外,GPU只是AI数据中心基础设施支出的一部分。如果你的GPU磨损了,你并不需要建造一个全新的数据中心。约30%-50%的数据中心支出(https://epoch.ai/assets/images/data-insights/ai-datacenter-cost-breakdown/ai-datacenter-cost-breakdown-upfront.png)(https://www.reuters.com/commentary/breakingviews/how-big-techs-630-bln-ai-splurge-will-fall-short-2026-03-26/)用于土地、电力、冷却等方面。剩下的50%-70%是整台服务器机架的成本,其中包括许多非GPU的部件。 ### 结论 就像AI推理需要消耗大量水资源(https://www.seangoedecke.com/water-impact-of-ai/)这个观点一样,AI GPU只能运行一两年这个想法之所以流行,是因为它对AI怀疑论者而言是一个有用的论点,而不是因为它真实。它源自一条化名推文,其中引用了一位匿名消息人士,而此人正被付以数百美元,以听起来像一位可信的AI专家。其他来自AI推理服务商的公开声明则引用了高得多的寿命数字,而且超级计算机(传统的超大型GPU集群案例)的统计数据也并不能支持“最长寿命为三年”的说法。 在每十八个月就有新一代GPU问世、且GPU提供商资金充裕足以升级的世界里,其*经济*寿命可能确实是三年,但这并不能告诉我们太多关于AI寒冬时期推理经济学的信息。如果资金变得非常稀缺,AI数据中心很可能会继续盈利地[4](#fn-4)运行它们的B300(或是H100,甚至A100)长达六年甚至更久。 --- 如果你喜欢这篇文章,可以考虑订阅(https://buttondown.com/seangoedecke)以获取我新文章的邮件更新,或者在Hacker News上分享它(https://news.ycombinator.com/submitlink?u=https%3A%2F%2Fwww.seangoedecke.com%2Fai-gpus-live-longer-than-three-years%2F&t=AI+GPUs+probably+live+longer+than+three+years)。 以下是一篇与本文标签相关的文章的预览。 > AI泡沫破裂后会发生什么?19世纪中期,美国陷入了铁路狂潮。在五年内,修建了超过三万英里的铁路。这一切很大程度上是由消费者对铁路公司的投资热潮资助的,铁路公司当时被认为是安全且利润丰厚的赌注。1873年,泡沫破裂了。成千上万的美国人失去了积蓄,大约三分之一的铁路公司破产。但铁路线并没有消失。它们被幸存下来的铁路公司廉价收购,并在接下来的百年里承载了大量的列车。继续阅读……(https://www.seangoedecke.com/after-the-ai-bubble/)

相似文章

谁害怕那个又大又可怕的GPU?

The Verge

本文探讨了驱动AI热潮的GPU在环境和伦理上的代价,从制造过程到数据中心的能源和水消耗,并质疑其收益是否足以抵消影响。

AI经济学 第二部分(11分钟阅读)

TLDR AI

本文分析了AI的经济学,聚焦于GPU资源的争夺战,将人类推理的尖峰负载与智能体连续工作负载进行对比,并认为当前基础设施是为人类使用而优化的,而非要求更高的智能体推理。