没人知道二手GPU集群值多少钱
摘要
关于将二手GPU集群作为债务融资抵押品时估值挑战的分析,强调了运营依赖性和硬件故障率使得传统资产评估无法进行。
暂无内容
查看缓存全文
缓存时间: 2026/07/22 20:23
# 没人知道二手GPU集群值多少钱
来源:https://ciphertalk.substack.com/p/nobody-knows-what-a-used-gpu-cluster
如果xAI对其债务违约,Apollo Global Management (https://pitchbook.com/news/articles/elon-musks-xai-reportedly-comes-back-to-the-well-for-12-billion-asset-backed-debt) 最终会涉足GPU租赁业务。这是2025年6月签署的合同 (https://fortune.com/2025/06/02/elon-musk-xai-startup-5-billion-morgan-stanley-colossus-data-center/) 中的条款,涉及摩根士丹利安排的50亿美元债务融资。贷方有权接管该公司位于孟菲斯郊外的20万GPU集群 (https://x.ai/memphis) Colossus,并将其出租给其他AI公司,直到贷款偿还完毕。
有趣的问题是,Apollo、Diameter Capital Partners或任何其他以这种方式为AI建设提供融资的贷方,是否愿意行使这一权利。
*难*的问题是,如果他们真的行使了权利,他们实际持有的会是什么。
GPU集群与建筑物几乎没有相似之处。它在任何时刻的价值取决于它如何被配置、当前性能如何、以及了解其特质的团队是否还在。所有这些都不在贷方的资产负债表中,不在他们能联系的任何人所能触及的范围内。
这是AI基础设施繁荣的核心问题之一。我无法确定为什么没有人在谈论它。数百亿美元的债务现在由芯片作为抵押,而这些芯片的价值取决于运营状态,而运营状态对定价债务的人来说是不可见的。
本周的CipherTalk探讨的是当抵押品本身可能随着运营团队一起离开时,特定类型的债务会发生什么。
---
在GPU集群运行的规模下,硬件和系统不断发生故障。保持它们高效运转是一门手艺。
现代数据中心GPU的年故障率约为9%。这个数字源于Meta的Llama 3技术报告 (https://www.datacenterdynamics.com/en/news/meta-report-details-hundreds-of-gpu-and-hbm3-related-interruptions-to-llama-3-training-run/),该报告记录了在54天训练中,16,384个H100上发生的419次意外中断,其中148次是GPU故障,72次是HBM3内存故障。在20万个GPU的规模下,这个年化率相当于每天大约50次GPU故障。按照xAI宣称的100万个GPU目标,Epoch AI预测 (https://epoch.ai/blog/hardware-failures-wont-limit-ai-scaling) 大约每三分钟就会发生一次故障。这些并非灾难性事件。这是常态。
对于信贷人员来说,真正重要的故障模式是那些看起来不像故障的。**静默数据损坏** (https://developer.nvidia.com/blog/automate-kubernetes-ai-cluster-health-with-nvsentinel/) (SDC) 是最昂贵的,一个有故障的GPU会产生错误结果而不会崩溃,这意味着一个持续多天的训练任务可能正常完成,但生成的模型权重被悄然破坏。**级联故障**是第二类,一个坏掉的GPU会导致分布在数千个其他GPU上的训练任务崩溃,损失数天的计算能力。然后是常规故障:热节流、ECC内存错误、NVLink闪断、GPU从总线上掉线。
NVIDIA构建了NVSentinel (https://developer.nvidia.com/blog/automate-kubernetes-ai-cluster-health-with-nvsentinel/),因为传统监控能检测到这些问题,但很少能修复它们。Crusoe构建了AutoClusters (https://www.crusoe.ai/resources/blog/autoclusters-minimizing-hardware-failures-in-large-gpu-clusters),因为队列等待时间是集群有效吞吐量中最大的可控变量。没有这些工具,修复时间需要数小时到数天。
运营团队的工作是保持这一切处于稳定状态。他们知道哪些机架在夏季运行过热,哪些冷却回路自上次固件更新以来一直不稳定,哪些任务在节点降级但尚未完全失效时需要重新路由。这些知识没有写下来。它存在于团队之中。
这就是作为数百亿美元债务抵押品的资产,而且这个数字还在增长。
分享 (https://ciphertalk.substack.com/p/nobody-knows-what-a-used-gpu-cluster?utm_source=substack&utm_medium=email&utm_content=share&action=share)
---
在过去十八个月里,AI基础设施的融资方式从公司债务转变为**由芯片本身提供融资**。
xAI Colossus 2 SPV是最清晰的例子。其结构 (https://techinformed.com/musks-xai-nears-20bn-raise-with-nvidia-to-fund-colossus-2-gpus/) 大致是75亿美元股权,其中高达20亿美元由NVIDIA本身贡献,以及125亿美元债务。特殊目的载体(SPV)购买NVIDIA GPU并租赁给xAI,期限为五年。Apollo和Diameter处于债务部分。Valor Equity Partners领投股权部分。债务由芯片作为抵押,而非xAI的整体资产负债表。
看看定价:xAI的50亿美元轮次定价高达12.5%。CoreWeave的GPU-backed deals (https://www.quinnemanuel.com/the-firm/publications/client-alert-emerging-litigation-risks-in-financing-ai-data-centers-boom/) 定价约为基准利率以上8.5%,之后随着贷方对该结构更加熟悉,条款有所收紧。
如果我们假设这里没有不成熟的贷方,那么我们必须假设他们收取的价格反映了他们认为的风险成本。那么,这个溢价就是猜测的价格。
范围比一家公司更广。仅CoreWeave一家就在多个SPV中持有188亿美元的GPU-collateralized debt (https://mlq.ai/research/neocloud-infrastructure/)。FluidStack与Anthropic的500亿美元交易 (https://www.fluidstack.io/about-us/blog/fluidstack-selected-by-anthropic-to-deliver-custom-data-centers-in-the-us) 使用了不同的包装,由Google提供租赁付款支持,但底层逻辑相同。
**每家新云公司和大多数主要AI实验室现在都以这种方式融资。**
[](https://substackcdn.com/image/fetch/$s_!8T7j!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F94e6ef92-e979-4fa0-8133-79edeb08dee1_1246x910.png)
其他每一种达到此规模并用作抵押的主要资产类别,背后都有数十年的价格发现基础设施。GPU几乎没有任何此类基础设施。
飞机有ISTAT认证的评估师、全球注册中心、标准化的维护日志、渡航飞行员,以及可追溯到20世纪70年代的活跃二级市场。船舶有BICA。汽车有NADA。A级写字楼有标准化的资本化率和空置率比较。石油自20世纪80年代初就有了远期曲线。
GPU在彭博终端上有Silicon Data的H100 Rental Index (https://www.silicondata.com/products/silicon-index),于2024年推出,以及Ornn AI (https://davefriedman.substack.com/p/coreweaves-30-billion-bet-on-gpu),后者在2025年10月筹集了570万美元,用于构建第一个受监管的GPU计算衍生品交易所。这就是一个现已支撑数百亿美元债务的资产类别的全部价格发现基础设施。
所有这些背后的price moves (https://newsletter.semianalysis.com/p/the-great-gpu-shortage-rental-capacity) 非常剧烈。H100每小时租赁费率从2024年初的大约8美元,跌至2025年10月的1.70美元,然后在2026年3月因无人定价的推理需求浪潮而飙升40%回到2.35美元。SemiAnalysis直言不讳:使用六年折旧表的贷方,现在看起来比那些指责他们过于慷慨的分析师更聪明。他们在猜测,并且碰巧比那些称他们鲁莽的人更接近正确答案。没有飞机贷款机构或航运贷款机构会以五年期债务承保一种价格如此波动的资产,除非有办法对冲。*他们不会被允许这样做*。
CoreWeave的GPU-backed loans定价约为基准利率以上8.5个百分点。作为对比,典型的飞机贷款定价在基准利率以上1到2个百分点,商业抵押贷款通常低于这个水平。额外的6到7个百分点是贷方为承担他们无法衡量的风险而收取的费用。没有GPU期货市场,没有标准化的残值曲线,也没有锁定远期租赁费率的方法。这个溢价就是在黑暗中承保的价格。
感谢阅读CipherTalk!这篇文章是公开的,欢迎分享。
分享 (https://ciphertalk.substack.com/p/nobody-knows-what-a-used-gpu-cluster?utm_source=substack&utm_medium=email&utm_content=share&action=share)
[](https://substackcdn.com/image/fetch/$s_!Kyt_!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F4477723b-214f-446e-ab3e-2c9e315901a1_1236x788.png)
随着市场成熟,这个利差应该会收窄。对冲工具将会出现。残值曲线将变得更加标准化。二手GPU的二级市场将深化。当这一切发生时,AI基础设施的资本成本将显著下降,这将改变谁能够大规模建设。受益的公司不是那些今天拥有最便宜GPU的公司。而是那些一旦融资基础设施跟上资产类别,就能获得廉价债务的公司。
---
关于GPU折旧速度的公开争论,暴露了账目编制者实际上的自信程度。
CoreWeave将GPU折旧期定为六年。Nebius (https://wccftech.com/coreweave-crwv-depreciates-its-gpus-over-6-years-while-its-competitor-nebius-uses-a-4-year-depreciation-period/),采用相同的商业模式和相同的硬件,将相同的芯片折旧期定为四年。AWS、微软和谷歌都在2023年将其服务器使用寿命假设从三到四年提高到六年,这一变化使它们在总计3000亿美元的合并资本支出中,每年的折旧费用减少了大约180亿美元。CoreWeave在2023年1月上市前也做了相同的会计变更,使每年报告的支出减少了数亿美元。
NVIDIA在2025年宣布,它将从两年产品周期转向一年产品周期。作为所有这些债务抵押品的芯片,将以前所未有的两倍速度变成上一代产品。
Michael Burry的主张 (https://www.cnbc.com/2025/11/11/big-short-investor-michael-burry-accuses-ai-hyperscalers-of-artificially-boosting-earnings.html) 是,超大规模企业将在2026年至2028年间累计少计折旧约1760亿美元。他预测,到2028年,Oracle的盈利将被夸大约27%,Meta约21%。撇开Burry的动机不谈,这个数学计算是可以独立验证的。如果前沿训练GPU的真实使用寿命更接近两到四年,而账面上是六年,那么账面价值与回收价值之间的差距是真实存在的,而且是巨大的。最近的推理需求激增使情况变得复杂。如果H100在超越前沿训练后确实具有生产寿命,那么六年可能没错。如果需求在2026年或2027年再次疲软,那么减记恰好发生在贷方需要其抵押品有一定价值的时候。
[](https://substackcdn.com/image/fetch/$s_!AV2w!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fa7a78412-453e-4bab-b149-2448210a69d4_1202x954.png)
GPU抵押品有三种不同的价值,而市场目前只为其中一种定价。
**面值**是SPV所说的,即购买价格减去根据借款人选择的任何时间表的直线折旧。这个数字决定了贷款价值比契约以及交易所能支持的债务金额。
**清算价值**是买方在困境中支付的价格。Secondary market data (https://introl.com/blog/secondary-gpu-markets-buying-selling-used-hardware-guide-2025) 显示,在正常条件下,中度使用2到3年的二手GPU交易价格为新品定价的50%到70%。在多家新云公司同时承压的违约情景下,买方池在供应飙升的同时萎缩,在贱卖中回收率可能仅为面值的30%到50%。
**持续经营价值**是集群作为可运营资产对下一任租户的价值,这完全取决于运营交接是否成功。
这就是第一部分中的运营现实回归之处。行使介入权的贷方继承了一个属于其他人的托管设施,以及该设施自身的合同和约束。他们继承的凭证和拓扑知识,历史上掌握在借款人的运营团队手中,而该团队在违约时已经离开。他们继承了一个租赁费率在十八个月内已向一个方向移动60%然后又向另一个方向移动40%的市场,而且没有对冲工具可用。他们继承了一种每天有50个芯片故障、必须有人知道过去一个季度哪些机架一直不稳定的资产类别。
面值与持续经营价值之间的利差,是没有人对冲的全部风险。
---
这个市场上最能说明问题的头寸,是那些没有被持有的头寸。
KKR一直是数据中心领域最激进的私募股权公司,包括2022年与Global Infrastructure Partners一起以150亿美元收购CyrusOne (https://www.themiddlemarket.com/news-analysis/private-equity-leans-into-data-center-development-as-lp-demand-surges),2026年对Global Technical Realty承诺15亿美元 (https://www.themiddlemarket.com/news-analysis/private-equity-leans-into-data-center-development-as-lp-demand-surges),以及2026年2月以51亿美元收购STT GDC (https://www.techbuzz.ai/articles/kkr-seals-5-1b-data-center-mega-deal-as-ai-demand-soars) 75%的股份。KKR的数字基础设施账簿是其1860亿美元实物资产的核心支柱。该公司不在收购Aligned Data Centers的AIP财团中,不在任何xAI SPV中,也不在CoreWeave的债务融资中。KKR拥有建筑物、电力、冷却和土地——这些基础设施层无论哪个AI实验室获胜或哪一代芯片主导,都保持价值。
Peter Thiel (https://fortune.com/2026/03/10/peter-thiel-nvidia-shares-sold-apple-microsoft-ai-bubble/) 在2025年第三季度出售了其全部NVIDIA股票,转而投资苹果和微软。芯片不是耐用品,而将其定价为耐用品的融资结构最终将不得不面对芯片的真实本质。
飞机之所以变得可融资,是因为有人建立了注册中心、评估师和维护日志。船舶之所以变得可融资,是因为有人建立了BICA。这些交易的利率溢价之所以存在,是因为没有人能回答两个基本问题:集群还在工作吗?而且:三年后它还能工作吗?回答这两个问题,建设AI基础设施的成本就会下降。
---
#### 关于此帖子的讨论
### 准备好了解更多了吗?
相似文章
如果需要四颗GPU,那么“GPU小时”就不再是商品了(6分钟阅读)
对Vast.ai上GPU租赁价格的分析显示,由于供应限制,多GPU配置的定价与每GPU小时的标价存在显著偏差,较大的集群往往不可用或更昂贵。
2026年GPU访问依然糟糕——有人正试图用计算期货市场来修复
Inferra正在构建一个GPU计算衍生品交易所,为H100、B200等芯片提供永续期货,实现价格发现和成本对冲,旨在解决不透明的GPU市场。
对15款“电子垃圾”GPU进行现代工作负载基准测试
对15款退役的NVIDIA Tesla GPU(K80、P100、V100)进行现代AI工作负载基准测试,展示它们在家庭实验室推理设置中的可行性和性价比。
@AnjneyMidha:显然不是所有人都知道这个,所以在此分享。自2026年1月以来,GPU租赁价格上涨了2倍以上。我们正经历…
自2026年1月以来,GPU租赁价格翻了一番,形成了“算力新冠”的局面,研究人员面临短缺和成本飙升。
我的4.8万美元GPU服务器值吗?
一位前FAANG工程师讲述了为独立AI研究构建一台配备六张RTX 6000 Ada显卡、价值4.8万美元的GPU服务器的经历,详细介绍了构建过程、电源限制以及与云GPU租用的成本对比。