停止购买新硬件的理由(或者,为什么推理成本越来越低)
摘要
该文认为,AI模型效率提升如此之快,以至于维持固定智能水平所需的硬件成本大约每3个月减半,这使得租赁前沿智能或拥有落后硬件比购买新硬件更经济。
暂无内容
查看缓存全文
缓存时间: 2026/07/24 17:11
# 停止购买新硬件的原因
来源:https://cascadia.to/blog/intelligence-deflation
博客 (https://cascadia.to/blog) 研究 2026年7月18日 12分钟阅读
标题“智力通缩”与一排带有状态指示灯闪烁显示的服务器机架。一排服务器,状态指示灯亮着,逐渐消失在浅景深中。
## 前沿 AI 模型每季度都在进步,但运行同等智力水平的模型所需的硬件量大约每 3 个月减半。
尽管硬件价格在上涨,但模型性能持续提升,而同等智力水平的模型尺寸却在缩小。这意味着组织所需的硬件可能比他们以为的要少。我们的论点是:要实现最佳经济效果,你有两个选择:要么租用前沿智力,要么拥有落后边缘。
## 更好的模型变得更小
过去几年里,最强大的模型可供任何拥有 API 密钥的人使用,并且性能稳步提升。
人工智能分析(Artificial Analysis)显示,公众可用的最佳模型在其智力指数上每年提升约 19 分,而且加速态势不减。Epoch AI 确定,自 2024 年 4 月以来,前沿模型的改进速度几乎翻了一番,用他们的 Epoch 能力指数(ECI)评分。[3]
前沿模型持续变得更好,但很少有研究关注一个事实:模型在每一尺寸下的能力都在指数级增长。许多人应该问的问题是:一旦某种智力水平存在,需要多少硬件才能复现它?
2023 年 3 月,达到 GPT-4 级别能力估计需要 1.8 万亿参数。[4] 到 2026 年 7 月,达到 GPT-4 级别能力可以装入一个约 140 亿参数的模型中。这比之前小了约 129 倍,所需的计算量大大减少。
其他模型基准也遵循类似的趋势。o1 级别能力在十一个月内从 6710 亿参数降至 250 亿参数,而 o3 级别能力在开放模型首次达到该水平后的一个月内就从约一万亿参数降至 270 亿参数。
这种情况现在足够常见,以至于一些研究人员将其命名为“稠密化定律”:每参数可获得的能力大约每三个半月翻一番。[5]
图 1 显示智力在左侧轴上上升,固定智力所需的参数在右侧轴上下降。你可以点击每个数据点查看来源。
图 1 — 智力上升,所需参数下降,2023–2026
前沿智力 · 左轴
每其他评分发布
GPT-4 级别参数 · 右轴
o1 级别参数 · 右轴
o3 级别参数 · 右轴
估计大小
2023 2024 2025 2026
0 20 40 60
10B 100B 1T
指数 (v4.1) ▲ ▼ 参数 (log)
智力:Artificial Analysis Intelligence Index v4.1 回溯评分,整个时期的一个统一尺度。深色线是运行最佳值;浅色点是每其他评分发布,包含 2026 年 7 月中旬的四次前沿发布。大小序列:达到每个固定级别的最小开放权重模型;空心点包含已发布的估计值而非公开大小。右轴是对数刻度——每条网格线代表参数减少十倍。
从能力在前沿首次亮相到能够装入工作站级模型(350 亿参数或更少)的等待时间也在缩短:
GPT-4-Turbo 级别 (前沿 2023 年 11 月) 16 个月
o1 级别 (前沿 2024 年 12 月) 14 个月
o3 级别 (前沿 2025 年 4 月) 10 个月
Grok-4 级别 (前沿 2025 年 7 月) 7 个月
## 运行更小模型的经济学
从经济学角度来看,提供固定水平能力每年大约便宜 10 倍。[7] 按基准逐个测量,每年在 9 倍到 900 倍之间,中位数接近 50 倍。[8]
其中一部分下降来自更好的模型(每年 3 倍),其余来自更好的硬件优化和提供商在利润率上的竞争。[9]
硬件是一种棘手的资产,因为当前需求导致硬件价格上涨,但过去几年里一些硬件也贬值了。H100 在 2023 年末售价约 4 万美元,现在为 7000–20000 美元,损失 50–82.5%。[10]
你可以从购买硬件是购买贬值资产的角度来看待。然而,另一个角度是,如果你在 2023 年购买了一台 H100,你现在拥有能够运行更好、更新、更稠密模型的硬件。它的财务价值可能下降了,但其实际效用从技术上讲增加了。尽管如此,它并未捕捉到硬件价格未来的下跌或提供商利润率的下降。
对于那些已经拥有硬件的组织来说,这也是一个强有力的论据。如果一个足够的模型可以装在你已经拥有的硬件上,你就能获得更好的本地模型带来的好处,这些模型使旧硬件随时间推移变得更有用,而无需以虚高价格对新硬件进行资本支出。
这就引出了另一个问题:何时购买新硬件比租用更经济合理?
这可能取决于你认为计算资源闲置的时间有多长。如果你能让硬件在超过 50–83% 的时间里保持忙碌,那么拥有它可能比向提供商付费更明智。[15]
然而,在四年的时间跨度内,API 价格每年下降十倍,而拥有者通过模型切换捕捉到该曲线的 60%,盈亏平衡点上升到 88% 的持续利用率。
你可以在图 2 中进行测试。默认值是我们观察到的数值。如果你将通缩设为 1 倍(即假设价格不下降),模型会给出其他研究中发现的标准总拥有成本结果。
图 2 — 智力通缩下的拥有 vs 租用
持续利用率 30%
预期保持使用的已购买容量份额
固定智力下的 API 通缩 10×/年 ~10×/年,根据 a16z 和 Altman [7];Epoch 的中位数测量 ~50×/年 [8];1× = 静态 TCO
已拥有硬件上捕捉到的通缩 60%
算法部分 ≈ 每年约 5–10× 总下降的 3× ⇒ 大约 50–65% [9]
硬件周期 4 年
超大规模数据中心折旧 5–6 年;批评者认为 2–3 年 [10]
拥有成本是 API 路径的 **2.9 倍**,在这些设置下。
盈亏平衡需要
**88%**
的持续利用率。
yr0 yr1 yr2 yr3
own $1.00 → $0.02/M
rent $0.40 → $0.0004/M
每百万 token 流的净现值(10% 折现率):拥有 $1.29 对比租用 $0.44。成本锚点:一个 8×B200 节点约 $320–400K 资本支出加上约 $150K/年运营成本,在满负荷利用下提供 o1 级开放模型(约每百万 token $0.30),对比可比的 API 价格约为 $0.40。简化有利于拥有:无故障成本,无残值损失,需求完全匹配容量。
在正确的假设下,购买硬件的赌注是合理的。它与使用你已经拥有的硬件的决策也是分开的,因为获取成本已经支付。
## 未来走向
大多数组织应该问的问题是:对于我们想要部署的模型能力,我们可以在已经拥有或计划获取的硬件上运行它吗?
Epoch 认为模型从前沿到工作站级所需的时间大约为 6-12 个月,小模型比前沿本身改进更快。[16] 我们自己的层级数据显示,这个时间轴在不到 2 年内也从 16 个月压缩到了仅 7 个月。
图 3 — 能力何时到达你拥有的硬件
前沿发展速度 +20 分/年 观察值:平均 +18.9/年;自 2025 年以来 +24/年 [1]
当前前沿到机队延迟 7 个月 观察值 2026 年中期:约 7 个月到 ≤35B 模型
延迟压缩 35%/年 观察值:约 1.7 年内 16 → 7 个月(约 35%/年);设为 0% 以保持延迟固定
2027 2028 2029 2030 2031
前沿(租用)可在已拥有硬件上运行
GPT-5.2 级别(2025 年 12 月前沿)2026 年 8 月
Fable-5 级别(今天的前沿)2026 年 12 月
2027 年中前沿 2027 年 11 月
2028 年中前沿 2028 年 10 月
“可在已拥有硬件上运行”意味着总参数 ≤35B 的模型——适合工作站 GPU 或分布在 AI PC 机队中的类别。阴影带是租用前沿的能力溢价;里程碑日期标记了给定级别归零的时刻。默认值是观察值;投影在指数上是线性的,不应超出所示范围太多。
稠密化定律的作者警告不要无限外推,而且精确外推是不可能的。[5] 你应该对图 3 的结果持保留态度,因为它们提供了基于当前趋势持续的数据。
## 我们会怎么做
基于我们的研究,我们认为很快将只剩下两个真正的选择:拥有落后边缘,或租用前沿。
对于大多数组织而言,无论是现在还是未来的某个时刻,拥有落后边缘(即在本地运行较旧的开放前沿模型进行推理)将是一个明智的赌注。本地模型正在接近对许多用户来说足够好的水平,并附带了一些不一定能计入经济方面的好处。
通过拥有芯片并运行你自己的模型,你获得了主权、隐私和控制权。条款和条件可能会改变,定价计划可能会改变,而且尽管 token 成本在下降,但净使用量在上升,这可能导致更大的成本。要警惕当前被过度购买的硬件,并尽可能使用你已经拥有的硬件。
对于那些想要或需要最强大模型且不介意缺点的人来说,租用前沿智力。API 定价目前是 AI 经济中成本通缩最快的项目之一,按需付费对于较小的工作负载可能更高效。将其视为资本支出。
全面披露:Cascadia 正在跨组织已经拥有的 Intel AI PC 机队构建分布式推理运行时。我们押注于这一论点,因为我们认为由于成本和数据隐私优势,本地 AI 和混合设置是未来。尽管如此,数据就是数据。我们鼓励你形成自己的结论。
## 注释
1. [1]Artificial Analysis Intelligence Index v4.1,回溯评分排行榜。2026 年 7 月 16 日快照,通过 BenchLM 镜像;交互式原版见 artificialanalysis.ai。models.benchlm.ai (https://benchlm.ai/benchmarks/artificialAnalysis)
2. [2]Artificial Analysis,“AI 趋势”——前沿智力随时间变化;智力 vs. 总参数和活跃参数。artificialanalysis.ai (https://artificialanalysis.ai/trends)
3. [3]Epoch AI,“AI 能力进步已加速”(2025 年 12 月)——前沿斜率 8.3 → 15.5 ECI 点/年,拐点 2024 年 4 月。epoch.ai (https://epoch.ai/data-insights/ai-capabilities-progress-has-sped-up)
4. [4]Ege Erdil,“前沿语言模型已变得更小,”Epoch AI 梯度更新(2024 年 12 月)——约 1.8T 参数 GPT-4 估计。epoch.ai (https://epoch.ai/gradient-updates/frontier-language-models-have-become-much-smaller)
5. [5]Xiao 等人,“LLM 的稠密化定律,”Nature Machine Intelligence 7, 1823–1833 (2025)——能力密度每约 3.5 个月翻一番。nature.com (https://www.nature.com/articles/s42256-025-01137-0)
6. [6]Sturb & LawrenceC,“对不可压缩知识探针的合理性检查”(2026 年 5 月)——稠密化对于参数化事实回忆是平缓的。lesswrong.com (https://www.lesswrong.com/posts/veFMEzDDyWaer2Sms/sanity-checking-incompressible-knowledge-probes)
7. [7]Appenzeller,“欢迎来到 LLM 膨胀,”a16z(2024 年 11 月)——同等能力的成本每年下降约 10 倍。a16z.com (https://a16z.com/llmflation-llm-inference-cost/)
8. [8]Epoch AI,“LLM 推理价格已迅速下降,但任务间不平等”——固定基准分数下每年 9–900 倍;中位数约 50 倍。epoch.ai (https://epoch.ai/data-insights/llm-inference-price-trends)
9. [9]Gundlach 等人,“进步的价格,”MIT FutureTech (2025)——算法效率贡献了每年约 5–10 倍总价格下降中的约 3 倍;前沿模型价格本身在上涨。arxiv.org (https://arxiv.org/abs/2511.23455)
10. [10]H100 二手市场价格,2026 年——购买后大约两年内价值损失 60–80%。compute.exchange (https://compute.exchange/blogs/h100-gpu-price-2026)
11. [11]Cast AI 生产遥测数据,跨越 23,000 个集群(2026 年)——企业 GPU 平均利用率约为 5%;调查发现 83% 的公司利用率为 50% 或更低。venturebeat.com (https://venturebeat.com/infrastructure/5-gpu-utilization-the-401-billion-ai-infrastructure-problem-enterprises-cant-keep-ignoring)
12. [12]IDC,AI 基础设施支出(2026 年 3 月)——2026 年预测为 4870 亿美元;云和共享环境占总量的 84–87%。idc.com (https://www.idc.com/resource-center/blog/ai-infrastructure-spending-caps-historic-year-at-90-billion-in-q4-2025-2029-spending-to-eclipse-1-trillion/)
13. [13]微软、Alphabet、亚马逊和 Meta 的 2026 年资本支出总指引:约 7250 亿美元,同比增长 77%。tomshardware.com (https://www.tomshardware.com/tech-industry/big-tech/big-techs-ai-spending-plans-reach-725-billion)
14. [14]Oracle 2026 财年第四季度业绩——剩余履约义务 6380 亿美元(+363%),其中 750 亿美元为客户预付或客户提供的 GPU。s23.q4cdn.com (https://s23.q4cdn.com/440135859/files/doc_earnings/2026/q4/earning-result/4q26-pressrelease-final.pdf)
15. [15]已发表的拥有 vs 租用 TCO 分析,2026 年——在考虑通缩前,盈亏平衡点为 50–83% 的持续利用率。digitalapplied.com (https://www.digitalapplied.com/blog/gpu-buy-vs-rent-vs-cloud-ai-inference-2026-decision-guide)
16. [16]Somala & Emberson,“前沿 AI 性能在一年内变得在消费级硬件上可用,”Epoch AI (2025)——消费级 GPU 模型落后前沿 6–12 个月,且改进速度更快。epoch.ai (https://epoch.ai/data-insights/consumer-gpu-model-gap)
17. [17]SemiAnalysis,“GPU 大短缺”(2026 年)——一年期 H100 合同价格在 2025 年 10 月至 2026 年 3 月期间上涨 40%;产能已预订至夏末。newsletter.semianalysis.com (https://newsletter.semianalysis.com/p/the-great-gpu-shortage-rental-capacity)
18. [18]MIT NANDA,“生成式 AI 鸿沟”(2025 年 8 月)——95% 的企业生成式 AI 试点未显示可衡量的 P&L 回报。fortune.com (https://fortune.com/2025/08/18/mit-report-95-percent-generative-ai-pilots-at-companies-failing-cfo/)
19. [19]AI Futures Project,“AI 2027”和“AI 2040:A 计划”——情景预测,其中自动化 AI 研究在当前硬件周期内产生超级智能。ai-2027.com (https://ai-2027.com/)
20. [20]Artificial Analysis,“八天内四次前沿发布”(2026 年 7 月)——六个实验室现在在指数上有一个得分超过 50 的模型,高于 6 月初的两个;领先者的优势是一个点。artificialanalysis.ai (https://artificialanalysis.ai/articles/four-frontier-launches-in-eight-days-six-labs-now-field-a-model-above-50-on-the-artificial-analysis-intelligence-index)
21. [21]Synergy Research Group,“到 2031 年超大规模运营商将占全部数据中心容量的 67%”(2026 年)——本地部署占世界容量的份额:56%(2018 年)→ 32%(2024 年第四季度)。
相似文章
AI价格暴跌:是软件的故事,而非硬件(14分钟阅读)
本文认为,AI推理成本的快速下降是由软件优化而非硬件改进驱动的,并且运行在消费级GPU上的开放权重模型正变得越来越能与前沿模型竞争。
“硬件是唯一的护城河”——我们应该现在购买新硬件还是等待?
文章讨论了硬件作为AI竞争优势日益增长的重要性,指出领先实验室更注重产品竞争力和计算规模,而非纯粹的AGI研究。文章强调了由此导致的消费级GPU供应紧张和硬件升级成本上升的问题。
科技公司能否学会青睐更便宜的AI模型?
TechCrunch报道称,随着成本不断攀升,企业开始考虑转向更便宜、更小的AI模型,而非始终使用最强大的模型,这可能引发行业转变。布赖恩·阿姆斯特朗等人的预测表明,12-18个月内,80%的工作负载可能运行在价格便宜99%的模型上,这将严重冲击OpenAI和Anthropic等主要AI实验室。
硬件革命:为什么AI硬件永远改变了(3分钟阅读)
近期AI硬件的进展,包括OpenAI、Etched、亚马逊和SambaNova的定制芯片,标志着向针对AI工作负载的专用ASIC的重大转变,有望带来重大效率提升,并挑战英伟达的主导地位。
推理的变革(阅读时长约 8 分钟)
本文分析了 Cerebras 即将进行的 IPO,将其视为 AI 硬件领域“推理变革”的信号。文章指出,尽管 Nvidia 在基于 GPU 的训练领域占据主导地位,但为了支持推理工作负载,AI 算力的未来正变得越来越异构。