思维价格的骤降
摘要
本文介绍了关于AI性能成本快速下降的研究,关键基准测试显示季度平均降幅达47%,突显了AI技术的变革性经济趋势。
暂无内容
查看缓存全文
缓存时间: 2026/09/23 00:54
# 思想的急剧降价
来源:https://epoch.ai/publications/the-plunging-price-of-thought
## 核心要点
- 过去三年间,达到特定AI性能水平的成本平均每季度下降约47%。这意味着每年成本下降13倍——其速度超过历史上任何其他变革性技术。
- 这一速率是基于过去三年我们掌握数据最充分的五大AI能力基准测算得出,涵盖数学、硬科学和技能游戏,同时也参考了更早期数据的简化分析。
- 我们观察到基于游戏的解谜基准成本下降稍慢,约为每季度39-43%,而数学问题的进展更快,达到每季度50-52%。
- 自2021年11月OpenAI全面发布GPT-3、商业大语言模型推理服务诞生以来,成本很可能一直以这种高速下降。
- 特定性能水平的成本通常在该水平首次实现(即达到最先进水平SOTA)后下降最快。我们五个基准中均体现此模式。平均而言,新晋SOTA性能的成本每季度下降66%(每年下降75倍)。两年后,降速减半,为每季度32%(每年下降4.7倍)。
- 尽管价格不断下降,AI相关支出仍可能居高不下。如果AI需要执行的重要任务(例如审查数千篇科学论文中的错误)需要相当于运行这些基准测试百万次的认知能力,那么即使单次运行仅需一美分,总支出仍然可观。此外,虽然价格下降,AI的能力可能持续提升。通过一年级数学测试的成本如今可能微不足道,但证明高深定理的成本则不然。
数据与代码已发布于GitHub(https://github.com/droodman/inference-cost/)。专题页面(https://droodman.github.io/inference-cost/)包含大量可交互探索的图表与表格。
## 概述
“ChatGPT”中的“GPT”代表“生成式预训练转换器”,这是对其内部AI工作原理的技术描述。当然,OpenAI的GPT模型创造者们确实也借用了该缩写词的古老含义:通用技术(General-purpose Technology)(https://doi.org/10.1016/0304-4076(94)01598-T)。他们准确预见了——如同蒸汽机、电力和互联网——大语言模型终将触及社会的方方面面。
如今人们普遍认识到,AI热潮是一股强大的宏观经济力量,足以推高其所需投入(芯片、电力甚至电工劳动)的价格。但较少有人认识到其悖论性的反面:所有这些数据中心所产生**输出**的价格正在急剧下降:
下图展示了一些实例。2025年1月31日,OpenAI在其“推理”模型系列中发布了新迭代版本o3。我们估算其平均每题成本为30美分,即可在GPQA Diamond基准测试(https://epoch.ai/benchmarks/gpqa-diamond)中达到75%的正确率,该测试为涵盖物理、化学和生物学博士水平的多选题考试¹(https://epoch.ai/publications/the-plunging-price-of-thought#user-content-fn-1)。不到18个月后,OpenAI发布了GPT-5.6 Luna。它获得了同样出色的成绩——但每题仅需四百分之一美分($0.0004)。这意味着在不到18个月内,“思想”的价格下降了725倍。这好比一辆新车的标价从50,000美元跌至69美元。历史上似乎没有任何其他通用技术如此迅速地变得如此廉价。
为衡量这些趋势,我们使用了一个更新、更全面的数据集来分析性能,其中包含过去三年涵盖数学、硬科学和技能游戏的五大AI性能基准。
我们发现,在这段时间内,达到特定性能水平的价格平均每季度下降约47%,即每年下降13倍。基于游戏的解谜基准降速较慢,约为每季度39-43%(每年7-10倍),而数学问题的进展更快,达到每季度50-52%(每年16-19倍)。
达到特定性能水平的成本下降速度确实会随时间放缓,尽管这一模式并非绝对。一种可能的解释是:当某个性能水平首次实现时,AI公司可以短暂地收取溢价,随后竞争和技术进步会迅速压低价格。这种动态会逐渐减弱。平均五大主要基准,初始成本每季度下降66%(每年75倍)。两年后,降速减半,仅为“区区”每季度32%(每年4.7倍)。
我们的分析存在重大注意事项。AI公司可能明确针对某些基准训练模型(“基准优化狂魔”),因此基准上的提升可能超过实际任务的提升。即使没有这种情况,在基准上表现优异也等同于有效工作。由于我们专注于前沿——能够达到任何给定性能水平的、绝对最便宜的模型——我们隐含地假设存在一个为每项任务不懈寻找最具成本效益模型的AI用户,而现实用户并不会如此频繁地切换模型,因此无法获得完全相同的节省。我们的数据不完整且存在噪音:时间范围仅三年有余,并非所有AI模型与基准的组合都被纳入。不同模型、基准、时间段和性能范围的成本下降方式各异,且有许多合理的方法来对这些多样化的情况进行平均。总体而言,虽然我们认为我们的基本数字能合理代表现实,但不应将其视为精确值。
本报告的其余部分详细阐述了我们的分析,部分内容较为技术性。
## 前期研究
我们并非首个量化AI降价速度的研究者。Guido Appenzeller于2024年为Andreessen Horowitz撰写的一篇博文(https://a16z.com/llmflation-llm-inference-cost/)记录了在GPT-3全面发布后的三年内,大语言模型成本下降了1000倍,即每年下降10倍。几个月后,即2025年3月,Epoch AI的一项分析(https://epoch.ai/data-insights/llm-inference-price-trends)发现,在六大性能基准上,成本每年下降9-900倍。
这两项早期分析衡量的是*能够达到特定性能水平的模型的每令牌价格*,这区别于*达到特定性能的实际成本*。随着推理模型的出现——OpenAI于2024年12月发布了o1——忽视这种区别变得更有问题。推理模型可以高效地消耗更多令牌,但结果是从一个更小、每令牌运行成本更低的基础语言模型中获得了良好性能。
2025年9月,Håvard Tveit Ihle在LessWrong上分享了一项分析(https://www.lesswrong.com/posts/ifSBamvobbyB9KWjK/inference-costs-for-hard-coding-tasks-halve-roughly-every),直接比较了两套编程挑战的性能和成本。分析发现成本每1.4-2个月减半(每年下降64-380倍)。
迄今为止最详尽的分析是Gundlach等人于2026年3月发表的论文(https://arxiv.org/abs/2511.23455v2)。该论文同样比较了实际成本与性能。与我们的分析类似,它估算了全量数据以及任何时间点构成成本前沿的模型子集的趋势。它还按性能水平(高端价格下降更快)和模型类型(开源或闭源、稠密或混合专家)进行了分解。总体而言,他们发现年降幅为5-10倍。
## 数据
本分析的主要创新在于使用一种方法分析成本趋势,该方法捕捉了每个模型在全部成本-性能连续体上的表现。
如果一个语言模型能在基准测试中得80%,成本为1美元,另一个最高只能得60%,成本为0.5美元,那么哪个更具成本效益并不显而易见。或许,如果以更少的推理令牌运行,那个更强大的模型能比那个较弱的模型以更低的成本达到60%。
更普遍地说,我们的兴趣在于绘制成本效益的“帕累托”前沿——在任何时间点,从可用模型中达到每个性能水平的最廉价方式。如果我们仅在给予语言模型无限预算时估算成本和性能,我们将遗漏大量区域,甚至可能包括大量前沿。任何给定的现代语言模型都能产生一系列性能水平,这取决于其推理强度设置为低、中、高或最大,以及是否施加了预算限制。
追踪模型成本-性能曲线的一种方法是在不同推理强度和令牌预算下多次运行它进行基准测试。然而,这个过程既昂贵又缓慢。相反,我们采用了联邦AI标准与创新中心(CAISI)(https://www.nist.gov/system/files/documents/2025/09/30/CAISI_Evaluation_of_DeepSeek_AI_Models.pdf#page=66)开发的流程。它使用在高(或无)预算约束下运行基准测试的*记录*来预测在更紧预算下的性能。核心思想是,由于基准测试包含许多问题,可以估算在消耗给定预算前,语言模型能回答多少问题。记录提供了所需信息:模型回答每个问题消耗了多少令牌,以及哪些答对了²(https://epoch.ai/publications/the-plunging-price-of-thought#user-content-fn-2)。
对于任何任意的每题X令牌预算,我们累加那些用少于X个输出令牌回答正确的问题数量。可以将其视为模型在被迫放弃前可能产生的最大开销。当模型在特定预算阈值内未能回答时,该问题得分为猜对的概率,例如在四选一多选题中为0.25,在其他类型问题中实际上为0。重复一系列预算范围,即可生成性能作为假设支出函数的曲线。
这种流程的一个担忧是,它可能错误估计了语言模型在*知晓*预算限制时的实际表现。如果模型被告知应优化在某个较低阈值下的得分,它们可能比问题被静默截断(CAISI方法模拟的情况)表现更好。
为测试这一担忧,我们修改了评估方式,明确告知模型其每题预算。结果表明,虽然思维模型的高强度版本在宣布预算时通常能改善其低预算性能,但在标准、未宣布条件下,它们并不优于低强度版本。也就是说,简单地以低思维强度运行思维模型,会产生与在宣布限制下高强度运行相似的成本-性能曲线。(参见图3,展示了多个模型的示例。)因此,只要我们使用CAISI方法涵盖各种思维水平,很可能就能覆盖模型成本-性能可能性域的大部分。
图3展示了GPT-5.2、o4-mini、Claude Sonnet 4.6和Gemini 3.5 Flash在GPQA Diamond基准上准确率与每题输出令牌预算的关系图。各推理强度下的静默截断曲线与告知预算限制的运行点紧密吻合。**图3. 向模型宣布预算上限所描绘的成本-性能关系,与简单限制其预算大致相同**
由于历史上我们的基准测试工作往往侧重于捕捉性能上限,而较少考虑成本效率,我们的数据系统性地缺失了使用较低推理强度和小型高效模型的评估。为避免结果偏差,我们进行了集中数据收集工作以填补以下基准测试的空白:FrontierMath Tiers 1-3 (v2)、OTIS Mock AIME 2024-2025、GPQA Diamond、Chess Puzzles和Mystery Game Puzzles。这包括直接运行一些开源模型,因为它们可能位于成本与性能的帕累托前沿,但无法通过任何专用推理API获取。为了获得这些模型上的评估价格,我们使用了租用硬件的成本,并努力优化硬件选择和评估设置,以在合理延迟条件下最大化成本效率。我们通过运行五个也可通过推理API获取的开源模型来验证我们的方法。在所有这些案例中,我们的直接成本与API定价之间的差异均小于30%。
## 建模
### 挑战
对于每个基准测试,我们有一组三元组 \(\{a_i, t_i, c_i\}\),分别代表模型在某次运行中的答案准确率、模型的发布日期以及运行成本(美元)。如上所述,CAISI方法在模型、思维强度和基准测试的每种组合下,随着假设令牌限制的变化,会产生许多这样的三元组。
我们希望表征特定性能水平的价格下降速率——不是针对平均模型,而是针对“前沿”,即能在基准测试中提供所需性能的、当前可用的最便宜模型。
具体而言,我们定义了两个经验帕累托前沿:准确率前沿和成本前沿。经验准确率前沿是在给定日期前可用的模型中,在给定预算内达到的最高性能:
\[A(t,c)=\max_{i | t_i \le t, c_i \le c} a_i\]
经验成本前沿是至少一个可用模型能够达到或超越给定准确率目标的最低成本:
\[C(t,a)=\min_{i | t_i \le t, a_i \ge a} c_i\]
这些曲面具有二维阶梯状特征,因为它们在其任一维度上经历不连续跳跃,且方向始终一致。
用统计模型表示这些动态前沿面临多重挑战:
1. 输出存在上限,因为准确率不能超过100%。在大多数生产和成本前沿的经济模型中,输出可以任意高。
2. 前沿在每个点上都是最大值或最小值的构造,这使其不稳定。单次基准测试结果——或单次缺失——可能会持续数月显著移动前沿。大多数统计工作关注平均值。在当前情境下,随着平均值估计的收敛,每个新增数据点对结果的影响往往小于前一个。在研究极值时,极限行为的收敛更为缓慢。因此,我们应假定经验前沿是“真实”前沿的有噪声代表。
3. 由于第2点,抽样计划更为重要。例如,如果较高比例的新模型被进行基准测试,这往往会推高后期前沿区域。由于测试模型耗时费钱,我们主要测试了在其发布日期看起来接近前沿的模型。因此抽样有些临时性。这意味着我们没有一个可信、干净的数据生成过程模型。
4. 模型发布在时间上是稀疏的。那些移动前沿的发布更为稀疏。然而,即使在没有数据点的日子,前沿依然存在,其确切位置包含信息。但该信息有限,因为昨日的前沿是今日前沿的良好预测因子。换言之,存在空间自相关。当像本文这样,前沿由网格点上的值表示时,提高网格分辨率会增加样本量和估计的表观精度,除非对空间自相关进行适当调整。
5. 在所研究的时间范围内,变化极快。大多数生产前沿的研究发生于变化较不
相似文章
智能成本下降100倍时会发生什么?
这篇文章分析了AI智能成本的快速下降,六个月内降低了56倍,并探讨了其对扩展AI应用和未来趋势的影响。
AI价格暴跌:是软件的故事,而非硬件(14分钟阅读)
本文认为,AI推理成本的快速下降是由软件优化而非硬件改进驱动的,并且运行在消费级GPU上的开放权重模型正变得越来越能与前沿模型竞争。
AI 成本下降速度比历史上任何变革性科技都快。在相同性能水平下,自2023年以来成本每季度下降约47%。
AI 成本正以前所未有的速度下降,自2023年以来每季度下降约47%,使其比以往任何变革性技术更快地变得更具成本效益。
智能成本快速下降
智能成本以每季度50%的速度快速下降,超过了DNA测序、计算、锂电池和电力成本的下降速度,并预计每年将发生重大变化,同时AI的可访问性将得到改善。
智能的成本正在快速下降
一份 Epoch AI 报告指出,达到特定 AI 性能水平的成本已急剧下降,OpenAI o3 和 GPT-5.6 Luna 在 GPQA Diamond 等基准测试上展示了推理成本降低 725 倍。