开放权重推理的经济学
摘要
本文分析了开放权重AI需求如何影响旧款NVIDIA GPU的经济价值,表明开放权重模型更为经济,并且像A100这样的硬件在特定工作负载上仍具成本效益。
暂无内容
查看缓存全文
缓存时间: 2026/09/22 15:59
# 开放权重推理的经济学 | Ornn 数据
来源:https://data.ornn.com/publications/the-economics-of-open-weight-inference
出版物 (https://data.ornn.com/publications)
开放权重需求如何支撑 NVIDIA GPU 系列的使用寿命
Ornn 数据 | 2026年9月7日
## 摘要
GPU 的折旧通常基于一个假设:每一代新的 NVIDIA 产品都会使前一代产品过时。本文通过考察开放权重需求对旧款 GPU 系列经济效用的影响,提出了反驳这一观点的论据。闭源模型的访问权限通过提供商可重置的订阅额度提供,因此标定的 token 费率代表了额外使用的边际价格。在 Artificial Analysis 智能指数涵盖的十一个开放权重模型和八个闭源模型中,按智能水平标准化后,最便宜的合格开放权重模型完成一项任务的成本大约是同类闭源模型的五分之一。在租赁硬件上自托管,可使成本在充分利用时降至每百万输出 token 0.12 至 0.35 美元,并且颠覆了硬件排名:在 gpt-oss-120b(一个拥有 51 亿激活参数的稀疏模型)上,A100 在现货市场以及三年期和五年期合同价格下的产出成本都低于 H100。Ornn 的租赁数据显示市场反映了这一效用。五年期 A100 租赁价格保持了其一个月期合同价格的 80%(相比之下,Hopper 和 Blackwell 系列为 44% 至 60%),而该合同将在 Ampere 系列发布超过十一年后到期。我们表明,当今计算密集型的工作负载——长时间运行的智能体、批处理评估和强化学习——能够容忍延迟且对硬件无偏好,这激励了对价格敏感的需求流向任何成本效益高的硬件。参见 NVIDIA 于 2026 年 9 月 3 日收购 Hugging Face 的事件 (NVIDIA, 2026c)。这些发现挑战了新硬件会消除旧 GPU 赚钱能力的预测。相反,它们表明,只要旧款 NVIDIA 系列能够在具有竞争力的情况下服务于合适的工作负载,并且运营者能够自由地将这些工作负载部署在这些硬件上,它们就能保留多年的赚钱寿命。
## 主要发现
- 在 Artificial Analysis 智能指数的几个采样常见分数阈值上,托管的开放权重模型更便宜,但并非在每个阈值上。闭源模型在某些分数下仍是更便宜的合格选项,并且闭源前沿在指数顶端超过了开放模型样本。
- 在采样中,租赁硬件上的自托管在充分利用时产生的纯计算成本为每百万输出 token 0.12 至 0.35 美元。
- 在 gpt-oss-120b 上,A100 在现货市场以及三年期和五年期合同价格下的产出成本都低于 H100。A100/H100 的稀疏结果结合了不同的第三方服务设置。稠密 A100 行的数据是估算的。
- 五年期 A100 合同价格保持了 80.2% 的一个月期价格,而 Hopper 系列为 43.7% 至 59.8%,Blackwell 系列为 53.8%。远期价格是分析师制作的指标,而非可执行的报价。
- A100 使用率从 74% 上升至 90%,同时挂牌容量增长 13%,现货指数上涨 20%。本文并未确定开放权重需求是导致 A100 使用率或租赁价格行为的原因。
## 部分图表
每百万输出 token 的纯计算成本(充分利用和基准情况)
| GPU | 稠密模型充分利用 | 稠密模型基准情况 | 稀疏模型充分利用 | 稀疏模型基准情况 |
| :--- | :--- | :--- | :--- | :--- |
| A100 SXM4 | $0.28 | $0.75 | $0.12 | $0.29 |
| H100 SXM | $0.26 | $0.68 | $0.27 | $0.64 |
| H200 | $0.32 | $0.81 | $0.35 | $0.98 |
| B200 | $0.16 | $0.39 | $0.15 | $0.47 |
来源:Ornn 数据根据公布的数据和 2026 年 9 月 1 日现货租金计算(论文表 7)。充分利用采用无预留开销的离线吞吐量。基准情况采用服务器吞吐量(如果可用),否则按 GPUStack 基线重新调整;后者并未确立服务器服务水平。稠密 A100 数据是估算的。A100/H100 稀疏行是第三方测量结果,而非 MLPerf 结果。成本为纯计算成本,单位为美元/每百万输出 token。
A100 使用率、挂牌容量变化和现货价格变化
| 系列 | 使用率,2026年3月1日 | 使用率,2026年9月1日 | 使用率,3月-9月平均值 | 挂牌容量,3月-9月 | 现货价格,3月-9月 |
| :--- | :--- | :--- | :--- | :--- | :--- |
| A100 SXM4 | 74% | 90% | 80% | +13% | +20% |
来源:Ornn 使用率和挂牌容量系列数据以及结算后的现货指数(论文表 8),获取于 2026 年 9 月 2 日。使用率是全球地区跟踪的按需提供商标牌容量中的已租容量比例。挂牌容量衡量跟踪的按需供应量,而非装机量。
远期合同价格保有率(占一个月期价格的百分比)
| 系列 | 6个月/1个月 | 1年/1个月 | 3年/1个月 | 5年/1个月 | 远期37-60个月/1个月 | 5年合同结束时机龄(年) |
| :--- | :--- | :--- | :--- | :--- | :--- | :--- |
| A100 SXM4 | 95.0% | 93.1% | 84.2% | 80.2% | 74% | 11.3 |
| H100 SXM | 95.0% | 86.2% | 68.2% | 59.8% | 47% | 9.4 |
| H200 | 92.4% | 80.2% | 51.0% | 43.7% | 33% | 7.8 |
| B200 | 99.1% | 97.9% | 69.1% | 53.8% | 31% | 7.5 |
| B300 | 93.8% | 81.3% | 60.9% | 53.8% | 43% | 6.5 |
来源:Ornn 报告的合同期限价格(论文表 9)。A100、H100、H200 和 B200 价格发布于 2026 年 8 月 13 日;B300 发布于 2026 年 9 月 1 日。保有率和隐含远期价格比率是根据这些价格计算得出的。机龄基于系列发布日期,以 2026 年 9 月 1 日为起算点。远期价格是分析师制作的指标,而非可执行的报价。
## 开放权重的可移植性
闭源模型仅通过开发者授权的部署提供。开放权重允许独立部署,并且在存在兼容端点的情况下,可以选择相同模型检查点的不同服务商。2026 年 9 月报告的 OpenRouter 快照显示,多个广泛部署的开放模型有 18 至 22 个提供商,最高与最低输出价格比率在 1.8 到 5.6 之间。这些数字说明了价格差异,而非可互换的服务:量化、容量、可靠性和迁移成本都可能限制替代性。
同样的选择也适用于硬件。内存、数值格式、软件和许可决定了哪些部署是可行的。gpt-oss-120b 使用 MXFP4 专家权重,并已在单个 80GB A100 上提供服务。因此,运营者可以在模型适配、软件能高效支持且许可允许预期用途的情况下考虑使用旧硬件。经济上的区别在于谁能够做出部署决策。
## GPU 使用寿命
Ornn 发布结算后的每日租赁指数和一个月、六个月、一年、三年及五年期的合同期限价格曲线。合同期限价格是在指定合同期限内的固定 GPU 小时费率。隐含远期价格通过差分累计合同期限成本来获得两个期限之间的费率。这些价格为租赁服务定价;单个设备的转售价值和运营寿命是独立的量。
A100 的五年期合同价格保持了其一个月期价格的五分之四,该合同将持续到 2031 年 9 月,届时该系列将已有超过十一年的历史。Hopper 和 Blackwell 系列的曲线更为陡峭。在不断扩大的 A100 挂牌基础上使用率不断上升意味着,该系列在现货市场的强势不能仅仅归因于可供出租的跟踪 GPU 数量减少。新一代产品本身并不会使其前代产品在经济上过时。
## 自托管经济
自托管没有公布的每 token 价格。其纯计算成本是 Ornn 现货指数上的 GPU 小时租金除以运营者实现的吞吐量,并根据有效利用率和预留开销进行调整。本文针对两种工作负载构建了该成本:稠密 Llama-2-70B 和稀疏 gpt-oss-120b。
成本排序在这两种工作负载中发生了逆转。稠密模型比较有利于新硬件。对于 gpt-oss-120b,A100 的基准情况成本为每百万输出 token 0.29 美元,不到 H100(0.64 美元)的一半。这些 A100 和 H100 稀疏模型的数据来自不同的第三方服务设置。在缺少匹配的 MLPerf 提交的情况下,稠密 A100 行的数据是根据厂商吞吐量比率估算的。按 GPU 额定功率计算的电力成本仅为现货租金的几个百分点,不会逆转所示的排名。
## 解释
长时间运行的智能体、批处理评估和部分强化学习任务在工作何时何地运行方面提供了灵活性。能够容忍延迟的工作负载可以路由到任何成本效益高的兼容硬件。旧硬件无需赢得所有工作负载即可保留其经济角色。新 GPU 可以为要求苛刻的任务提供更低的成本,而旧容量则服务于适合其内存、软件和租金价格的工作。
衡量硬件有用性的正确标准是它能处理的工作成本以及该工作的需求,而不仅仅是芯片的年龄。评估单个投资仍然需要获取成本、运营现金流和所有者可选择的其他方案。融资和合同条款属于该评估的一部分,因为它们有助于确定长期承诺的价格。
## 局限性与披露
远期价格是分析师制作的指标,并非可执行的报价或在所有期限上验证过的类似已执行合同的平均价格。对合同期限价格进行差分并不能预测预期的未来现货租金。八月合同期限价格和九月现货观察值属于不同版本。
使用率记录的是跟踪的按需提供商标牌容量的租赁状态,而非装机量、租户工作负载或实现的 token 吞吐量。系列机龄从 NVIDIA 发布之日起算,而非设备投产日期。高百分比的保有率也可能源于起始租金的早期下降。这些价格并未确定单个设备的生存率、盈利运营寿命、残值或所有者会计折旧计划的适当性。
稠密 A100 吞吐量是估算的;不同的精度假设可能会逆转其成本排名。A100/H100 稀疏结果结合了不同的第三方服务设置。通用指数阈值筛选模型,但并不确立任务成功性相等。两个自托管示例并未确立托管比较中更高评分模型的性能。
租赁观察值并未确定开放权重需求的贡献。本文并未确定开放权重需求是导致 A100 使用率或租赁价格行为的原因。设备退役、稠密推理、非 LLM 工作、运营退出成本以及融资或稀缺性效应仍然是可能的解释。
Ornn 数据发布本文以及其中使用的租赁指数、使用率系列数据和合同期限价格。其数据进行商业授权许可,并通过 Ornn Compute 提供 GPU 租赁服务。这些活动在数据的解释和采纳方面产生了商业利益。本文无外部资助。本文内容不构成交易要约或投资、会计、税务或法律建议。
## 开放权重模型是否比闭源模型更便宜?
在本文样本中,按 Artificial Analysis 智能指数标准化的最便宜的合格开放权重模型完成一项任务的成本大约是同类闭源模型的五分之一。开放权重模型仅在几个采样常见分数阈值上更便宜,而非在所有阈值上。闭源模型在某些分数下仍是更便宜的合格选项,并且闭源前沿在指数顶端超过了开放模型样本。
## 对于自托管开放权重推理,A100 是否比 H100 更便宜?
在 gpt-oss-120b(一个拥有 51 亿激活参数的稀疏混合专家模型)上,计算得出的 A100 成本在充分利用时为每百万输出 token 0.12 美元,基准情况为 0.29 美元,低于 H100 的 0.27 美元和 0.64 美元。该 A100/H100 稀疏结果结合了不同的第三方服务设置。稠密 Llama-2-70B 比较有利于新硬件,并且稠密 A100 行的数据是估算的,而非来自匹配的 MLPerf 提交。
## Ornn 远期合同期限价格是什么?
Ornn 合同期限价格曲线报告了从一个月到五年期限的固定 GPU 小时费率。公布的五年期 A100 价格保持了 80.2% 的一个月期合同价格,而 Hopper 系列为 43.7% 至 59.8%,Blackwell 系列为 53.8%。远期价格是分析师制作的指标,并非可执行的报价或在所有期限上验证过的类似已执行合同的平均价格。
## 开放权重需求是否导致了 A100 使用率和租赁价格行为?
本文报告了 A100 使用率从 2026 年 3 月 1 日的 74% 上升至 2026 年 9 月 1 日的 90%,平均使用率为 80%,挂牌容量增长 13%,现货指数上涨 20%。这些租赁观察值并未确定开放权重需求的贡献。本文并未确定开放权重需求是导致 A100 使用率或租赁价格行为的原因。设备退役、稠密推理、非 LLM 工作、运营退出成本以及融资或稀缺性效应仍然是可能的解释。
## 在新一代产品发布后,旧款 NVIDIA GPU 能继续赚钱多久?
本文认为,新一代产品本身并不会使其前代产品在经济上过时。当有用的工作负载仍能在旧 GPU 上具有竞争力运行,并且运营者能够自由地将这些工作负载部署在其上时,旧 GPU 仍能保留其角色。一份始于 2026 年 9 月 1 日的五年期 A100 合同将在 Ampere 系列 11.3 岁时结束,届时仍将保持 80.2% 的一个月期合同价格。这是系列级别的租赁服务观察结果,而非关于单个设备残值或会计折旧的发现。
## 引用
Ornn Data. 2026. “开放权重推理的经济学.” 9 月 7 日. https://data.ornn.com/publications/the-economics-of-open-weight-inference.
## 完整论文
下载《开放权重推理的经济学》PDF (https://data.ornn.com/the-economics-of-open-weight-inference.pdf)
相似文章
开源权重难以承受的廉价
讨论了开源权重AI模型变得极其廉价的趋势,使得先进的AI能力更加普及。
开放权重与美国AI领导地位(6分钟阅读)
NVIDIA发布了一份白皮书,讨论了开放权重AI模型在维护美国AI领导地位中的作用。
开放权重模型的权衡(9分钟阅读)
对开放权重AI辩论的分析:支持者认为它使AI民主化,而批评者则指出滥用风险;多家大型科技公司签署了支持开放权重的公开信,而Anthropic和特朗普政府的部分成员仍保持谨慎。
开源模型令人难以承受的廉价
本文探讨了像DeepSeek V4这样的开源模型与Anthropic和OpenAI的闭源模型之间的巨大成本差异,认为后者是通过人为稀缺性和品牌效应而非技术优势来维持高价格。
人工智能的经济因素开始倾向于开放模型
本文探讨了市场力量和经济因素,这些因素正日益倾向于开源AI模型而非专有替代方案。