AI时代的记分卡
摘要
OpenAI 探讨 CFO 如何通过 'Useful Intelligence per Dollar' 来衡量 AI 价值,该指标评估完成的工作与成本,而非仅仅 token 成本或采用率。
OpenAI 的 CFO Sarah Friar 介绍了一种实用的 AI 记分卡,通过有用工作、每次成功任务成本、可靠性和计算回报来衡量 ROI。
查看缓存全文
缓存时间: 2026/07/20 09:43
# 人工智能时代的评分标准
我听到的来自全球CFO的问题都很简单:我们如何从AI投入中获得更多价值?
多年来,市场通过采用率来衡量软件的成功:购买席位、活跃用户数、续签许可。理解AI的价值则需要一个更有力的衡量标准:完成的工作量。
CFO和其他商业领袖面临的基本经济问题是:AI完成的工作价值是否比其生产成本增长得更快?
回答这个问题,不能仅仅看每token成本这类指标。一个成本更低的模型可能token更便宜,但要获得好结果可能需要更多尝试、更多时间或更多人工审核。一个能力更强的模型可能token更贵,但能一次性完成同样的任务。真正重要的是完成一个成功结果的完整成本,并与其创造的价值进行比较。
AI时代的终极评分标准可以看作是“每美元的有用智能”。这个指标回答了四个关键问题:
1. AI是否在做有意义的工作?
2. 每个成功任务的成本是多少?
3. 人们能否信赖这个结果?
4. 随着使用增长,每投入一美元AI是否产生更多价值?
## 1. 完成了多少有用工作?
从工作本身开始。
AI帮助解决了多少客户问题?帮助交付了多少代码变更?审核了多少份合同?为人们节省了多少时间?有多少决策因为恰好在关键时刻获得了正确的上下文而得到改善?
当token转化为人们可以使用的实际工作时,它们才创造价值。随着模型能力增强,它们可以承担更长、更复杂的任务:维护上下文、多步推理、跨工具协作,并灵活适应变化。
最好的起点是选择一个工作流程。定义什么算是“完成”,并在工作发生的系统中衡量该结果。
对于支持团队,“完成”可能意味着客户问题得到解决。对于工程团队,可能意味着通过测试的代码变更。对于法务团队,可能意味着准确且按时完成的合同审核。
设想一个财务团队准备预测审查。大量工作发生在最终决策之前:找到最新预测、将数据导入Excel或Sheets、识别变化、核对标签、重建幻灯片、检查各项是否完全吻合。
ChatGPT Work可以接手这一过程的大部分工作,让团队有更多时间专注于真正重要的问题:什么变了?为什么?下一步该做什么?
这就是实践中“每美元的有用智能”:更多工作更快完成,同时人们将更多时间用于运用判断力、创造力和专业知识。
## 2. 一个成功任务的实际花费是多少?
接下来的问题是,出色完成这项工作需要花费多少。
AI任务差异很大。快速问答可能只需要很少的计算资源。编码、研究或财务工作流程可能涉及更深度的推理、工具使用和多个操作步骤。这些更复杂的任务可能需要更多计算资源,但也能创造更大价值。
在模型层面,每成功任务成本取决于价格、使用的计算量以及达到正确结果的可能性。对于企业而言,完整成本还包括员工时间、人工审核、重试和返工。
计算方法很简单:
- 累加完成工作的完整成本。
- 统计达到所需质量标准的工作任务数。
- 将完整成本除以成功任务数。
这就是为什么每token最低价格并不总是产生最低的每成果成本。即使是常规请求,一个前沿模型可能一次性给出正确答案,从而减少重试、延迟、审核和总计算量,从而提供最佳价值。
分层模型家族为客户提供了更多优化这一公式的方式。我们上周发布的GPT-5.6有三个层级:Sol是我们的旗舰型号;Terra平衡性能与成本;Luna是我们最快、最实惠的型号。
这些层级提供了有用的起点。最终应根据完整任务的经济性来决定合适的模型。客户可能会在快速、高吞吐量的工作流程中使用Luna,在需要更深度的任务中使用Terra,或者在需要更强推理能力才能以最少尝试获得最佳结果时使用Sol。
我们训练GPT-5.6旨在让每个token产出更多有用工作。在Artificial Analysis Coding Agent Index上,GPT-5.6 Sol采用最大推理设置,在比另一领先模型减少54%输出token的同时,达到了新的最高水平。下图展示了这一对比。
***DeepSWE v1.1**:长周期工程任务;GPT-5.6 Sol达到72.7%新高,高于Claude Fable 5的69.9%,同时预估API成本低36.2%。*
在GPT-5.6系列中,目标相同:每美元更多成功工作。更高的效率使现有任务更经济实惠。更强的能力使全新类型的工作成为可能。
每一代新模型都应改进这一公式的两个方面。客户应该能够完成更有价值的工作,同时每个任务完成的成本持续下降。
## 3. AI正确完成工作的频率有多高?
第三个衡量标准是可依赖性。
AI的采用通常会分阶段深化。首先,AI协助起草。然后,它找到上下文并在工具和数据之间进行推理。随着时间推移,它开始采取行动、处理异常、完成工作流程,而人类在需要时提供判断和控制。
每一步都创造更多价值,也对系统提出更高要求。
可依赖性具有直接的经济价值。当结果准确、有可靠来源、一致且适当地升级处理时,人们花在审核、纠正和重复工作上的时间就会减少。成功任务成本降低,组织也有信心在更重要的流程中使用AI。
团队可以通过跟踪三个结果来具体化这一点:
- 可直接使用:结果按提交的质量标准达标。
- 需要修正:结果需要再次尝试或人工编辑。
- 需要升级:需要人为介入并完成工作。
这些衡量指标比单纯的模型准确率更能说明问题。它们显示AI是否真正减少了完成项目所需的工作量。
可依赖性还需要明确的边界。在AI从起草转向采取行动之前,组织应定义:
- 系统可以访问哪些数据。
- 系统可以使用或更改哪些系统。
- 何时需要人工审核或批准某个操作。
安全性、隐私、合规和控制构成了深度使用的基础。人们需要了解系统的行为方式、数据如何处理以及其操作如何被管理。
ChatGPT Work建立在ChatGPT Enterprise的安全、隐私、合规和工作空间管理基础之上。这允许组织在保持适当监督的同时,为AI提供更多上下文和访问更有价值工作流程的能力。
能力赢得首次使用。可依赖性让AI成为工作方式的一部分。
## 4. 随着使用量增长,每投入一美元AI能否完成更多工作?
最后一个问题是,规模化后经济效益是否改善。
公司可以通过长期跟踪同一工作流程来衡量这一点。追踪多少任务达到了质量标准、完成这些任务的总成本以及每成功任务成本。如果在质量保持或提高的情况下,完成的工作增长快于总成本增长,那么每投入一美元AI就产生了更多价值。
计算是这一公式的核心。
计算能力驱动着研究和AI完成的每一项任务。它塑造着产品质量、速度、可依赖性、可用性和成本。训练计算构建未来能力。推理计算交付今天的实用工作。两者都应转化为客户更好的成果。
更好的模型、更高效的推理、专用硬件、更高的利用率、更智能的路由以及更强的产品设计,都能提升计算投资的回报。每一代基础设施都有助于训练更强大的模型。更好的算法、硬件和软件则能以更高效率服务这些模型。
客户以人类体验的维度感受这些改进:更好的答案、更快的结果、更少的修正、更可靠的产品,以及所需工作的更低成本。
这些收益会持续累积增长。更好的基础设施加速研究。研究产出更强大、更高效的模型。更好的模型改善产品。更好的产品推动采用、学习和收入。这种增长支撑对下一代研究、计算、部署和安全进行持续投资。
OpenAI通过一个共享的智能平台将这些要素整合在一起。人们通过ChatGPT和ChatGPT Work使用它。开发者通过Codex和API进行构建。企业将其部署到工作发生的系统中。
当一个层面改进时,所有产品和客户都能受益。
## 人工智能时代的评分标准
综合来看,这四个衡量指标告诉我们“每美元的有用智能”是否在提升。
有用工作告诉我们AI产出了什么。每成功任务成本告诉我们实现该结果需要什么。可依赖性告诉我们人们可以放心使用多少工作成果。规模化价值告诉我们,每投入一美元和每一单位算力,长期内是否完成更多工作。
目标是让AI帮助人们做更有意义的工作、做出更好的决策,并将更多时间花在需要独特人类判断力和创造力的工作部分。
我们的职责是让这个等式随着每一代产品而变得更好:更强大的模型、更快更可靠的结果,以及客户所需工作的更低成本。
这就是AI随着时间的推移,如何对更多人和组织变得更加有用。
相似文章
智能每美元(2分钟阅读)
微软在模型发布卡上引入'平均Token使用量'作为衡量每美元智能的新指标,将AI竞争转向效率和成本效益。该指标在性能和实现智能的成本两方面对模型进行基准测试。
如何判断你的AI产品是否真正盈利?
讨论评估AI产品盈利能力的方法,重点关注关键财务和性能指标。
你的AI战略是在烧钱还是创造资本?
本文批判了当前企业中的AI狂热,由于Token滥用等低效使用方式,飙升的成本往往超过投资回报率。文章倡导同时关注组织流畅性和算法成本降低(例如观察掩码),从而将AI从资本消耗者转变为价值创造者。
@VKazulkin: "目标仍是价值" AI 采用并不等同于实现成果。作者:Francisco Trindade https://francisco…
文章认为,AI 采用应通过实际向客户交付的价值来衡量,而不是像 AI 使用率这样的中间指标,强调投资和周期时间在评估成果中的重要性。
@vasuman:只有三个价值类别对AI实施至关重要。时间/成本节省:AI是否会取代人类的工作...
文章讨论了AI实施的三个关键价值类别:时间/成本节省、收入提升和风险降低,强调了协调优先级和KPI以避开资源浪费的重要性。