思考的代价:推理努力作为模型特定的API契约

arXiv cs.AI 论文

摘要

本论文研究了AI模型API契约中推理努力参数的影响,基于对Sonnet 5的实验,表明显式高努力导致更高成本,而未检测到准确性提升。

arXiv:2608.16956v1 公告类型:新 摘要:API购买者购买的是有日期的合同,而不仅仅是模型名称:该合同包括请求和提供的模型、推理努力项或其省略、输出护栏、服务产品、提示和价格表。我们通过注册配对对比研究了推理努力项,对比了Sonnet 5在显式高努力和努力省略下的表现,使用30个AIME 2026项目和每个项目五次调用。每次付费尝试被分配一个冻结的终端类别,推理重采样项目并保留其重复调用。平均交付成本在显式高合同比省略合同高\$0.01031每次调用[+\$0.00204, +\$0.01974]。相应的准确性对比为+0.0133 [-0.0267, +0.0467];我们未检测到准确性差异,该区间允许最高4.67个百分点的增益,但该设计无法排除。每个正确答案的成本在高努力合同为\$0.08665,在省略合同为\$0.07662,作为注册点估计。有日期的合同普查、Models-API元数据和预注册原始响应探针进一步记录了模型特定的省略语义,包括在提供商内部;当原始结构不确定时,声明保持在文档级别。请求注册表、解析器、终端分类、统计计划和分析管道在结果被检查之前被冻结;因此产生的声明被限制在所研究的模型、任务和收集日期。
查看原文
查看缓存全文

缓存时间: 2026/08/19 09:47

# 推理努力程度作为模型特定的API契约
来源:https://arxiv.org/html/2608.16956

## 思考的代价:推理努力程度作为模型特定的API契约

**叶秉文**  
布兰迪斯商学院与经济学学院,布兰迪斯大学  
联系邮箱:[[email protected]](mailto:[email protected])

## 摘要

API购买者购买的是一个有时效性的契约,而非单纯的模型名称:该契约包含所请求和所服务的模型、推理努力程度项或其缺失情况、输出限制、服务产品、提示词以及价格方案。我们通过一项预先注册的配对对比研究,探讨了Sonnet 5模型在明确设定高努力程度与省略努力程度参数两种条件下的表现差异,使用30个AIME 2026题目,每个题目进行五次调用。每次付费尝试都被分配到一个固定的终止类别,而推理过程则在保留重复调用的前提下对题目进行重采样。在明确高努力契约下,平均每次调用的交付成本比省略契约下高出$0.01031 [$0.00204, $0.01974]。相应的准确率对比为+0.0133 [-0.0267, +0.0467];我们未检测到准确率存在显著差异,该区间允许高达4.67个百分点的增益,本设计无法排除此可能性。根据预先注册的点估计,高努力契约下每个正确答案的成本为$0.08665,而省略契约下为$0.07662。一项有时效性的契约普查、Models-API元数据以及预先注册的原始响应探测进一步记录了模型特定的省略语义,包括同一提供商内的情况;当原始结构不确定时,相关声明仅达到文档记录级别的可靠性。请求注册表、解析器、终止分类体系、统计计划和分析流程在检查结果之前就已冻结;所得声明被限制在所研究的模型、任务和收集日期范围内。

## 引言

语言模型旁边标出的价格并非完成任务的价格。当购买者为长度可变的补全付费时,API推理成本本就是随机的,但推理模型增加了一个更难理解的变异来源:在可见答案之前分配的隐藏思考令牌。陈等人(2026)报告称,在336个模型-任务比较中,约三分之一的实现成本颠倒了列出的令牌价格所暗示的顺序,并且对固定查询的重复调用在成本上存在显著差异。我们将这些结果视为已确立的背景,而非本研究的贡献。

该证据留下了一个更狭窄的未决问题。陈等人(2026)以单一推理设置运行每个模型,并将努力-成本消融视为未来工作。因此,他们的比较单位是配置后的模型:提供商、架构、令牌价格和推理模式的变化可能同时发生。他们还分别分析了成本与质量。错误响应保留其令牌成本,但付费尝试并未被分类为相互排斥的交付结果,这些结果能区分正确答案、错误答案、超出限制且无答案的响应、其他无答案响应以及提供商故障。这些选择适合研究模型级别的价格颠倒,但无法识别当买家在保持模型不变的情况下改变一个努力参数时实际获得了什么。也无法表明两个暴露相同名义控制的请求界面是否实现了相同的省略行为。对于这个问题,相关的对象并非单纯的提供商或模型名称,而是由所请求和所服务的模型、努力设置或省略情况、输出限制、服务产品、提示词、价格方案和运行日期所形成的契约。

我们提出:既然推理模型的成本是随机的,当买家改变同一模型API契约的一个明确条款时,会发生什么变化,应如何为由此产生的交付结果定价?我们的主要设计是一项预先注册的、Sonnet 5在明确高努力程度与Sonnet 5在努力参数被省略两种条件下的配对对比。努力程度和思考模式是独立的请求字段。在省略单元中,两者均未指定:Sonnet 5文档记录的默认值是高努力和自适应思考。禁用思考需要明确的请求 `thinking: {"type": "disabled"}`(参见示例1)。因此,主要单元的区别在于高努力是明确指定还是使用默认值,而非其文档记录的努力水平或思考模式。该比较保持了模型、提示词模板、30个AIME 2026题目、输出限制、服务产品和价格方案不变;每个题目在每种契约下接收五次调用。完整网格还增加了GPT-5.6 Terra(努力省略)和Claude Fable 5(努力省略)的单次通过参考单元,以及一个小型非同时期的GPT-5.4-mini低/高努力桥接单元。每次尝试的购买都会接收交付成本测量值和在固定优先级规则下的一个终止类别。无论停止状态如何,有效的最终答案即为正确或错误;限制结果需要同时满足超出限制且无有效最终答案;其他无答案和提供商故障状态保持分开。我们通过重采样题目同时保留每个选定题目的所有调用来估计单元均值和配对对比。因此,重复调用揭示了对一个问题的条件行为,而不会被计为额外的独立问题。

在明确高努力契约下,平均每次调用的交付成本比省略契约下高出$0.01031。相应准确率对比的点估计值为+0.0133,但我们未检测到准确率存在显著差异;预先注册的区间允许高达4.67个百分点的增益,这可能被一些买家重视。该结果不能解读为高努力毫无价值的证据。预先注册的每个正确答案成本点估计值在高努力契约下也高于省略契约下,但未预先注册单独的置信区间。三项支持性贡献将该对比置于可审计的市场环境中。首先,有时效性的契约普查和预先注册的原始响应探测记录了省略语义在不同模型间存在差异,包括单一提供商内,因此提供商级别的描述过于粗糙。原始结构验证了一些精确模型的声明,而结构不确定的响应使其他声明停留在文档记录级别。其次,固定的终止结果分类体系将错误和无答案的调用保留在购买的交付结果组合及其成本总额中,而非将其视为缺失观测值。第三,请求注册表、支出限制、解析器、统计规则和分析流程在检查预先注册结果之前就已固定。这些要素共同将努力标签转化为可测量的契约比较,同时将经验性声明限制在所研究的模型、任务和收集日期内。

## 相关工作

成本感知部署研究将模型选择视为经济决策而非纯粹准确率排序。Chen, Zaharia, and Zou (2023) 在 FrugalGPT 中将此决策形式化为受成本约束的效用最大化,并学习级联路由,将查询通过一系列模型路由,当更便宜的响应足够时停止,否则升级。在该公式中,可用服务及其成本信息是路由问题的输入:路由器从其单次查询价格被视为已知输入的模型中选择。我们的环境改变了被选择的对象,而非成本感知路由的逻辑。买家可以在一个模型内改变推理努力程度项,而省略本身就是一个模型特定的请求状态。因此,我们将配置好的API契约视为候选服务。我们并非声称发现了列出价格与实现价格之间的不匹配;该发现属于下面讨论的Chen等人(2026)。

成本调整后的评估询问一旦推理费用纳入目标,能力比较将如何变化。Erol等人(2025)定义了 Cost-of-Pass,这是一个经济框架的前沿指标,结合了任务成功和跨模型与策略的推理成本。我们的每个正确答案成本属于同一类别:总交付成本除以正确结果数量。我们并非将其提出为一个新指标。相反,我们在一个商业模型内、两种预先注册的努力契约下应用该量,将其作为点估计报告,并在成本和终止结果核算中保留每一次付费尝试。Cost-of-Pass 提供了决策框架;本研究询问的是,在其他条件固定的模型契约下,改变一个请求项是否会改变购买的交付结果,而非构建另一个跨模型前沿。

FrugalGPT 的作者们在 *价格颠倒现象*(Chen et al., 2026)中回到了这个问题,该研究在更大的模型和任务广度上考察了推理模型的成本。他们报告称,列出的令牌价格经常颠倒实现的工作负载成本——在固定的v2版本中约三分之一的336次比较——并将颠倒归因于单轮任务上的思考令牌量以及代理设置中的额外轮次和上下文效应。他们还报告了对固定查询的重复调用之间存在显著的成本差异。我们视这些为已确立的结果,而非本文的贡献。他们的设计在单一推理设置下运行每个模型,分别分析成本与质量,且未按终止结果对付费尝试进行分类。我们更窄的出发点是预先注册的模型内对比:明确高努力与省略契约,结合项目聚类推理以及交付成本和终止结果的联合核算。

## 方法

### 任务与题目

准确度评估工具是完整的30个AIME 2026题目集,通过MathArena评估平台(Dekoninck et al., 2026)和固定的 MathArena/aime_2026 revision 分发。我们保留了有序的测量ID,从 aime_2026_i_01 到 aime_2026_i_30。模型响应自由生成,但评分目标是闭式:最终声明的答案必须是0到999之间的整数。固定的解析器读取最终明确的 `Answer: N` 声明,当最终声明格式错误时,不会回退到之前看似有效的声明。

选择 AIME 2026 是为了减少在前一年题目上观察到的数据污染问题。该竞赛于2026年2月举行,晚于预先注册设计中使用的文档知识截止日期,尽管与Anthropic的2026年1月截止日期差距很小。在初步队列中,Sonnet low 在约100个计费输出令牌内正确回答了两个 AIME 2025 题目,如此少的令牌不足以包含隐藏推理。在 AIME 2026 的相同题目索引上,计费输出增加到755和1627个令牌,而可见回复仍为简短的最终声明,表明存在大量隐藏计算。我们将此索引内的变化视为类似检索的新鲜度诊断,而非 AIME 2026 未被污染的证明。AIME 材料的许可证为 CC BY-NC-SA。因此,发布内容包含题目标识符、配置、测量和派生结果,但不包含题目文本或参考答案。

### 契约与预先注册的单元

比较单位是契约单元:请求的模型、服务的模型、努力项或其省略、输出限制、服务产品、请求模式、提示词模板、有时效性的价格方案以及收集日期。此定义防止将特定模型的结果推广为提供商范围的声明,并使服务模型或服务层级的不匹配成为可观察的契约偏差,而非可忽略的实现细节。

主网格包含所有30个题目上的四个预先注册单元。我们将完整契约称为 Sonnet high、Sonnet omitted、Terra omitted 和 Fable omitted。两个 Sonnet 单元各使用每个题目五次调用;Terra omitted 和 Fable omitted 各使用一次。重复深度集中在配对的 Sonnet 对比中,其中条件内的题目行为是预先注册的估计目标;单次通过单元用作跨模型参考点。两个早期的 gpt-5.4-mini 单元提供了五个题目的描述性桥接。每个单元使用固定的 aime_frozen_v1 提示词模板和64,000个令牌的输出限制。

表1. 预先注册的 AIME 2026 契约单元和描述性桥接单元。
| 单元名称 | 请求的模型与努力项 | 题目数 x 每题调用数 | 总调用数 | 收集日期 |
| :--- | :--- | :--- | :--- | :--- |
| Sonnet high | claude-sonnet-5, 明确 high | 30 x 5 | 150 | 2026-07-18 |
| Sonnet omitted | claude-sonnet-5, 努力省略 | 30 x 5 | 150 | 2026-07-18 |
| Terra omitted | gpt-5.6-terra, 努力省略 | 30 x 1 | 30 | 2026-07-18 |
| Fable omitted | claude-fable-5, 努力省略 | 30 x 1 | 30 | 2026-07-18 |
| Mini low bridge | gpt-5.4-mini, 明确 low | 5 x 1 | 5 | 2026-07-09 |
| Mini high bridge | gpt-5.4-mini, 明确 high | 5 x 1 | 5 | 2026-07-09 |

360次主网格调用在单一预先注册会话 `aime2026_main_20260718_01` 中完成,使用非流式实时请求且无自动重试。每次调用作为独立、无状态的API请求发出:未提供对话历史或早期响应,研究未在调用之间传递任何状态。因此,重复调用采样的是相同的固定请求契约,而非模型已见过该题目的对话。调度顺序是固定的而非随机的:在所有150个 Sonnet 题目/重复对中,高努力调用在队列中排在省略调用之前。前20对严格顺序运行;剩余130对使用有界并发,每个提供商最多三个进行中请求,因此完成顺序可能不同。每个成功的主网格响应都报告了所请求的准确模型ID。桥接别名解析为 gpt-5.4-mini-2026-03-17;其共享的五个题目索引为1、5、8、12和15。由于这些桥接调用是非同时期的且仅覆盖五个题目,其比较仍属于描述性。

### 有时效性的契约普查与结构探测

在主网格推广之前,我们于7月14日使用官方文档和Models-API元数据(未进行推理调用)冻结了七个当前菜单模型ID的普查。7月16日,我们在预选的 HEADLINES 任务上运行了19个预先注册的单题契约探测。这些探测测试了请求接受度、服务身份、回显的努力程度、思考块结构、思考令牌细节以及明确的禁用思考请求;其任务准确率未用于选择主网格单元。

证据等级遵循固定的层次结构。原始的努力回显值、正向的思考结构或对明确禁用思考请求的接受或拒绝仅提升其直接识别的契约属性。相比之下,缺失的思考块与缺失或为零的思考令牌字段结合,无法区分禁用思考与选择零个令牌的自适应思考。此类结果保持不确定状态,不提升文档记录的省略行为。

### 交付成本与终止结果

交付成本根据为每个单元预先注册的价格方案,从提供商报告的用量重建。重建使用了提供商适用的输入、缓存输入和输出核算,包括输出用量中计费的推理部分,并与每行存储的成本进行核对。对于7月18日的主会话,提供商级别的重建总额还与控制台中心精度下经认证的控制台余额变化进行了核对。此外部核对验证了核算边界,未更改任何行或统计估计。

每次尝试的调用恰好接收五个终止类别之一:`correct`(正确)、`wrong`(错误)、`no_answer_rail`(超出限制无答案)、`no_answer_other`(其他无答案)或 `provider_failure`(提供商故障)。分类遵循固定的优先级。有效的最终声明无论其停止状态如何,即为正确或错误;限制结果需要同时满足超出限制且无有效最终答案;其他无答案和提供商故障状态保持分开。

相似文章

控制LLMs中的推理努力

Hacker News Top

本文讨论了在LLMs中控制推理努力,包括OpenAI发布的GPT-5.6具有多种推理努力设置,并提供了开发可调节努力模式的推理模型的指导。