推理的影子价格:LLM最优预算分配的经济学视角

arXiv cs.AI 论文

摘要

本文将LLM推理预算分配形式化为一个约束优化问题,提出CLEAR方法,将资源从低效用查询重新分配到接近涌现阈值的查询,在预算紧张的情况下实现了高达3倍的准确率提升。

arXiv:2606.03092v1 Announce Type: new 摘要:推理时扩展已成为提升大语言模型性能的关键途径,但实际部署受到严格计算预算的限制。本文中将推理预算分配建模为受经济学原理支配的全局约束优化问题。通过使用平移激增函数对每个查询的推理效用进行建模,我们推导出基于全局影子价格的最优分配策略,该影子价格在资源稀缺下使边际效用均衡。基于这一理论,我们提出了受约束的推理潜在效用均衡分配方法(CLEAR)。它执行理性放弃,并将资源从无力解决的查询重新分配到接近其涌现阈值且可解决的查询。 在各种推理任务和不同流量流的广泛实验表明,CLEAR显著改善了总token成本与平均准确率之间的帕累托前沿。在资源稀缺情况下,与均匀分配相比,CLEAR在全局准确率上实现了高达3倍的提升。
查看原文
查看缓存全文

缓存时间: 2026/06/03 09:42

# 大型语言模型最优预算分配的经济学视角
来源:https://arxiv.org/html/2606.03092
## 推理的影子价格:大型语言模型最优预算分配的经济学视角

Speed Zhu, Jianwei Cai, Guang Chen, Ximing Huang, Wiggin Zhou, Mingyang Sun

###### 摘要

推理时间扩展已成为提升大型语言模型性能的关键途径,然而实际部署受严格计算预算的约束。本文中,我们将推理预算分配表述为一个由经济原则支配的全局约束优化问题。通过使用移位-激增函数对每次查询的推理效用进行建模,我们推导出一种基于全局影子价格的最优分配策略,该影子价格在资源稀缺条件下平衡边际效用。基于这一理论,我们提出了一种用于推理的约束潜效用均衡分配方法(CLEAR)。它执行理性放弃,并将资源从无力偿还的查询重新分配到接近其涌现阈值的可解查询。在不同流量流的多个推理任务上的大量实验表明,CLEAR 显著改善了总令牌成本与平均准确率的帕累托前沿。在资源稀缺情况下,与均匀分配相比,CLEAR 在全局准确率上实现了高达 3 倍的提升。

代码可在此处获取:https://github.com/waunx/CLEAR

机器学习,ICML

## 1 引言

请参考图注 图 1:S 型计算-效用曲线。我们在三个基准上评估了 Qwen2.5-Math-7B(Yang 等,2024)。预算-性能关系表现出三个不同区域:(1) 阈值前的“严格”阶段,效用可忽略;(2) 快速“激增”阶段,具有高杠杆作用;(3) “充裕”阶段,收益递减。

请参考图注 图 2:经验展开与潜效用。对于选定的 AIME-24 问题,蓝色条表示每个长度区间内正确展开的数量,红色曲线表示由我们的移位-激增模型拟合的潜效用映射。

大型语言模型的发展正在经历从训练时间扩展到推理时间扩展的范式转变(Wei 等,2022;Snell 等,2024;Wu 等,2024)。最近的突破表明,通过调用“系统 2”推理能力,增加测试时计算量可以产生与扩展模型参数相当的性能提升(Weston 和 Sukhbaatar,2023;Brown 等,2024)。一系列长度扩展实验进一步验证了,允许模型思考更长时间会导致复杂推理任务的显著改进(Muennighoff 等,2025;Aggarwal 和 Welleck,2025)。然而,在实际部署场景中,测试时计算是一种有限且昂贵的商品。无论是通过云 API 服务数百万并发用户,还是在资源受限的边缘设备上运行模型,从业者都受到严格的全局预算约束(Chen 等,2023)。因此,核心挑战从单纯提高模型智能的理论上限,转变为在固定计算上限下最大化全局效用(Raposo 等,2024)。

标准部署实践通常采用统一策略,为每个查询分配相同的生成限制(例如,固定的 `max_new_tokens`)。这隐含地假设所有查询具有可比的计算-效用曲线,这与推理任务的巨大异质性相冲突。如图 1 所示,当我们固定解码策略并改变令牌限制时,推理效用遵循 S 型曲线。对于像 AIME 这样的难题,统一的限制可能使轨迹停留在“严格”阶段,此时计算被消耗但效用接近于零。对于像 GSM8K 这样的简单问题,相同的限制可能使生成进入“充裕”阶段,此时额外的令牌只能带来递减的回报。当然,在无约束资源设置中,将简单问题推入“充裕”阶段导致的低效率可能不那么重要。然而,本文关注资源受限的设置,即在整个评估集上施加固定的总令牌预算。因此,核心问题是如何在单个查询之间分配令牌,以便在此全局预算下最大化整体令牌效用。

因此,我们将推理预算制定视为一个批次级别的分配问题:给定一个固定的总令牌供应量,决定每个查询应接收多少令牌以最大化总期望效用。这产生了一个关于实例特定效用曲线的全局约束优化问题。尽管最终目标是非凸的,但其拉格朗日形式揭示了一个简单的经济原理:在最优状态下,每个活跃查询应花费令牌,直到其边际效用等于一个共同的全局影子价格(Boyd 和 Vandenberghe,2004;Devanur 等,2019)。那些可达到的边际增益从未超过此价格的查询不应获得预算,而其余查询则根据其效用斜率共享预算。

基于这些发现,我们提出了用于推理的约束潜效用均衡分配方法(CLEAR)。CLEAR 并不为每个查询假设统一效用,而是将其映射到一条激增形状的效用曲线。然后系统作为一个计算市场运行:(1) **阈值建模**:我们估计每个查询的涌现阈值并实例化其潜效用曲线;(2) **价格发现**:我们采用快速二分搜索找到唯一的全局影子价格来出清市场,确保总需求与可用预算匹配;(3) **最优分配**:根据发现的价格,我们应用从 Lambert W 函数导出的闭式策略严格确定每个查询的令牌限制,自动处理截断或理性放弃。关键的是,CLEAR 不需要重新训练基础 LLM,并且作为即插即用的推理包装器运行。

我们的贡献总结如下:

(1) 我们识别出 LLM 推理中三个阶段的计算-效用模式,并在非凹的潜效用曲线上形式化了推理时间令牌分配问题,其中最优策略由全局影子价格支配。

(2) 我们导出了闭式的 Lambert W 分配策略,并将其实例化为 CLEAR,这是一个结合了潜阈值预测与市场出清价格发现的即插即用框架。

(3) 我们在混合复杂度的数学推理基准上验证了 CLEAR,展示了改进的成本-准确率帕累托效率以及对超参数选择和预测器噪声的鲁棒性。

## 2 实证动机

为了更好地建模每个查询推理令牌的效用,我们研究更长的推理是否对每个查询都均匀有益。如果每个问题都有一个实例特定的有利推理长度,那么推理效用应该在超过最小阈值后自然上升,但当生成过多时最终会饱和或下降。

遵循 DeepSeek-R1 中的“思想学”分析(Marjanović 等,2025),我们使用 Qwen2.5-Math-7B 进行了一项受控实验。我们使用高温 T=1.0 进行采样,以诱导不同长度的多样化推理路径。我们为 AIME-24 生成 N=50 个响应,为 GSM8K、MATH-500 基准生成 N=4 个响应,并将生成的轨迹分组到长度区间中以计算条件 Pass@1 准确率。

如图 2 所示,推理效用表现出非线性动态,而非简单的缩放。我们识别出三个反复出现的区域:一个“严格”阶段,其中短轨迹持续失败,暗示存在一个最小可解阈值;一个“激增”阶段,超过此阈值后性能急剧上升;以及一个“充裕”阶段,此处额外的生成产生递减的回报,并可能最终降低解决方案质量。

## 3 问题形式化

基于上述实证观察,我们首先用一个捕获严格-激增-充裕结构的函数来建模每个查询的推理效用。在此效用模型下,在固定总预算下分配令牌的问题自然成为一个具有实例相关、非凹效用景观的全局约束优化问题。

### 3.1 建模推理的物理过程

虽然推理任务的观测结果是二元的(正确或错误),但我们假设这个结果是由一个连续的、不可观测的变量支配的:推理效用 \(\phi(t)\)。对于查询 \(i\),我们建模在生成 \(t\) 个令牌后的累积势能,遵循一个移位激增函数:

\[
\phi_i(t) = \begin{cases} 0 & 0 \leq t < \tau_i \\ \alpha_i (t - \tau_i) \cdot e^{-\beta_i (t - \tau_i)} & t \geq \tau_i \end{cases} \tag{1}
\]

该参数化将潜效用模型与上述观察到的三个经验阶段对齐:

- **严格**:在生成长度跨过潜涌现阈值 \(\tau_i\) 之前,效用保持为零。
- **激增**:一旦超过阈值,推理势能以初始速度 \(\alpha_i\) 上升,捕获有效推理的快速积累。
- **充裕**:当生成过度延长时,指数衰减项 \(e^{-\beta_i \Delta t}\) 占主导,反映递减的回报。

在图 2 中,红色曲线可视化了拟合的潜推理势能,它提供了从不同生成长度下观察到的经验展开结果到连续效用的映射。

### 3.2 全局优化目标

我们采用纯基于令牌的成本模型,其中成本 \(C_i(t) = t\)。系统的目标是为 \(N\) 个查询分配一个令牌向量 \(\mathbf{t} = [t_1, \dots, t_N]\),以在全局令牌预算限制 \(B_{\text{total}}\) 下最大化总推理势能:

\[
\max_{\mathbf{t} \in \mathbb{R}_{\geq 0}^N} \sum_{i=1}^N \phi_i(t_i) \tag{2}
\]
\[
\text{s.t.} \quad \sum_{i=1}^N t_i \leq B_{\text{total}}.
\]

## 4 理论分析

为解决式 (2) 中的非凸优化问题,我们应用拉格朗日乘子法。通过松弛全局预算约束,我们建立了一个支配最优推理的经济原则:边际推理势能的均等化。

### 4.1 影子价格均等

我们构造拉格朗日函数 \(\mathcal{L}(\mathbf{t}, \lambda) = \sum_i \phi_i(t_i) - \lambda (\sum_i t_i - B_{\text{total}})\),其中 \(\lambda \geq 0\) 是拉格朗日乘子。在经济术语中,\(\lambda\) 表示计算的**全局影子价格**——通过放松一个令牌的预算所获得的总势能的边际增益。

Karush-Kuhn-Tucker (KKT) 条件表明,对于任何全局最优分配 \(\mathbf{t}^*\),每个活跃任务的边际增益必须与此全局价格一致。这种均等决定了一个查询是否应该被提升出“严格”阶段,放置在其高杠杆的“激增”阶段附近,或者在浪费预算于“充裕”阶段之前被截断。我们将其形式化为:

###### 定义 4.1(影子价格均等)

一个严格正的预算分配 \(t_i^* > 0\) 是一个局部最大值,如果它满足一阶驻点条件,将边际推理势能与全局影子价格相等:

\[
\frac{\partial \phi_i(t_i^*)}{\partial t_i} = \lambda. \tag{3}
\]

然后通过比较此驻点处的效用剩余与放弃选项(\(t_i = 0\))来确定全局最优策略。我们将此称为**理性放弃条件**,其中最大净剩余低于零的任务被认为经济上无力偿还,并被分配零预算。

### 4.2 个体最优分配策略

对于激增势能 \(\phi_i(t) = \alpha_i \Delta t e^{-\beta_i \Delta t}\),其中 \(\Delta t = t - \tau_i\),影子价格均等条件导出微分方程:

\[
\frac{d\phi_i}{dt} = \alpha_i e^{-\beta_i \Delta t} (1 - \beta_i \Delta t) = \lambda. \tag{4}
\]

虽然标准代数方法无法从这个超越方程解出 \(t\),但我们证明精确解由 Lambert W 函数 \(W(z)\) 给出,它被定义为 \(f(w) = w e^w\) 的反函数。

###### 定理 4.2(个体最优分配策略)

在影子价格均等条件下,给定 \(\lambda\) 的最优令牌分配 \(t_i^*\) 遵循一个闭式解:

\[
t_i^*(\lambda) = \tau_i + \frac{1}{\beta_i} \left[ 1 - W_0 \left( \frac{\lambda e}{\alpha_i} \right) \right], \tag{5}
\]

受制于偿付能力约束 \(\phi_i(t_i^*) > \lambda t_i^*\)。此处,\(W_0(\cdot)\) 表示 Lambert W 函数的主分支,\(e\) 是欧拉数。

###### 证明

每个任务 \(i\) 的目标是最大化净经济剩余 \(J_i(t)\),它被定义为潜推理势能与令牌机会成本之间的差:

\[
J_i(t) = \phi_i(t) - \lambda t = \alpha_i (t - \tau_i) e^{-\beta_i (t - \tau_i)} - \lambda t. \tag{6}
\]

我们假设任务处于活跃推理阶段(\(t \geq \tau_i\))。令 \(\Delta t = t - \tau_i\) 表示有效生成长度。最优性的一阶必要条件要求边际势能等于影子价格:

\[
\frac{d\phi_i}{dt} = \lambda. \tag{7}
\]

应用乘积法则对激增函数关于 \(t\) 求导:

\[
\begin{aligned}
\frac{d}{dt} \left[ \alpha_i \Delta t e^{-\beta_i \Delta t} \right] &=
\alpha_i \left( 1 \cdot e^{-\beta_i \Delta t} + \Delta t \cdot (-\beta_i) e^{-\beta_i \Delta t} \right) \\
&= \alpha_i e^{-\beta_i \Delta t} (1 - \beta_i \Delta t). \tag{8}
\end{aligned}
\]

将其等于 \(\lambda\),我们得到超越方程:

\[
\alpha_i e^{-\beta_i \Delta t} (1 - \beta_i \Delta t) = \lambda. \tag{9}
\]

为了求解 \(\Delta t\),我们将此方程转换为 Lambert W 函数的标准形式 \(w e^w = z\)。引入变量替换:

\[
u = 1 - \beta_i \Delta t. \tag{10}
\]

这意味着 \(\beta_i \Delta t = 1 - u\),因此指数项变为 \(e^{-\beta_i \Delta t} = e^{-(1-u)} = e^{u-1}\)。将这些代入最优性条件:

\[
\begin{aligned}
\alpha_i \cdot e^{u-1} \cdot u &= \lambda \\
u e^{u} e^{-1} &= \frac{\lambda}{\alpha_i} \\
u e^{u} &= \frac{\lambda e}{\alpha_i}. \tag{11}
\end{aligned}
\]

现在,方程呈现为 Lambert W 函数的规范形式 \(w e^{w} = z\),其中 \(w = u\) 且 \(z = \frac{\lambda e}{\alpha_i}\)。应用 \(W_0(\cdot)\) 主分支,我们得到 \(u = W_0\left( \frac{\lambda e}{\alpha_i} \right)\)。回代 \(u = 1 - \beta_i \Delta t\) 并求解 \(\Delta t\):

\[
\begin{aligned}
1 - \beta_i \Delta t &= W_0\left( \frac{\lambda e}{\alpha_i} \right) \\
\beta_i \Delta t &= 1 - W_0\left( \frac{\lambda e}{\alpha_i} \right) \\
\Delta t &= \frac{1}{\beta_i} \left[ 1 - W_0\left( \frac{\lambda e}{\alpha_i} \right) \right]. \tag{12}
\end{aligned}
\]

最后,恢复总令牌预算 \(t_i = \tau_i + \Delta t\),得到闭式分配规则:

\[
t_i^*(\lambda) = \tau_i + \frac{1}{\beta_i} \left[ 1 - W_0\left( \frac{\lambda e}{\alpha_i} \right) \right]. \tag{13}
\]

该解仅在有效(\(t_i^* \geq \tau_i\))且任务净剩余非负时才成立。

□

Lambert W 函数确保解的存在性和唯一性:对于所有 \(\lambda e / \alpha_i \geq 0\),\(W_0\) 返回一个非负值,当 \(\lambda e / \alpha_i = 0\) 时在 \(-1\) 处达到最小值。当影子价格相对于潜速度 \(\alpha_i\) 足够高时,\(W_0\) 超过 1,导致负的 \(\Delta t\)——表明该问题无法在正剩余下获得资金,因此满足理性放弃条件。分配策略的几个性质值得强调:

- **单调性**:随着影子价格 \(\lambda\) 上升,\(W_0\left( \frac{\lambda e}{\alpha_i} \right)\) 增加,从而 \(\Delta t\) 收缩。更高的计算机会成本有效压缩了推理长度。
- **阈值意识**:基础阈值 \(\tau_i\) 作为一个不可削减的基础需求。\(\lambda\) 下的最优分配从不低于此下限,因为成本函数在 \(\tau_i\) 以下没有边际收益。
- **偿付能力约束**:对于每个活跃查询,我们必须验证 \(\phi_i(t_i^*) > \lambda t_i^*\)。如果失败,任务即使在阈值之上也无法产生足够利润来覆盖其机会成本,应被放弃。

相似文章

大语言模型搜索代理的推理时预算控制

arXiv cs.AI

本文提出了一种用于大语言模型(LLM)搜索代理的两阶段推理时预算控制方法,利用信息价值(VOI)分数在多跳问答过程中优化工具调用和 Token 分配。

BAGEN:LLM智能体是否具有预算意识?

arXiv cs.LG

本文介绍了BAGEN,一个评估LLM智能体预算意识的框架,将预算估计定义为内部预算和外部预算,并形式化了渐进式区间估计。实验表明,强智能体缺乏预算意识,过于乐观,提前停止可以节省令牌,而训练可以改善告警行为。

Agora:通过基于拍卖的任务分配增强LLM智能体推理

arXiv cs.AI

Agora引入了一种基于拍卖的任务分配机制,用于LLM智能体,将推理步骤视为可交易物品,并使用校准后的置信度将任务路由到最有能力的专家模型,从而在多个基准测试中提升推理性能。

大语言模型何时进行推理?基于熵相变的动力系统视角

arXiv cs.LG

本文探讨了思维链推理在何时对大语言模型有益,表明早期熵动力学能够可靠地指示推理效用,并介绍了EDRM,这是一个轻量级、无需训练的框架,可自适应选择推理策略,在保持或提升准确率的同时显著节省token。