并非所有Token都平等:面向代理型LLM系统的通胀感知路由

arXiv cs.CL 论文

摘要

本文介绍了InflationAgent,这是一个为代理型LLM设计的路由系统,它能测量Token通胀,使用思维链分支熵(CoT Branching Entropy)预测任务难度,并优化模型选择以最大化成本精度比,在如GSM8K等基准测试中,以更少的Token实现更高的准确率。

arXiv:2608.13571v1 公告类型:新 摘要:当语言模型在第一次尝试中未能回答查询时,代理型系统会重试,每次消耗额外的Token。这种重试开销导致模型每Token价格所暗示的成本与完整工作流实际成本之间产生差距。我们将此差距称为 \emph{token inflation},并将其定义为真实工作流成本与单次调用成本之比。像FrugalGPT这样的系统基于后者进行路由,这可能在困难任务上低估真实成本超过 $2\times$。我们使用InflationAgent来解决这个问题,这是一个四阶段路由器,它(1)系统地测量不同模型层级和任务类型的Token通胀,发现7B模型在多跳问答中的通胀高达 $4.25\times$;(2)引入思维链分支熵(CoT Branching Entropy,CBE),这是一个完全从本地推理计算得出的执行前难度信号,其预测高通胀的AUROC为0.887;(3)通过最大化语义汇率(Semantic Exchange Rate,SER)来选择模型,该汇率将预期准确率除以预测的真实成本,并采用新鲜升级策略,在路由到更强模型之前丢弃失败的链路。在固定预算下的GSM8K测试中,InflationAgent实现了94.7\%的准确率,而FrugalGPT为91.0\%,同时使用了更少的31\%的Token,我们表明将失败的推理链转发给GPT-4o可将其准确率降低多达34.8个百分点,验证了新鲜升级设计。
查看原文
查看缓存全文

缓存时间: 2026/08/17 09:38

# 并非所有 Token 都相同:面向智能体 LLM 系统的通胀感知路由

来源:https://arxiv.org/html/2608.13571

11institutetext: 石溪大学11email:\{heming\.fu, shan\.x\.lin\}@stonybrook\.edu22institutetext: 武汉大学22email:\{xieq@whu\.edu\.cn\}33institutetext: 上海交通大学33email:\{gjxiong@sjtu\.edu\.cn\}

###### 摘要

当语言模型首次尝试未能回答查询时,智能体系统会重试,每次消耗额外的 token。这种重试开销导致模型的单 token 定价与完整工作流程的实际成本之间产生差距。我们将此差距称为*token 通胀*,定义为实际工作流程成本与单次调用成本的比率。像 FrugalGPT\[1 (https://arxiv.org/html/2608.13571#bib.bib1)\] 这样的系统基于后者进行路由,在困难任务上可能将实际成本低估超过 2 倍。我们通过 InflationAgent 解决了这个问题,这是一个四阶段路由器,它(1)系统性地衡量不同模型层级和任务类型的 token 通胀,发现 7B 模型在多跳问答任务上的通胀高达 4.25 倍;(2)引入了思维链分支熵(CBE),这是一种完全基于本地推理计算的执行前难度信号,以 0.887 的 AUC 预测高通胀;(3)通过最大化语义汇率(SER)来选择模型,该汇率将预期准确率除以预测的真实成本,并采用“新鲜升级”策略,在路由到更强模型之前丢弃失败的推理链。在固定预算的 GSM8K 任务上,InflationAgent 实现了 94.7% 的准确率,而 FrugalGPT 为 91.0%,同时使用的 token 减少了 31%。我们还表明,将失败的推理链转发给 GPT-4o 会使其准确率降低多达 34.8 个百分点,验证了“新鲜升级”设计的有效性。

###### 关键词:

LLM 路由 token 智能体 通胀系统 成本感知推理

## 1引言

基于大型语言模型构建的现代智能体系统很少只发出单次调用就结束。当模型返回错误答案或不完整的推理链时,智能体会重试\[18 (https://arxiv.org/html/2608.13571#bib.bib2),13 (https://arxiv.org/html/2608.13571#bib.bib3)\]。ReAct 风格的智能体在工具出错后重新发出查询;自洽性方法\[15 (https://arxiv.org/html/2608.13571#bib.bib4)\]采样多个推理链;代码生成智能体循环直到测试通过\[8 (https://arxiv.org/html/2608.13571#bib.bib7)\]。这些重试的成本是真实存在的,但对于路由决策却是不可见的。

考虑一个具体例子。用户要求一个流程回答:“谁导演了那部由与迈克尔·杰克逊合作《Thriller》的艺术家作曲原声的电影?” 一个 7B 的本地模型可能尝试五次仍然失败,消耗的 token 大约是成本估算器预测的五倍。而 GPT-4o 调用第一次就正确回答了问题。按实际工作流程成本衡量,“便宜”的选项一点也不便宜。

现有的路由系统\[1 (https://arxiv.org/html/2608.13571#bib.bib1),14 (https://arxiv.org/html/2608.13571#bib.bib12),4 (https://arxiv.org/html/2608.13571#bib.bib11)\] 将查询成本估算为每 token 价格乘以单次调用的预期输出长度。当模型首次尝试失败时,这个估算可能偏差两到五倍。我们将这种差异称为*token 通胀*:工作流程的实际成本与单次调用估算预测成本之间的比率。

本文介绍了 InflationAgent,一个做出了三项贡献的路由系统。**衡量**:我们在两个推理任务和三个模型层级上部署了一个智能体重试框架,以表明通胀因任务类型而异,在多跳问答任务上,7B 模型通胀达到 4.25 倍,而 GPT-4o 仅为 1.31 倍。**预测**:我们引入了思维链分支熵(CBE),这是一种执行前难度信号,通过少量本地推理链样本估算重试可能性,无需 API 成本。**路由**:我们将语义汇率(SER)定义为预期准确率除以预测的真实成本,路由到 SER 最高的模型,并在所选模型通胀超出预测时,使用新的提示进行升级。

图 1 (https://arxiv.org/html/2608.13571#S1.F1) 说明了核心动机:每个点是一个查询,以其 FrugalGPT 估算的 token 数与实际工作流程 token 数绘制。对角线以上的点代表路由系统当前忽略的隐藏成本。

参照说明 图 1:200 个困难 GSM8K 查询上的 token 通胀(Qwen2\.5\-7B,最多 5 次重试)。**左图**:每个点是一个查询。x 轴是 FrugalGPT 单次调用成本估算;y 轴是实际工作流程成本。颜色编码通胀率,从绿色(1 倍,首次回答正确)到红色(5 倍,所有重试用尽)。对角线以上的点具有通胀的成本。**右图**:通胀率的累积分布函数。分布是双峰的:75% 的困难查询在第一次尝试时成功(1 倍成本),25% 的查询五次重试均失败(5 倍成本),使得平均值为 2 倍,导致 FrugalGPT 低估实际工作流程成本 110%。
## 2相关工作

#### LLM 成本路由与级联。

越来越多的工作通过将简单查询路由到较小模型来降低推理成本。FrugalGPT\[1 (https://arxiv.org/html/2608.13571#bib.bib1)\] 学习一个级联策略,一旦响应通过质量阈值就停止升级。RouteLLM\[9 (https://arxiv.org/html/2608.13571#bib.bib10)\] 在人类偏好数据上训练路由器;Hybrid LLM\[14 (https://arxiv.org/html/2608.13571#bib.bib12)\] 根据查询复杂度进行路由;RouterBench\[4 (https://arxiv.org/html/2608.13571#bib.bib11)\] 对跨模型家族的路由策略进行基准测试;LLM\-Blender\[5 (https://arxiv.org/html/2608.13571#bib.bib13)\] 融合来自多个模型的输出;语言模型级联\[3 (https://arxiv.org/html/2608.13571#bib.bib18)\] 依次查询能力越来越强的模型,直到一个产生置信答案。所有这些系统都将路由成本估算为单次调用的每 token 价格,这仅在流程仅执行所选模型一次时才准确。在有重试的智能体设置中,单次调用估算系统地低估了真实成本。我们的工作明确地模拟了这种重试开销,并将其纳入路由目标。

#### 语言模型的不确定性估计。

自洽性\[15 (https://arxiv.org/html/2608.13571#bib.bib4)\] 生成多个补全,并使用答案一致性作为隐式置信度度量。语义不确定性\[7 (https://arxiv.org/html/2608.13571#bib.bib20)\] 在测量熵之前对语义等效的答案进行聚类,以纠正释义变化。Kadavath 等人\[6 (https://arxiv.org/html/2608.13571#bib.bib22)\] 表明,大型模型在适当提示下可以产生校准的自我评估。思维链分支熵(CBE)与自洽性相关,但目的不同:我们不是聚合答案以进行最终输出,而是使用少量链样本的熵作为重试概率的*执行前*代理。关键的设计选择是 CBE 在本地计算,不增加路由决策的 API 成本。

#### 智能体系统与多步推理。

思维链提示\[16 (https://arxiv.org/html/2608.13571#bib.bib8)\] 通过引出中间步骤来提高推理能力。ReAct\[18 (https://arxiv.org/html/2608.13571#bib.bib2)\] 将推理和工具使用交织成可检查的智能体轨迹。Reflexion\[13 (https://arxiv.org/html/2608.13571#bib.bib3)\] 添加了口头自我批评,允许智能体修订失败的计划。AgentBench\[8 (https://arxiv.org/html/2608.13571#bib.bib7)\] 在多样化的任务环境中评估 LLM 智能体。这项工作证实重试循环是标准做法,但未解决其成本影响。当重试很常见时,预期的 token 成本可能远超过单次调用的成本,我们的工作通过一种考虑到这一点的路由方式弥补了这一差距。

## 3方法

### 3\.1问题公式化

我们考虑一个智能体流程,它从候选集合 \(\mathcal{M}\) 中选择一个模型 \(m\),并在查询 \(x\) 上执行最多 \(R\) 次重试尝试。令 \(T_k(m,x)\) 表示第 \(k\) 次调用的 token 数。真实的工作流程成本为

\(C_{\text{true}}(m,x)=\sum_{k=1}^{k^*} T_k(m,x)\), (1)

其中 \(k^*\) 是首次成功尝试的索引(如果模型从未成功,则 \(k^* = R\))。现有路由器将其近似为 \(C_{\text{direct}}(m,x) = T_1(m,x)\),即单次调用成本。*Token 通胀*是比率

\(\text{Inflation}(m,x) = C_{\text{true}}(m,x) / C_{\text{direct}}(m,x)\)。 (2)

始终在第一次成功的模型通胀为 1 倍;耗尽所有 \(R\) 次重试的模型达到 \(R\) 倍。优化 \(C_{\text{direct}}\) 的路由系统隐含假设这个比率始终为 1,这个假设在困难的多跳查询上失效严重。

我们定义模型 \(m\) 的效用为预期准确率 \(U(m) \in [0,1]\)。路由目标是最大化单位真实成本的准确率。我们称之为语义汇率:

\(\mathrm{SER}(m,x) = U(m) / C_{\text{true}}(m,x), \qquad m^* = \arg\max_{m \in \mathcal{M}} \mathrm{SER}(m,x)\)。 (3)

SER 奖励准确*且*可靠的模型:一个高通胀的高精度模型得分可能低于一个重试率很低的精度稍低的模型。因为 \(C_{\text{true}}\) 在执行前不可观测,系统必须预测它,这就是下面描述的两个组件的作用。

### 3\.2思维链分支熵(CoT Branching Entropy)

我们使用模型在独立样本上推理的*一致性*作为查询难度的代理。简单查询从几乎每个链产生相同的答案;困难查询产生分歧的路径和冲突的答案。形式上,我们从本地模型采样 \(K\) 个独立推理链,从每个链中提取最终答案,并令 \(p_c\) 为答案 \(c\) 的经验频率。**思维链分支熵**(CBE)是此答案分布的香农熵\[12 (https://arxiv.org/html/2608.13571#bib.bib16)\]:

\(\mathrm{CBE}(x) = -\sum_{c} p_c \log_{2} p_c\)。 (4)

CBE 始终使用本地模型计算,无论将部署哪个层级,因此不需要 API 调用。一个让小模型困惑的查询是真正模糊或多步的,这种难度可以预测所有层级的重试概率,正如我们在第 4.3 节 (https://arxiv.org/html/2608.13571#S4.SS3) 中验证的那样。

### 3\.3通胀预测与 InflationAgent 流程

参照说明 图 2:InflationAgent 四阶段流程。**阶段 1**(橙色)从传入查询中提取结构特征:token 数、词汇多样性以及提示多跳推理的线索(例如嵌套的“谁/哪个”结构)。**阶段 2**(蓝色)从本地模型采样 \(K\) 个短推理链,并计算结果答案分布的思维链分支熵 \(\mathrm{CBE}(x) = -\sum_{c} p_c \log_{2} p_c\) 以及一致性得分 \(\max_{c} p_c\)。两个阶段都在本地硬件上运行,无 API 成本。**阶段 3**(绿色)将这些特征输入轻量级 MLP,预测 \(\widehat{\text{Inflation}}(x)\),形成估算的真实成本 \(\hat{C}_{\text{true}} = C_{\text{direct}} \cdot \widehat{\text{Inflation}}\),并选择具有最高语义汇率的模型 \(m^* = \arg\max_{m} U(m) / \hat{C}_{\text{true}}(m,x)\)。**阶段 4**(橙色)在查询 \(x\) 上执行 \(m^*\)。成功时直接返回答案(上层路径)。如果实际通胀超过预测的 2 倍,InflationAgent 使用*新的*提示升级到下一层级模型(下层路径,橙色箭头):丢弃失败的推理链,而不是转发。该设计在第 4.6 节 (https://arxiv.org/html/2608.13571#S4.SS6) 中进行了实证验证。

CBE 单独无法捕捉所有难度来源,因此 InflationAgent 在四个特征上训练了一个轻量级 MLP:CBE、一致性得分(\(\max_{c} p_c\))、平均链长度和提示 token 数。MLP 输出 \(\widehat{\text{Inflation}}(x)\),然后在阶段 3 中用于计算估算的真实成本 \(\hat{C}_{\text{true}}(m,x) = C_{\text{direct}}(m,x) \cdot \widehat{\text{Inflation}}(x)\) 并选择 SER 最高的模型。图 2 (https://arxiv.org/html/2608.13571#S3.F2) 显示了完整的四阶段流程。阶段 1 和 2 在本地硬件上运行,无 API 成本;阶段 3 是 MLP 的单次前向传播;阶段 4 应用“新鲜升级”策略,当观察到的通胀超过预测的 2 倍时,在调用更强模型之前丢弃失败的上下文。我们将计算单元分别分配给小、中、大层级,权重为 1 倍、3 倍和 52 倍,以校准反映 token 定价和典型输出长度。

## 4评估

### 4\.1实验设置

#### 模型和数据集。

我们评估了三个模型层级:Qwen2\.5\-7B\-Instruct\[11 (https://arxiv.org/html/2608.13571#bib.bib14)\](小型,本地 RTX 4090)、GPT\-4o\-mini(中型)和 GPT\-4o\[10 (https://arxiv.org/html/2608.13571#bib.bib15)\](大型),后两者通过 OpenRouter API 访问。我们使用 GSM8K\[2 (https://arxiv.org/html/2608.13571#bib.bib5)\],这是一组具有唯一数值答案的多步算术问题,以及 HotpotQA\[17 (https://arxiv.org/html/2608.13571#bib.bib6)\],它需要链接两个或更多检索和推理步骤来产生简短的事实答案。对于 HotpotQA,我们每个查询只提供三个候选段落(而不是完整的十个),故意创建一个通胀最明显的更困难的设置。CBE 采样使用温度 \(\tau=0.7\) 的 \(K=3\) 个链;首次执行尝试使用贪心解码(\(\tau=0\)),重试使用 \(\tau=0.7\) 以避免确定性重复。

#### 重试协议和基线。

所有智能体都遵循“重试直到正确”的协议,最多尝试 \(R=5\) 次。我们将 InflationAgent 与以下基线进行比较:All\-Small(始终使用本地模型);FrugalGPT\[1 (https://arxiv.org/html/2608.13571#bib.bib1)\](使用 \(C_{\text{direct}}\) 作为成本估算按查询长度进行级联);以及 Confidence Escalation(当 CBE 高时升级,但没有通胀模型或新鲜调用语义)。

### 4\.2跨模型和任务的 Token 通胀

表 1 (https://arxiv.org/html/2608.13571#S4.T1) 和图 3 (https://arxiv.org/html/2608.13571#S4.F3) 总结了所有层级-数据集组合的通胀情况。在 GSM8K 上,所有三个层级的通胀都较为适中(1.31–1.42 倍),反映出算术推理在每个测试模型层级的能力范围内。HotpotQA 则呈现出不同的情况:小模型通胀 4.25 倍,意味着平均查询消耗的 token 是单次调用估算预测的四倍。中型和大型层级表现更好(3.15 倍和 2.92 倍),但仍然有显著的通胀。在多跳查询上,小模型既昂贵(80% 的查询通胀超过 2 倍)又不准确(21.4% 的任务准确率),使其无论名义上的每 token 价格如何,都是一个糟糕的选择。

表 1:跨模型层级和数据集的平均 token 通胀和任务准确率。“高通胀”是指

相似文章

LLM 路由不是要解决的问题;token 效率才是

Reddit r/AI_Agents

本文认为,模型路由并不是真正要解决的问题——token 效率才是。文章倡导一种整体闭环方法,将更便宜的默认模型、偏好感知路由和更好的缓存(例如 Coinbase 将缓存命中率从 5% 提升到 60%)结合起来,以最大化每美元获得的有用智能。

大语言模型搜索代理的推理时预算控制

arXiv cs.AI

本文提出了一种用于大语言模型(LLM)搜索代理的两阶段推理时预算控制方法,利用信息价值(VOI)分数在多跳问答过程中优化工具调用和 Token 分配。