大语言模型搜索代理的推理时预算控制

arXiv cs.AI 论文

摘要

本文提出了一种用于大语言模型(LLM)搜索代理的两阶段推理时预算控制方法,利用信息价值(VOI)分数在多跳问答过程中优化工具调用和 Token 分配。

arXiv:2605.05701v1 公告类型:新论文 摘要:大语言模型(LLM)搜索代理在推理时越来越依赖工具,但其执行轨迹通常受限于对工具调用和生成 Token 数量的硬性限制。在这种双重预算约束下,要获得更高质量的答案,不仅需要更强的模型,还需要明确控制在搜索过程中应将下一个预算单位分配给哪个搜索动作,以及何时累积的证据已足以提交最终答案。我们在多跳问答(QA)任务中研究了这一问题,并将其表述为两阶段推理时预算控制。在搜索阶段,我们的控制器为每个可行动作分配一个任务级信息价值(Value-of-Information, VOI)分数,该分数定义为在当前搜索状态和剩余双重预算下,每单位预算带来的边际任务价值的操作性估计,并基于此分数在检索、问题分解和答案提交之间进行选择。搜索结束后,选择性证据接地终结器(selective evidence-grounded finalizer)将轨迹中的答案与优化后的候选答案进行比较,仅当残差错误看似属于低风险的答案表述错误时才进行重写。在四个多跳问答基准、三种大语言模型骨干网络以及四种预算水平下,该方法在相同的硬性双重预算协议下,相较于四个经审计的基线模型取得了正向的聚合性能提升。消融实验表明,搜索时预算控制(尤其是依赖于预算的惩罚机制)提供了主要的性能增益,而答案时控制主要在检索路径已经充足的情况下发挥作用。这些结果表明,针对大语言模型搜索代理的推理时预算控制应同时管理搜索过程中的预算分配方式以及最终答案的提交机制。
查看原文
查看缓存全文

缓存时间: 2026/05/08 08:35

# LLM 搜索代理的推理时预算控制
来源:https://arxiv.org/html/2605.05701

###### 摘要
LLM 搜索代理在推理时越来越依赖工具,但其轨迹往往受到工具调用和生成 token 数量硬性限制的双重约束。在这种双重预算下,获得更好的答案不仅需要更强的模型,还需要明确控制下一个预算单位应分配给哪种搜索动作,以及何时积累的证据足以提交最终答案。我们在多跳问答(QA)中研究了这一问题,并将其表述为两阶段推理时预算控制。在搜索阶段,我们的控制器为每个可行动作分配一个任务级信息价值(VOI)评分,该评分定义为在当前搜索状态和剩余双重预算下,每单位预算边际任务价值的操作性估计,并利用该评分在检索、分解和答案提交之间进行选择。搜索结束后,一个选择性证据锚定的最终确定模块(finalizer)将轨迹答案与优化后的候选答案进行比较,仅在残差错误似乎是低风险的答案形式错误时才进行重写。在四个多跳 QA 基准、三个 LLM 主干模型和四种预算水平下,该方法在相同的硬性双重预算协议下,相对于四个经过审计的基线取得了积极的总体增益。消融实验表明,搜索时的预算控制(尤其是预算依赖惩罚)提供了主要的性能增益,而答案时的控制主要在检索路径已经充分时起作用。这些结果表明,LLM 搜索代理的推理时预算控制应同时管理搜索期间的预算消耗方式以及最终答案的提交方式。

## 1 引言

大型语言模型(LLMs)越来越多地被部署为在推理期间使用外部工具的搜索代理。ReAct [69](https://arxiv.org/html/2605.05701#bib.bib69)、Toolformer [43](https://arxiv.org/html/2605.05701#bib.bib43)、BATS [28](https://arxiv.org/html/2605.05701#bib.bib28) 和 Search-o1 [21](https://arxiv.org/html/2605.05701#bib.bib21) 将检索视为推理轨迹的一部分,而不是固定的预处理步骤。更广泛的代理系统增加了反思、树搜索、协作和软件工具 [46](https://arxiv.org/html/2605.05701#bib.bib46), [68](https://arxiv.org/html/2605.05701#bib.bib68), [7](https://arxiv.org/html/2605.05701#bib.bib7), [53](https://arxiv.org/html/2605.05701#bib.bib53), [78](https://arxiv.org/html/2605.05701#bib.bib78), [77](https://arxiv.org/html/2605.05701#bib.bib77), [30](https://arxiv.org/html/2605.05701#bib.bib30)。在这种范式下,答案质量不仅取决于模型能力,还取决于代理在推理仍在进行时如何消耗工具调用和 token 预算。这种范式也将测试时缩放(test-time scaling)从单纯的 token 问题转变为推理时控制问题。

先前工作研究了额外的推理计算如何通过重复采样、自我细化和自适应分配来改善输出 [56](https://arxiv.org/html/2605.05701#bib.bib56), [32](https://arxiv.org/html/2605.05701#bib.bib32), [47](https://arxiv.org/html/2605.05701#bib.bib47), [12](https://arxiv.org/html/2605.05701#bib.bib12), [25](https://arxiv.org/html/2605.05701#bib.bib25)。然而,对于搜索代理而言,计算不仅仅关乎 token:额外的预算可能会产生更多的分支、中间状态和低收益动作。诸如 Search-R1 [17](https://arxiv.org/html/2605.05701#bib.bib17)、BATS [28](https://arxiv.org/html/2605.05701#bib.bib28) 和近期的浏览代理 [80](https://arxiv.org/html/2605.05701#bib.bib80), [57](https://arxiv.org/html/2605.05701#bib.bib57), [45](https://arxiv.org/html/2605.05701#bib.bib45), [15](https://arxiv.org/html/2605.05701#bib.bib15) 等系统已经处于这种重度工具使用的模式中。部署研究也表明,不受约束的工具使用会导致预算低效的失败,包括冗余检索、浪费的分支和脆弱的上下文增长 [6](https://arxiv.org/html/2605.05701#bib.bib6), [72](https://arxiv.org/html/2605.05701#bib.bib72), [19](https://arxiv.org/html/2605.05701#bib.bib19), [31](https://arxiv.org/html/2605.05701#bib.bib31)。

在明确的预算下,更多的推理计算和更好的答案不再等价。这提出了核心的推理时控制问题:*在明确工具调用和输出 token 预算的情况下,如何决定下一步做什么,以及在搜索停止后如何提交最终答案。* 现有的预算感知方法要么通过跨模型路由来降低成本 [6](https://arxiv.org/html/2605.05701#bib.bib6), [72](https://arxiv.org/html/2605.05701#bib.bib72),要么在代理循环中注入预算跟踪 [28](https://arxiv.org/html/2605.05701#bib.bib28), [74](https://arxiv.org/html/2605.05701#bib.bib74),但没有一种方法在相同的硬性双重预算审计下明确控制搜索期间的动作分配和搜索后的答案解决,这也正是本工作的动机所在。

三个难点使得这一控制问题变得非平凡:

**挑战 1:预算必须在异构动作间分配。** 在每一步,搜索代理可以检索证据、分解问题或直接回答。这些动作的成本和回报不同,正确的选择取决于证据状态和剩余预算。基础设施分析显示,简单的缩放会导致过度搜索和收益递减 [19](https://arxiv.org/html/2605.05701#bib.bib19), [3](https://arxiv.org/html/2605.05701#bib.bib3),而在耦合的工具调用和输出 token 预算下,token 级预算无法解决这种动作级的权衡 [12](https://arxiv.org/html/2605.05701#bib.bib12), [25](https://arxiv.org/html/2605.05701#bib.bib25)。

**挑战 2:成功搜索后最终答案错误仍然存在。** 即使拥有正确的证据,最终答案仍可能在精确性上失败:是/否极性、二元选择、类型化槽位或别名补全。自我细化 [32](https://arxiv.org/html/2605.05701#bib.bib32)、逐步验证 [5](https://arxiv.org/html/2605.05701#bib.bib5), [48](https://arxiv.org/html/2605.05701#bib.bib48) 和推理感知选择 [52](https://arxiv.org/html/2605.05701#bib.bib52) 可以提供帮助,但它们针对的是开放式生成,而不是每次额外调用都有成本的预算搜索。

**挑战 3:重写引入了干预风险。** 无条件答案重写可能会在多跳设置中擦除桥接结构或逆转比较语义 [51](https://arxiv.org/html/2605.05701#bib.bib51), [50](https://arxiv.org/html/2605.05701#bib.bib50)。Reflexion 风格的反馈循环 [46](https://arxiv.org/html/2605.05701#bib.bib46) 可以缓解某些错误,但没有明确建模损坏正确答案的风险。因此,答案控制器仅在预期收益大于风险时才进行干预。

为了解决这些挑战,我们提出了一种无训练的、基于受 BAVT [23](https://arxiv.org/html/2605.05701#bib.bib23) 启发的树搜索主干的两阶段推理时控制器。在搜索阶段,控制器根据任务级 VOI 对每个可行动作进行评分:这是在当前轨迹状态和剩余双重预算下每单位预算边际任务价值的操作性估计,而非香农信息增益或贝叶斯后验价值。该评分结合批评家衍生的价值变化、结构信号、成本归一化、预算惩罚和保守保护,以在检索、分解和答案提交之间进行选择。搜索结束后,一个基于证据的最终确定模块仅在预期精确性增益大于损坏原本足够好的轨迹答案的风险时才进行重写。因此,该方法控制两个不同的决策点:搜索期间的预算消耗方式,以及搜索后最终答案的提交方式。

我们在四个多跳 QA 基准、三个 LLM 主干和四级预算阶梯下,在共享的硬性双重预算审计下评估 VOI。结果支持显式的两阶段控制,同时也暴露了其在数据集、预算和主干上的边界条件。我们的主要贡献如下:

- ❶ **两阶段推理时预算控制公式化。** 我们将 LLM 搜索代理中的预算感知推理表述为两阶段推理时控制问题:在耦合的工具调用和输出 token 预算下进行搜索时动作分配,随后在存在干预风险的情况下进行答案时最终确定。
- ❷ **用于搜索动作的任务级 VOI 控制。** 我们引入了一种无训练的分值器,根据估计的每单位预算边际任务价值对检索、分解和答案提交进行排名。该分值器结合了批评家衍生的进展、结构信号、成本归一化、预算依赖惩罚和保守保护。
- ❸ **风险控制的答案最终确定。** 我们引入了一种基于证据的最终确定模块,仅针对低风险的答案形式错误进行重写,例如是/否极性、二元选择、类型化槽位不匹配或支持的事实补全,并在桥接或比较推理尚未解决时放弃干预。
- ❹ **硬性双重预算审计下的实证分析。** 我们在相同的硬性双重预算协议下,跨越四个基准、三个主干和四种预算水平进行评估。结果显示了积极的总体增益以及许多低中和中预算改进,同时消融实验确定了预算依赖惩罚作为主导组件,并揭示了增益减小的主干和数据集依赖边界条件。

## 2 相关工作

**搜索代理和工具增强推理。** 工具使用将 LLM 从静态文本生成转变为交互式决策。ReAct [69](https://arxiv.org/html/2605.05701#bib.bib69) 交错推理和行动,Toolformer [43](https://arxiv.org/html/2605.05701#bib.bib43) 研究自监督工具使用,后续系统增加了反思、树搜索、协作、环境接地和软件工具 [46](https://arxiv.org/html/2605.05701#bib.bib46), [68](https://arxiv.org/html/2605.05701#bib.bib68), [7](https://arxiv.org/html/2605.05701#bib.bib7), [29](https://arxiv.org/html/2605.05701#bib.bib29), [53](https://arxiv.org/html/2605.05701#bib.bib53), [78](https://arxiv.org/html/2605.05701#bib.bib78), [77](https://arxiv.org/html/2605.05701#bib.bib77), [39](https://arxiv.org/html/2605.05701#bib.bib39), [63](https://arxiv.org/html/2605.05701#bib.bib63), [66](https://arxiv.org/html/2605.05701#bib.bib66), [30](https://arxiv.org/html/2605.05701#bib.bib30)。代理评估也扩展到现实世界和主动协助设置 [49](https://arxiv.org/html/2605.05701#bib.bib49)。面向搜索的代理,如 Search-R1 [17](https://arxiv.org/html/2605.05701#bib.bib17)、BATS [28](https://arxiv.org/html/2605.05701#bib.bib28)、Search-o1 [21](https://arxiv.org/html/2605.05701#bib.bib21)、BrowseComp [57](https://arxiv.org/html/2605.05701#bib.bib57) 和近期的浏览系统 [62](https://arxiv.org/html/2605.05701#bib.bib62), [45](https://arxiv.org/html/2605.05701#bib.bib45), [79](https://arxiv.org/html/2605.05701#bib.bib79), [20](https://arxiv.org/html/2605.05701#bib.bib20), [11](https://arxiv.org/html/2605.05701#bib.bib11), [54](https://arxiv.org/html/2605.05701#bib.bib54), [10](https://arxiv.org/html/2605.05701#bib.bib10), [59](https://arxiv.org/html/2605.05701#bib.bib59), [36](https://arxiv.org/html/2605.05701#bib.bib36) 推动了开放式信息寻求。我们则研究在明确工具调用和输出 token 预算下的 QA 代理。

**图 1:问题示意图。** 代理从观察到的轨迹、证据和剩余预算中选择下一个搜索动作;未来证据和确切下一步成本是未知的。

**测试时缩放和预算感知代理缩放。** 测试时缩放工作通过重复采样、自我细化、早停、元生成、自适应计算、高效任务适应和 token 预算推理,将额外的推理计算转化为更好的输出 [56](https://arxiv.org/html/2605.05701#bib.bib56), [32](https://arxiv.org/html/2605.05701#bib.bib32), [22](https://arxiv.org/html/2605.05701#bib.bib22), [58](https://arxiv.org/html/2605.05701#bib.bib58), [47](https://arxiv.org/html/2605.05701#bib.bib47), [52](https://arxiv.org/html/2605.05701#bib.bib52), [12](https://arxiv.org/html/2605.05701#bib.bib12), [25](https://arxiv.org/html/2605.05701#bib.bib25), [14](https://arxiv.org/html/2605.05701#bib.bib14), [34](https://arxiv.org/html/2605.05701#bib.bib34), [2](https://arxiv.org/html/2605.05701#bib.bib2), [5](https://arxiv.org/html/2605.05701#bib.bib5), [33](https://arxiv.org/html/2605.05701#bib.bib33), [4](https://arxiv.org/html/2605.05701#bib.bib4), [38](https://arxiv.org/html/2605.05701#bib.bib38), [73](https://arxiv.org/html/2605.05701#bib.bib73)。预算感知推理增加了一个更难的问题:不仅仅是花费多少额外计算,而是花费在哪里。FrugalGPT [6](https://arxiv.org/html/2605.05701#bib.bib6) 和 EcoAssistant [72](https://arxiv.org/html/2605.05701#bib.bib72) 跨模型路由,而代理缩放工作 [80](https://arxiv.org/html/2605.05701#bib.bib80), [28](https://arxiv.org/html/2605.05701#bib.bib28), [19](https://arxiv.org/html/2605.05701#bib.bib19), [31](https://arxiv.org/html/2605.05701#bib.bib31) 认为工具使用改变了缩放问题本身。相关的边缘和移动智能研究进一步强调,LLM 和 AI 部署受到通信、缓存、模型下载、持续适应以及分割或联邦执行成本的约束 [40](https://arxiv.org/html/2605.05701#bib.bib40), [41](https://arxiv.org/html/2605.05701#bib.bib41), [61](https://arxiv.org/html/2605.05701#bib.bib61), [60](https://arxiv.org/html/2605.05701#bib.bib60), [8](https://arxiv.org/html/2605.05701#bib.bib8)。我们遵循这种资源感知框架,但粒度更细:搜索期间的步骤级动作控制和最终确定时的选择性干预。

**工作流搜索和基于树的控制。** DSPy [18](https://arxiv.org/html/2605.05701#bib.bib18)、PromptAgent [55](https://arxiv.org/html/2605.05701#bib.bib55)、Promptbreeder [9](https://arxiv.org/html/2605.05701#bib.bib9)、ADAS [16](https://arxiv.org/html/2605.05701#bib.bib16)、AgentSquare [44](https://arxiv.org/html/2605.05701#bib.bib44)、AFlow [71](https://arxiv.org/html/2605.05701#bib.bib71)、AutoFlow [24](https://arxiv.org/html/2605.05701#bib.bib24)、EvoFlow [70](https://arxiv.org/html/2605.05701#bib.bib70)、MermaidFlow [75](https://arxiv.org/html/2605.05701#bib.bib75) 和 HyEvo [64](https://arxiv.org/html/2605.05701#bib.bib64) 在部署前优化提示、模块图或工作流。相关的基于 LLM 的自动算法设计工作也使用语言模型在推理前演化启发式或启发式集 [26](https://arxiv.org/html/2605.05701#bib.bib26), [27](https://arxiv.org/html/2605.05701#bib.bib27)。另一条路线将推理视为对状态、思维或计划的结构化搜索,例如 Tree of Thoughts [68](https://arxiv.org/html/2605.05701#bib.bib68)、Graph of Thoughts [1](https://arxiv.org/html/2605.05701#bib.bib1)、Language Agent Tree Search [77](https://arxiv.org/html/2605.05701#bib.bib77)、BAVT [23](https://arxiv.org/html/2605.05701#bib.bib23) 和 CATS [74](https://arxiv.org/html/2605.05701#bib.bib74)。我们的方法属于第二种家族:给定现有的搜索主干,它控制哪个动作花费下一个预算单位以及如何解决最终答案。

**答案验证和选择性干预。** Self-Refine [32](https://arxiv.org/html/2605.05701#bib.bib32) 表明事后编辑可以改善输出,而逐步调试 [76](https://arxiv.org/html/2605.05701#bib.bib76)、VerifAI [48](https://arxiv.org/html/2605.05701#bib.bib48)、Reasoning-Aware Self-Consistency [52](https://arxiv.org/html/2605.05701#bib.bib52) 和 SETS [5](https://arxiv.org/html/2605.05701#bib.bib5)...

相似文章

BAGEN:LLM智能体是否具有预算意识?

arXiv cs.LG

本文介绍了BAGEN,一个评估LLM智能体预算意识的框架,将预算估计定义为内部预算和外部预算,并形式化了渐进式区间估计。实验表明,强智能体缺乏预算意识,过于乐观,提前停止可以节省令牌,而训练可以改善告警行为。

Agora:通过基于拍卖的任务分配增强LLM智能体推理

arXiv cs.AI

Agora引入了一种基于拍卖的任务分配机制,用于LLM智能体,将推理步骤视为可交易物品,并使用校准后的置信度将任务路由到最有能力的专家模型,从而在多个基准测试中提升推理性能。

面向LLM代理中功能等价工具的延迟-质量路由

arXiv cs.LG

本文介绍了 LQM-ContextRoute,一种上下文赌博机路由器,用于在 LLM 代理中选择功能等效的工具提供商,平衡延迟和答案质量。它在网络搜索和检索器基准测试上优于基线。