BAGEN:LLM智能体是否具有预算意识?
摘要
本文介绍了BAGEN,一个评估LLM智能体预算意识的框架,将预算估计定义为内部预算和外部预算,并形式化了渐进式区间估计。实验表明,强智能体缺乏预算意识,过于乐观,提前停止可以节省令牌,而训练可以改善告警行为。
查看缓存全文
缓存时间: 2026/06/02 15:40
# BAGEN:LLM 智能体是否具备预算感知能力?来源:https://arxiv.org/html/2606.00198 \\reportnumber 001 \\paperurlhttps://ragen-ai.github.io/bagen
林宇翔12∗,王子涵12∗†,刘梦阳3∗,单雨轩2∗,白龙驹4∗,张俊耀2,金星3,陈博山2,苏瑾言5,王兴尧6,裴佳欣78,李曼宁1
∗核心贡献者。†项目负责人。
1西北大学 2O2实验室 3独立研究者 4密歇根大学 5康奈尔大学 6All Hands AI 7斯坦福大学 8德克萨斯大学奥斯汀分校
https://ragen-ai.github.io/bagen
###### 摘要
虽然智能体在消耗越来越多资源,但今天智能体的成本大多只在执行后才被衡量。一个预算感知智能体(BAGEN)应将预算视为主动控制信号,而非被动成本指标。我们首先系统地将预算估计定义为内部预算(来自智能体计算)和外部预算(来自智能体动作)。然后,我们将预算感知形式化为渐进区间估计:在规划的每一步,智能体应预测剩余预算的上下界,并在任务不太可能完成时发出警报。通过一种回滚-重放协议进行评分,我们在四个环境和五个前沿智能体上发现了一致的失败模式:(1) 强智能体不一定具备强预算感知能力,相关性 r≈0.35。(2) 前沿模型始终过于乐观,继续在不太可能成功的任务上消耗资源,而不是提前告知用户。(3) 预算感知信号是可操作且可训练的。早期停止在失败轨迹上节省 28-64% 的令牌,而 SFT+RL 增强了早期停止和警报行为。(4) 精确的区间校准仍然具有挑战性,SFT+RL 后区间覆盖率最高仅为 47%。
###### 摘要
基础模型智能体在部署时面临日益增长的资源约束,如令牌、金钱和时间预算,但尚不清楚它们是否知道自己将花多少预算。我们将这种能力称为“预算感知”,并将预算感知智能体(BAGEN)的能力形式化为“渐进区间估计”:在执行过程中,智能体能否提供所需剩余预算的区间以及任务是否仍可完成。我们通过一种回滚-重放协议进行评分,该协议在无约束回滚的每个前缀上重新查询同一智能体,并将估计分解为三个子能力:可行性预测、早期失败检测和区间校准。我们在四个环境上评估了五个前沿模型,涵盖内部预算(Sokoban、Search-R1、SWE-bench 上的令牌消耗)和外部预算(从真实企业数据整理的供应链环境中的成本、时间和仓库占用);我们还在 Sokoban 上使用 SFT 和 RL 训练了 Qwen-7B 预算估计器,并通过简单的早期停止策略部署其预测。在这些维度上,我们发现预算感知:(1) 与任务性能解耦,(2) 以结构化方式失败,(3) 已经是可操作和可训练的控制信号,而资源受限的智能体目前缺乏这种信号。本项目代码将开源。
## 1 引言
基础模型智能体越来越多地部署在更长周期、更高风险的任务中:一个编码智能体每个推理步骤消耗令牌,一个网络智能体每次搜索查询调用 API,一个供应链智能体每次采购决策都要花费真金白银和仓库容量。它们生成所消耗的预算(内部预算,主要是令牌)和动作所承诺的预算(外部预算,包括金钱、时间和库存)都随着部署周期的增长而迅速增长。然而,现有基准仅事后追踪这一预算,很少询问智能体本身在执行过程中是否知道自己将要花费多少。
参照图注图 1:BAGEN 中的渐进区间估计。我们记录一个无约束回滚,然后在每个前缀上重新查询同一智能体,以预测剩余预算的区间或声明“不可能”;预测结果与实际剩余预算和结果进行评分。
这引出了一个基本问题:智能体知道自己需要多少预算吗?我们将这种能力称为“预算感知”:预算感知智能体(BAGEN)在执行过程中估计剩余预算以及任务是否仍可完成的能力。一个无法估计自身资源需求的智能体无法决定何时中止希望渺茫的任务、何时请求更多资源,或如何在子目标之间分配预算。
两个空白阻碍了这种能力的系统研究。
首先,智能体研究(liu2026budgetconstrained; ding2026calibratethenact; mccleary2026quantifying)通常将令牌消耗作为事后指标计算,但几乎从不询问智能体是否能够“自我估计”需要多少预算。
其次,大多数评估协议在任务开始时收集单点预测,这与长期周期智能体任务不符——在这些任务中,可行性会逐轮变化:项目经理在每个里程碑重新估计剩余时间,给出一个范围而非单点,并在完成变得不可行时标记出来。
为了解决这些局限性,我们提出“渐进区间估计”作为一种新的智能体能力,它具备置信感知,并在整个执行过程中不断推进。我们记录一个没有任何预算约束的完整智能体回滚,然后在每一轮单独查询智能体:根据当前进度,完成还需要多少预算?给出一个带置信度的区间,或声明任务不可能。我们将这种能力分解为三个子能力(可行性预测、早期失败检测和区间校准),并让五个前沿模型在四个环境(Sokoban、Search-R1、SWE-bench 以及一个从真实企业数据整理的具有三个耦合预算维度的仓库环境)上执行此任务,涵盖内部和外部预算模式。
在这些实验中,我们发现:
- • 预算感知是一种与任务性能不同的能力,其分离点在于区间校准而非可行性预测。任务成功率与区间命中率相关性较弱(r≈0.35)。在 Search-R1 上,Opus 达到最高任务成功率(75.8%),但 Sonnet 产生更好的区间(36.5% vs. 23.1%);没有模型在所有三个子能力上占优(§4)。
- • 二元可行性是一个校准问题;区间估计是一个推理问题,所有模型都偏向乐观。仅 SFT 就将 Qwen-7B 的可行性准确率从 25.5% 提升到约 90%,表明该能力是潜在的;区间覆盖率在 SFT+RL 后仅达到 47%。所有 20 个模型-环境组合中,低估剩余预算的次数多于高估,并且较弱的模型更乐观,而非相反(§5.1、§5.2)。
- • 估计值随轮次更新,但失败被识别得太晚而无法采取行动。随着执行推进,估计值会变化——但并非可靠地趋近真相。在失败轨迹上,即使预算已消耗 60%,模型预测的可行性仍高于 70%;警报仅在最后 20% 才触发(§5.3、§5.4)。
- • 信号是可操作的,但训练很脆弱。基于“不可能”预测的早期停止策略可在失败轨迹上节省 28% 到 64% 的令牌,代价仅为成功率下降 1.6 到 4.2 个百分点。在 Sokoban 上,SFT 后接 RL 改进了估计;没有 SFT 热启动的 RL 完全崩溃(§6)。
总的来说,我们的结果表明,预算与其说是事后核算的指标,不如说是资源受限智能体目前缺乏的控制信号。
## 2 单点预算估计的两个失败
我们从最简单的预算估计形式开始:在任务开始时,要求智能体给出它将花费的总令牌数的单点估计,并根据实际运行预算进行评分。作为初步探索,我们让五个前沿模型在两个内部预算环境 Sokoban 和 Search-R1 上进行这种估计,收集第一轮估计(任务开始时)和后几轮估计(重放记录的前缀后);完整设置见附录 B.3。所有模型都出现了两个失败,这促成了 §3 的协议。
第一个失败是系统性的乐观。在两个任务上,所有五个模型的第一轮预测低估实际预算的次数都多于高估(图 5);这种偏差与模型置信度相关,而非任务难度,较弱模型在任务上更乐观,而非更不乐观。
第二个失败是第一轮估计与后几轮估计不一致。在 Sokoban 上,Gemini 的可行性宏 F1 从第一轮评估到所有轮评估提高了 +21.9 点;在 Search-R1 上,Qwen3-235B 则反向移动了 9.3 点(图 6)。因此,第一轮判断既不是对所有轮判断的一致高估也不是低估;它只是不同的判断,其方向取决于模型和任务。
这些失败共同反对单点估计。单点估计无法表达模型表现出的乐观,而区间可以;明确的“不可能”选项让模型声明不可行性,而不是默默低估。在 k=0 时的一次查询错过了观察部分进展后产生的修正,但每轮触发的查询则能捕获这一点。§3 将这两个变化形式化为“渐进区间估计”。
## 3 智能体预算感知
前一节揭示了单点预算估计的两个结构性失败:系统乐观以及第一轮与后续轮估计之间的不稳定性。我们现在形式化预算感知智能体(BAGEN)的能力,以解决这两个问题。我们首先介绍两种预算模式,然后描述带有回滚-重放过程的渐进区间估计协议,最后将估计质量分解为三个子能力并给出具体指标。本节以实验设置结束。
### 3.1 预算模式:内部与外部
考虑一个智能体执行多轮轨迹 τ={(o_t,z_t,a_t)}_t=1^T,其中 o_t 是第 t 轮收到的观察(例如环境状态或工具输出),z_t 是智能体的推理轨迹,a_t 是动作。在每一轮,智能体以两种根本不同的方式承诺预算。
**内部预算**。内部预算是模型自身推理生成的计算量。设 c_t^{in} 表示第 t 轮的新鲜令牌数。到第 k 轮的累计内部成本为 C_k^{in}=∑_{t=1}^k c_t^{in},从第 k+1 轮往后的剩余内部成本为 R_k^{in}=C_T^{in}−C_k^{in}。智能体在总上限 B^{in} 下运行,要求 C_T^{in}≤B^{in}。超过此上限的轨迹将被截断并计为失败。内部预算估计测试模型是否能够预测自己的计算足迹:剩余的推理、规划和行动步骤将花费多少令牌?
**外部预算**。外部预算是智能体在环境中承诺的成本。通常是多维的:设 c_t^{ex}∈R^D 是第 t 轮的 D 维成本向量,累计使用量和剩余成本为 C_k^{ex}=∑_{t=1}^k c_t^{ex},R_k^{ex}=C_T^{ex}−C_k^{ex},受限于每个维度的约束 C_T^{ex,(d)}≤B^{(d)},d=1,…,D。外部预算迫使智能体推理耦合的资源约束:持有更多库存会提高收入但占用仓库容量,而借贷可以改善短期现金流但会带来后续还款压力。
### 3.2 渐进区间估计与回滚-重放
**渐进区间估计**。在每一轮 k,给定轨迹前缀 τ_{≤k}={(o_t,z_t,a_t)}_t=1^k 和累计使用量 C_k,估计器返回:
ŷ_k = [R̂_k^{lo}, R̂_k^{hi}] 如果智能体预测任务仍可行,
impossible 如果智能体预测任务已无法完成。
(1)
该输出同时捕获三个属性:不确定性(区间宽度)、渐进性(每轮更新估计)和不可行性感知(明确的 impossible 选项,支持早期停止或重新路由)。前两个解决了单点估计的两个失败;第三个使得信号在下游可操作。
**回滚-重放协议**。为了将预算估计能力与任务完成能力分离,我们使用两阶段过程(图 1)。
(1) 回滚生成:智能体在没有任何预算约束的情况下执行任务。我们记录完整轨迹 τ 以及每轮成本 c_t 和最终结果。
(2) 前缀重放与估计:对于每个非终止轮 k∈{1,…,T−1},我们重放已记录的前缀 τ_{≤k} 作为历史,附加累计使用量摘要,并要求智能体通过公式 (1) 估计 ŷ_k。每个预测根据真实剩余成本 R_k=C_T−C_k 和真实结果进行评分。
一个自然的替代方案是让智能体在自身回滚过程中估计预算,将估计与执行交织。我们避免这样做,因为估计本身会消耗令牌,这会将任务完成成本与自我评估成本混淆。在线估计留给未来的工作。
### 3.3 子能力指标
参照图注图 2:左和中间:对于内部预算和外部预算,估计质量仅与任务性能弱相关。右:在失败的 Sokoban 轨迹上,随着观察到更多任务进展,估计准确率提高,最大的增益出现在轨迹后期。
一个预算感知智能体(BAGEN)必须做三件事:判断任务能否在预算内成功、足够早地识别失败以采取行动、以及在成功可能时提供校准的成本范围。我们将每项作为独立的子能力评分。
**(1) 可行性预测**:智能体能否判断任务是否能在剩余预算内成功?这是最粗略的二元预算感知级别。设 y_k∈{feasible, impossible} 是第 k 轮的真实标签(智能体是否在预算内成功),ŷ_k∈{[·,·], impossible} 是预测。相似文章
EcoAgent-Bench:评估预算受限的LLM代理中的经济决策
本文介绍了EcoAgent-Bench,一个包含304个任务的基准测试,用于评估LLM代理在明确预算和定价操作下的经济决策,测试五个任务族中的四种与成本相关的决策。
大语言模型搜索代理的推理时预算控制
本文提出了一种用于大语言模型(LLM)搜索代理的两阶段推理时预算控制方法,利用信息价值(VOI)分数在多跳问答过程中优化工具调用和 Token 分配。
Cost-Aware Multi-Objective Bandits: Theory and Application to Budgeted LLM Configuration Evaluation
This paper formalizes LLM configuration evaluation as a cost-aware multi-objective bandit problem, proposing a hypervolume-based UCB algorithm for online configuration selection and a cost-aware gap elimination algorithm for Pareto identification, both with theoretical guarantees and empirical validation.
推理的影子价格:LLM最优预算分配的经济学视角
本文将LLM推理预算分配形式化为一个约束优化问题,提出CLEAR方法,将资源从低效用查询重新分配到接近涌现阈值的查询,在预算紧张的情况下实现了高达3倍的准确率提升。
BudgetBench:用于本地大型语言模型代理内存策略评估的预算分层协议与试点工具
本文提出BudgetBench,一个通过调整每次调用的输入令牌预算来评估本地大型语言模型代理内存策略的协议与工具,为社区基准测试提供可重用的测量平台。