从一开始就注定失败:通过召回控制探针级联提前终止LLM代理任务轮次

arXiv cs.AI 论文

摘要

本文提出了一种召回控制的中止级联方法,通过在LLM代理的内部表示上使用轻量级探针,早期检测并中止注定失败的任务轮次,在保持高召回率成功轮次的同时,最多可节省47%的推理计算量。

arXiv:2607.06503v1 Announce Type: new 摘要:大型语言模型(LLM)代理在解决多步骤任务时,常常会陷入注定失败的轨迹,但在失败变得可观测之前,仍会消耗大量推理计算资源。我们证明,失败可以从代理的内部表示中早期预测:对隐藏激活的轻量级逐轮探针,早在第一轮交互时就能预判最终的任务轮次失败,而此时仅凭代理可观测行为进行评分的模型几乎与随机猜测无异。我们将这一信号转化为实用的中止级联:每轮设置一个无分布假设的校准门控,并联合搜索每轮的召回预算,使得最终成功的任务轮次以用户指定的全局概率通过所有门控;这种轮次级别的保证在部署中至关重要,因为误中止的风险会跨轮累积。在TextCraft上的两个代理模型实验中,该级联达到了从90%到97%的所有召回目标,在90%目标下,分别节省了47.1%±10.3%(Qwen-2.5-7B)和37.2%±8.8%(Llama-3.2-3B)的推理计算量,是最优单门控策略的1.6–1.7倍。与此对照,仅基于行为信号的相同级联节省量约为一半,而向探针添加行为特征并未带来额外收益:隐藏状态已捕获了行为所揭示的信息。最后,我们刻画了认证高召回目标所需的样本复杂度,帮助实践者了解其数据能够(以及明确不能)支持哪些召回承诺。代码将很快发布。
查看原文
查看缓存全文

缓存时间: 2026/07/08 04:40

# 从一开始就注定失败:通过召回控制探针级联实现LLM智能体剧集的早期中止

来源:https://arxiv.org/html/2607.06503

###### 摘要

解决多步骤任务的大型语言模型(LLM)智能体常常会陷入注定失败的轨迹,但在失败变得可观察之前,它们仍会消耗大量推理计算。我们表明,失败可以从智能体的*内部表征*中早期预测:在隐藏激活上训练的轻量级逐轮探针,最早在第一个交互轮次就能预见剧集的最终失败,而仅读取智能体可观察行为的评分器在此时的表现仅略优于随机猜测。我们将这一信号转化为实用的*中止级联*:每轮设置一个无分布假设的校准门控,并联合搜索每轮的召回预算,使得最终成功的剧集以用户指定的全局比率通过*所有*门控;这种剧集级别的保证在部署中至关重要,因为错误中止的风险会跨门控累积。在TextCraft上的两个智能体模型中,该级联实现了从90%到97%的每个召回目标,并在90%目标下,为Qwen-2.5-7B节省了47.1%±10.3%的推理计算,为Llama-3.2-3B节省了37.2%±8.8%的推理计算,是最佳单门控策略的1.6–1.7倍。一个除使用行为评分器外完全相同的级联,其节省量大约只有一半;而将行为特征添加到探针中则没有带来进一步的提升:隐藏状态已经捕获了行为所揭示的信息。最后,我们描述了*认证*高召回目标的样本复杂度,告知从业者其数据能够(并且可证明不能)支持哪些召回承诺。代码将很快发布。

## 引言

[图1: 召回控制的中止级联。在前Rg轮中,线性探针f_r读取智能体的隐藏状态h_r,如果失败分数超过校准阈值τ_r,门控则中止剧集;剧集只有在通过每个门控后才完成。阈值带有每轮的无分布召回保证,并且每轮预算t_r被联合搜索,使得剧集级别的成功召回达到用户选择的目标ρ⋆。]

LLM驱动的智能体越来越多地处理长期任务(网页导航、工具使用、具身模拟),在这些任务中,单个剧集跨越多轮交互并消耗数千个生成令牌。这些计算中的很大一部分被浪费了:当智能体误解了任务、进入了不可恢复的状态或开始循环时,剧集在正式超时或返回错误答案之前很久就已经注定失败。如果我们能够及早检测到这些注定失败的剧集并中止它们,节省下来的计算资源可以重新分配给重试、采样额外的轨迹,或者仅仅降低服务成本。

有三个障碍需要克服。首先,我们需要一个信号,能够在轨迹的*早期*区分注定失败的剧集与最终成功的剧集,而早期恰恰是行为证据最稀缺的时候。我们发现,仅读取智能体可观察行为的评分器在第一轮时表现仅略优于随机猜测,大约要到第3-4轮才会变得有信息量,而此时超过三分之一的剧集已经结束,大部分有用的剩余计算已经消耗殆尽。在智能体内部激活上训练的轻量级探针则表现出相反的模式:在第一个轮次,它们就已经达到或超过了表层评分器在之后两到三轮才达到的峰值,并且它们在第二轮就达到了自己的峰值(图3 (https://arxiv.org/html/2607.06503#Sx4.F3))。

其次,任何中止策略只有在部署时能够对其造成的损害提供可控保证时才能使用:中止本应成功的剧集会默默破坏任务奖励,因此从业者需要在*部署之前*(而不是之后观察到)限制这种错误中止的比率。第三——也是智能体剧集顺序性所特有的——在每个轮次重新评估剧集的监控器面临风险累积:即使每个单独的检查很少杀死一个好剧集,一个成功的轨迹也必须通过*所有*检查,因此每轮保证并不能组合成真正重要的剧集级别保证。

我们通过一个召回控制的*级联*(图1 (https://arxiv.org/html/2607.06503#Sx1.F1))来解决这些问题:在剧集的前Rg轮中,每个门控如果探针分数超过阈值τ_r则中止剧集。每个阈值经过校准,使得成功剧集通过门控率的精确二项式(Clopper-Pearson)下置信界达到每轮召回预算t_r,并且预算向量(t1,...,tRg)在独立的验证集上搜索,以在全局召回(最终成功剧集通过所有门控的比例)满足用户选择的目标的前提下最大化计算节省。一个安全裕度使搜索对验证噪声具有鲁棒性;一个更严格的变体用全局召回本身的认证替代裕度,产生一个无分布、可先验验证的保证。

该级联具有很强的计算正收益。在90%全局召回目标下,它为Qwen-2.5-7B智能体节省了47.1%±10.3%的推理计算,为Llama-3.2-3B智能体节省了37.2%±8.8%的推理计算,是相同目标下最佳*单门控*策略的1.6–1.7倍,这证实了将召回预算分布在多轮中而不是全部花在一个决策点上,是大部分实际价值所在。在保守的95%目标下,级联的节省量仍然大约是单门控的两倍,并且在测试的每种配置中,其实现的召回与目标匹配。将探针替换为相同级联内的纯行为评分器,对于更强的智能体,节省量大约减半;而将行为特征堆叠到探针上则没有增加任何东西,表明内部信号已经捕获了行为信号。

最后,我们诚实地说明了*认证的*召回控制在数据方面的代价。使用n个成功的验证剧集,置信度为95%的单边认证最多只能支持召回目标0.05^(1/n);在我们的规模下,这限制了可认证目标在0.974左右,并且确实,认证变体在目标为0.98和0.99时弃权,这两个目标分别需要大约1.3倍和2.6倍于我们现有的成功剧集(图7 (https://arxiv.org/html/2607.06503#Sx4.F7))。我们不认为这是该方法的弱点,而恰恰是它的意义所在:节省计算的同一机制也告诉从业者,在部署之前,可用的数据能够并可以证明不能支持哪些承诺。

我们的贡献是:

- • 我们跨两个智能体模型证明,LLM智能体的最终任务失败可以从内部激活在前几个交互轮次内预测,而纯行为评分器要到第3-4轮才变得有信息量,那时大部分可恢复的计算已经消耗殆尽。
- • 我们提出了第一个为LLM智能体控制跨多个顺序决策点的*剧集级别*成功召回的中止策略,通过每轮无分布门控,其召回预算在全局约束下联合优化,并带有可选的认证。
- • 我们展示了该级联在90%全局召回下节省高达47.1%的推理计算(是最佳单门控策略的1.6–1.7倍),并描述了认证更严格目标的数据需求。

## 方法

**算法1** 召回控制的中止级联
**输入**:标记剧集D,全局召回目标ρ⋆,预算网格T,裕度规则(裕度δ或认证水平α_m)
**输出**:门控{(f_r, τ_r)}_r=1^{R_g}

1: 通过任务分组交叉拟合探针f_r对所有剧集评分
2: 将任务划分为校准 / 验证 / 测试
3: **对于**每个候选预算t∈T **执行**
4:     **对于** r=1,...,R_g **执行**
5:          τ_r(t) ← 最小的阈值,使得在r处成功校准剧集通过率的Clopper-Pearson下界 ≥ t_r
6:     **结束**
7:     在验证集上模拟级联;记录全局召回ρ̂_val和节省
8: **结束**
9:  F ← 通过ρ⋆处裕度或认证规则的候选
10: **如果** F = ∅ **那么**
11:     弃权(不中止)
12: **否则**
13:     部署 t⋆ = argmax_{t∈F} 验证节省
14: **结束**
15: 在测试集上评估一次

### 问题设定

一个智能体剧集是LLM策略与环境之间的交互轮次序列(s1, a1, s2, a2, ...),终止于二元结果y∈{0,1}。我们从第一轮开始索引;剧集最多运行R_full=20轮。令c_r表示到第r轮为止的累积推理成本,C表示完整剧集的总成本。

一个*中止级联*在前R_g轮(r=1,...,R_g;我们使用R_g=6)的每一轮放置一个门控。在门控r处,每个仍在运行的剧集由逐轮评分器f_r评分,如果f_r(x) > τ_r则中止,损失任何潜在成功但节省剩余成本C-c_r。剧集在不同轮次终止;在我们的数据中,超过三分之一的剧集在前两轮内完成(图2 (https://arxiv.org/html/2607.06503#Sx3.F2)),因此后期轮次的门控只看到当时仍在进行的剧集:后期门控在召回方面成本低,但保护的计算量也较少。这个权衡正是级联所要优化的。

中止一个本应成功的剧集是关键的错误模式。我们目标*全局成功召回*:在y=1的剧集中,通过*每个*门控并运行完成的比率。设计目标是在满足用户指定的全局召回下限ρ⋆的前提下最大化期望成本节省。注意,单独控制每个门控的召回并不能控制全局召回:错误中止的概率跨门控累积,并且累积取决于每个门控看到多少成功剧集。

### 逐轮失败评分器

在每个门控轮次r,我们从智能体LLM的内部激活中提取特征向量x∈R^d:在第r轮智能体生成的动作的最后一个令牌处的残差流隐藏状态,通过教师强制前向传递轨迹提取,每个模型在一个固定层提取(Llama-3.2-3B的第14层,共28层;Qwen-2.5-7B的第20层,共28层)。层是通过初步的逐层探针AUC扫描为每个模型确定的:对于Qwen-2.5-7B,在层{0,2,...,28}上,使用在主实验之前收集的独立试点回滚集(生成后AUC在第20层达到峰值);对于Llama-3.2-3B,在层{6,10,14,18,22,26}上,生成后扫描选择第14层(见技术附录“逐层探针AUC扫描”)。一个逐轮探针f_r,即对标准化特征进行逻辑回归(L2正则化,C=1),用于从第r轮仍在运行的剧集中预测最终失败1-y。

我们比较另外两个评分器,保持整个下游校准和搜索流程不变。*表层*评分器仅观察智能体的*行为*:一个基于轨迹特征的逻辑模型,这些特征仅从服务API可观察:当前轮次的平均动作令牌对数概率、前几轮的平均值、生成的令牌数、前缀长度,以及环境反馈包含错误关键词(“error”、“invalid”、“fail”等)的前几轮次数。*堆叠*评分器将这些表层特征连接到探针的激活特征上,测试行为证据是否在隐藏状态之外增加了任何信息。

### 逐轮召回校准门控

每个门控的阈值在校准集上设置,使得门控可证明至少通过t_r比例的成功剧集。给定每轮召回预算t_r,令S_r = {f_r(x_i): y_i=1, i在r处存活}为第r轮仍在运行的n_r个成功校准剧集的分数。对于候选阈值τ,令k(τ)=|{s∈S_r: s≤τ}|为幸存者数量;门控真实通过率的精确二项式(Clopper-Pearson)下置信界是Beta分位数:

p̄(τ) = Beta^{-1}(α; k(τ), n_r - k(τ) + 1)    (1)

我们将τ_r设置为满足p̄(τ_r) ≥ t_r的最小校准分数,每门置信水平为1-α,α=0.05。这故意比边缘共形分位数更强:每轮保证在校准抽取上具有高置信度,代价是当n_r较小时保守(如果一个门控的n_r无法支持t_r,则弃权,即不中止任何内容)。一种共形分位数变体(τ_r = Quantile_{⌈(n_r+1)t_r⌉/n_r}(S_r))在技术附录(“共形分位数门控”)中进行了比较。预算t_r=1禁用门控。

### 全局约束下的召回预算搜索

每轮保证不能以任何有用的方式组合成乘法:一个对门控的联合界是有效的但过于保守,因为它忽略了后期门控暴露很少的成功剧集,并且每门错误中止事件远非不相交。因此我们将预算向量t=(t_1,...,t_R_g)视为超参数,并在与校准分离的验证集上经验性地选择它。

具体来说,探针分数通过任务分组交叉拟合(分层组k折)产生,因此每个剧集都由一个在训练期间从未见过其任务的探针评分。然后任务被划分为用于门控阈值的校准集(20%的任务)、预算搜索的验证集(20%)和保留测试集(60%)。全程按任务分组确保没有任务将其剧集贡献到任何划分的两边。

对于网格上每个候选t(t_r ∈ {0.85, 0.90, 0.95, 0.98, 0.99, 1.0},共6^6 = 46,656个候选),我们在校准集上校准所有门控,在验证集上模拟完整级联,记录其全局召回ρ̂_val(t)和计算节省。部署的预算在满足可行性条件的情况下最大化验证节省,我们研究两个变体:

相似文章

当代理过早承诺:诊断LLM代理的过早承诺

Hugging Face Daily Papers

本文引入表征承诺,这是一种跨运行隐藏状态收敛,用于诊断LLM代理何时过早锁定了轨迹。研究表明,承诺预测轨迹一致性而非正确性,并提出了监控方法,用于检测代理何时自信地稳定下来,而不是假设一致性等于可信度。

内存增强型LLM智能体中的状态污染

arXiv cs.AI

本文识别并研究了LLM智能体中的“记忆洗白”现象,即有毒或对抗性上下文被压缩成记忆摘要后,能够逃避标准毒性检测器,同时仍影响后续生成。文章引入了亚阈值传播间隙(SPG)来衡量隐藏的下游影响,并表明在摘要之前对有毒状态进行消毒比事后清理更有效。

@omarsar0: // LLM 智能体中的记忆诅咒 //(建议收藏)过长的历史记录显然会导致智能体性能下降,因为它们变得越来越…

X AI KOLs Following

本研究论文揭示了 LLM 智能体中的“记忆诅咒”现象,证明扩大的上下文窗口会通过削弱前瞻性意图,系统性地破坏多智能体社会困境中的合作行为。作者表明,通过定向微调、合成记忆净化以及减少显式思维链(Chain-of-Thought)推理,可有效缓解此类行为衰退。