Critic Experience Bank: 自演进的步骤级置信度估计用于LLM Agents

arXiv cs.AI 论文

摘要

介绍Critic Experience Bank (CEB),一个用于LLM智能体逐步置信度估计的自我演进批评框架,利用过去判断和后果的记忆库来改进校准,无需训练。

arXiv:2607.12397v1 公告类型:新 摘要:LLM 代理在外部环境中运行,每个动作都会改变状态,后续决策依赖于该状态;此外,一个错误的步骤可能浪费交互预算,或在最终失败被观察到之前很久就引发不可逆的副作用。因此,可靠部署需要\emph{步骤级置信度估计}:在动作执行\emph{之前},对每个提议动作是否富有成效给出经过校准的概率。现有的 LLM 置信度估计器旨在对给定提示的响应进行评分,但代理的置信度还取决于执行后果:在环境响应后,类似情境下的类似动作是否真正推进了任务。我们提出 \method(\methodshort),一种自我进化的批评家框架,其中 LLM 批评家从其过去的判断及其观察到的后果中积累证据。每条轨迹完成后,一个能看到完整执行反馈的事后 LLM 对每一步是否富有成效进行投票。由此产生的伪标签填充到一个记忆库中,当类似步骤再次出现时,相关的富有成效和无效经验从该记忆库中被检索到批评家的提示中。\methodshort 无需训练,也不使用任何真实步骤标签。在三个代理基准和三个批评家骨干模型上,\methodshort 在每个数据集-批评家组合上都达到了最佳校准(ECE 和 Brier)和排名(AUC),相对于最强的免训练基线,ECE 降低了高达 $54\%$。
查看原文
查看缓存全文

缓存时间: 2026/07/15 04:19

# 批评者经验库:面向LLM智能体的自演进步骤级置信度估计

来源:https://arxiv.org/html/2607.12397

Yaopei Zeng¹, Congchao Wang², JianHang Chen³, Nan Wang⁴¹¹¹, Yurui Chang¹, Lu Lin¹  
¹宾夕法尼亚州立大学,²弗吉尼亚理工大学,³普渡大学,⁴Amazon AGI  

**摘要**

LLM智能体在外部环境中执行动作,每个动作都会改变后续决策所依赖的状态,且一个错误的步骤可能在最终失败被观察到之前就浪费交互预算或引发不可逆的副作用。因此,可靠的部署需要**步骤级置信度估计**:一个校准过的概率,衡量每个提议的动作是否富有成效,且该概率必须在动作**执行之前**可用。现有的LLM置信度估计方法旨在对给定提示的响应进行评分,但智能体置信度还取决于执行后果:在类似状态下执行类似动作后,环境响应是否真正推进了任务。我们提出**批评者经验库(CEB)**,一种自我演进的批评框架,其中LLM批评者从其自身的过往判断及其观察到的后果中积累证据。每条轨迹完成后,一个能看到完整执行反馈的事后LLM会对每个步骤是否富有成效进行投票。由此产生的伪标签被存入记忆库,当类似步骤再次出现时,相关富有成效和无效经验会被检索到批评者的提示中。CEB无需训练,也不使用任何真实步骤标签。在三个智能体基准和三个批评者主干上,CEB在每个数据集-批评者组合中都达到了最佳校准(ECE和Brier)和排序(AUC)性能,相比最强的无训练基线,ECE降低了高达54%。

*脚注:本研究与作者在Amazon的职位无关。通讯作者:Lu Lin ([email protected])*

## 1 引言

LLM智能体越来越多地通过在外部环境中执行动作来解决问题,而不是生成单次文本响应(Denget al., 2023; Yanget al., 2023)。这改变了置信度估计必须提供的内容。在网页、移动设备或Shell环境中,一个中间动作可能改变所有后续决策所依赖的状态。一次错误点击会将浏览器带到不相关的页面,一次错误触摸会进入死胡同屏幕,一条无用的Shell命令会改变之后每条命令的工作上下文。有些动作代价高昂或难以撤销,例如提交表单、删除文件或修改数据库。因此,最终任务成功是一个不足够可靠性的信号:它报告的是轨迹是否成功,而不是**下一个提议的动作**是否应该执行、交给人类处理或重新规划。部署需要的是**步骤级置信度估计**——一个校准过的概率,衡量每个提议的动作是否富有成效,且该概率必须在执行动作改变环境之前产生。

现有的LLM置信度估计方法,如Token对数几率、一致性和口头置信度(Kadavathet al., 2022; Tianet al., 2023; Xionget al., 2024),可以适应这一设置,但它们继承了响应级框架:评分是针对给定上下文下的单个提议步骤进行的,而智能体部署询问的是执行该步骤是否会富有成效地改变状态。Yuet al. (2025)表明,思维链(CoT)提示改进了具身智能体的口头置信度,但其判断仍然依赖于当前查询提供的上下文,而不是对类似决策在执行后表现如何的持久记录。经过训练的过程奖励模型和步骤级验证器(Lightmanet al., 2024; Chaeet al., 2025; Parket al., 2025)提供了更强的监督,但需要标记的过程数据和可训练的模型,而当智能体使用固定API模型部署且没有步骤注释时,这两者都不具备。

结构性差距在于,智能体置信度针对的是执行事件,而不仅仅是生成的响应。一个提议的动作在给定上下文下看起来局部可行,但它的有用性由执行后达到的状态决定:它可能推进任务,可能使智能体陷入循环,也可能使后续进展更难。因此,步骤级置信度必须在该环境转变被观察到之前估计动作的富有成效性。即使在简单的诊断中也能看到这一困难。图1评估了几种现成的置信度信号在Mind2Web上按轨迹内位置分组的步骤上的表现。这些信号在交互展开时并未持续校准,表明响应式置信度无法干净地迁移到步骤级智能体置信度。相比之下,CEB保持了显著更好的估计,这表明检索到的执行经验提供了超越当前轨迹上下文的有用信号。

![图1](https://arxiv.org/html/2607.12397v1/extracted/6083950/figures/calibration_all.pdf)
**图1:** 在Mind2Web上使用GPT-5.4,步骤级置信度随轨迹内深度的校准情况。现成的置信度信号在直接应用于智能体步骤时不稳定,而CEB通过使用检索到的执行经验保持了更好的校准。

CEB从一个简单的出发点开始:在任务流中,智能体经常在相关上下文中面临重复决策。一个固定的批评者不必仅从当前查询中判断每次重复。一旦轨迹完成,其执行反馈可以转换为紧凑的记录,记录批评者在执行前相信什么以及步骤之后是否富有成效。我们将这一想法具体化为批评者经验库(CEB),一个自我演进的批评者框架,当类似未来步骤被评分时,它检索这些记录作为先例。图2总结了由此产生的在线评分和事后更新流程。每条轨迹完成后,一个看到完整动作-观察序列的事后LLM多次投票决定每个步骤是否富有成效。多数票成为伪标签,与状态、动作、观察到的后果以及批评者在执行前的原始评分一起存入库中。在每个新步骤中,批评者会看到最相似的过去示例,这些示例通过基于任务、状态和动作的组合键检索。CEB占据了一个现有工具服务不佳的部署领域。具体来说,CEB在推理阶段处理校准问题,此时智能体在执行每个动作之前需要可靠的置信度,但没有真实步骤标签或可训练的验证器。它是**步骤级**的:它在执行前对每个提议的动作进行评分。其证据完全来自执行反馈,LLM批评者的权重是冻结的,而批评者的有效行为随着任务流中不断扩展的、由事后标记经验构成的库而改变。在涵盖网页、移动GUI和Shell模态的三个智能体基准以及三个批评者主干上,CEB在所有九个数据集-批评者组合中取得了最佳的ECE、Brier分数和AUC。

### 贡献

- 我们为LLM智能体形式化了**步骤级置信度估计**:在执行前,根据当前任务信息、状态和交互历史,估计一个提议的动作是否会对任务富有成效。
- 我们提出CEB,一个无需训练的批评者框架,它用来自先前轨迹的事后标记执行经验增强固定的LLM批评者,并在未来步骤被评分时检索相关的富有成效和无效记录作为先例。
- 在三个智能体基准和三个批评者主干上,CEB在所有数据集-批评者组合中取得了最佳的ECE、Brier分数和AUC,相比最强的无训练基线,ECE降低了高达54%,支持选择性执行,并且在宽松的LLM作为评判者的步骤标签下仍然最强。

## 2 相关工作

**置信度估计与校准。** 无需训练的LLM置信度估计通常使用Token不确定性、口头置信度、单Token探测或多个样本的概率聚合(Guoet al., 2017; Kadavathet al., 2022; Tianet al., 2023; Xionget al., 2024; Nguyenet al., 2025)。Yuet al. (2025) 通过CoT提示将口头置信度适应于具身智能体。这些方法与闭源API兼容,因此我们将相应的类别作为基线进行评估。然而,它们仅为当前查询估计置信度,不积累先前轨迹的执行后果,而智能体动作的可靠性取决于类似决策在环境响应后的表现。其他校准方法如MICE、CCPS和DACA提供互补信号,但需要访问隐藏状态或成对的基础和微调检查点(Subramaniet al., 2025; Khanmohammadiet al., 2025; Luoet al., 2025),这些在固定API环境中不可用。CEB保持批评者固定,而是使用先前轨迹的执行反馈作为推理期间的校准证据。

**步骤级监督与智能体验证。** 过程奖励模型和步骤级验证器在标注的过程数据上训练(Lightmanet al., 2024; Chaeet al., 2025; Parket al., 2025; Wanget al., 2025b)。近期工作研究了用于计算机使用智能体的验证器构建和统计控制决策规则(Rossetet al., 2026; Zhanget al., 2026; Sadhukaet al., 2025)。这些方法在存在标记过程数据、可训练验证器或校准验证集时是有效的。我们则专注于推理阶段,其中动作执行者和批评者是固定模型,部署时没有真实步骤标签,且必须在执行动作之前生成分数。Maviet al. (2025) 最接近,他们使用LLM评判者分数进行步骤级置信度,但其评判者没有构建批评者自身交互历史的持久记录。

**LLM智能体中的经验与记忆。** Reflexion(Shinnet al., 2023)、ExpeL(Zhaoet al., 2024)和ReasoningBank(Ouyanget al., 2026)积累智能体经验以改善未来的动作选择或推理,进一步的工作研究了记忆设计如何影响智能体行为(Xionget al., 2025)。这些系统改进了**动作执行者**。CEB将记忆放在**批评者**一方:它检索过去状态-动作结果和批评者的早期分数,以估计下一个提议的动作是否可靠。这也不同于自我改进和工具增强的批评(Madaanet al., 2023; Baiet al., 2022; Gouet al., 2024; Wanget al., 2025a),后者独立批评每个实例,旨在纠正动作执行者,而不是生成校准的步骤级置信度。

## 3 方法

### 3.1 问题形式化

一条轨迹为τ = (s₁, a₁, o₁), ..., (s_T, a_T, o_T),其中s_t是动作前的环境状态,a_t是提议的动作,o_t是动作执行后的观察。任务是q,h₀表示...(原文此处公式不完整,保留原样)。应用多数投票是因为个体事后判断在模糊步骤上可能有所不同:
ỹ_t = (1/V) Σ_{v=1}^V ŷ_t^{(v)}, ŷ_t = 1[ỹ_t ≥ 1/2]。   (3)

完成的步骤作为记录追加到库中,包含任务、状态摘要、动作、观察、事后伪标签ŷ_t以及执行前分配的置信度分数ẑ_t。每个库记录的形式为:
e = (q', s', a', õ', ŷ', ẑ', χ'),   (4)
其中q'是父任务,s'是动作执行前的紧凑状态摘要,a'是执行的动作,õ'是动作执行后观察的摘要。例如,在网页导航中,s'是候选动作周围的截断DOM片段;在移动GUI控制中,是可见的可点击元素列表;在Shell交互中,是最近的终端输出。伪标签ŷ' ∈ {0,1}由事后投票产生(公式3),ẑ' ∈ [0,1]是执行前分配的在线置信度分数。我们额外存储一个一致性标志:
χ' = 1[1[ẑ' ≥ 1/2] = ŷ'],   (5)
记录批评者原始的二元判断是否与事后结果一致。检索到的示例暴露这个标志,使批评者能够看到之前哪些地方分配了过高或过低的置信度。我们将库保持为类别分裂:B_t = B_t⁺ ∪ B_t⁻,其中B_t⁺ = {e: ŷ' = 1},B_t⁻ = {e: ŷ' = 0}。这种分裂使检索明确具有对比性:批评者不仅看到类似的动作成功了,也看到类似的动作失败了。批评者是自我演进的,因为随着B_t从智能体在推理期间的自身交互中增长(无需人工或真实标签参与),其评分上下文会发生变化。

**算法1:CEB:用于步骤级置信度估计的自我演进批评者**

1: 任务流 T,批评者 f_θ,事后LLM g_φ,检索深度 k,投票次数 V,库 B ← ∅  
2: **对每个** 任务 q ∈ T **执行**  
3:   traj ← ∅, scores ← ∅  
4:   **对每个** 由智能体提议的步骤 a_t **执行**  
5:     s_t ← 状态摘要(当前环境)  
6:     κ_t ← 组合键 (task: q || state: s_t || action: a_t)

相似文章

ICRL:通过强化学习内化自我批判

arXiv cs.AI

本文介绍了ICRL框架,该框架联合训练求解器和批判器,通过强化学习内化批判指导,使求解器无需外部批判即可自我改进。它使用分布校准和角色分组优势估计,在智能体和数学推理任务上比GRPO提高了6-7个点。

重新思考自进化大语言模型智能体的持续经验内化

arXiv cs.CL

本文研究了大语言模型智能体在多轮迭代经验内化过程中出现能力渐进式崩溃的原因,并提出了一套从经验粒度、注入模式和训练机制三个维度出发的鲁棒解决方案。主要发现包括:原则级经验、逐步注入方式以及离策略上下文蒸馏能够带来更稳定、更可持续的持续学习效果。