智能体是否知道成功?基于内部表示的智能体置信度校准

arXiv cs.AI 论文

摘要

本论文提出通过内部表示来校准智能体系统的置信度,在多轮基准测试中展示了其相对于基线方法的性能提升。

arXiv:2609.09448v1 Announce Type: new 摘要:随着智能体系统在安全关键应用中的快速采用,测量与智能体行动相关的置信度变得至关重要。与传统的机器学习系统相比,智能体工作流在规划、工具调用和动态环境交互方面具有复杂的故障模式。在本文中,我们研究模型的内部表示是否能在多轮智能体设置中为最终任务成功提供更强的信号。我们引入了两种互补的方法:潜在轨迹动态(LTD),它总结了交互轨迹中残差流表示的变化;以及动作表示探测(ARP),它从动作决策形成的表示中预测成功。在三个交互基准测试(Bash、SQL、Python)和三个模型家族(Qwen14B、Qwen7B、DeepSeek6.7B)上,我们的方法始终优于表面级生成和基于序列的校准基线,提供了一种零开销的可靠性监控器,无需提示修改或多样本回滚。
查看原文
查看缓存全文

缓存时间: 2026/09/11 08:37

# 智能体知道自己成功了吗?从内部表征校准智能体置信度
来源:https://arxiv.org/html/2609.09448  
Emil Joswin  
所属机构:独立研究  
Srujananjali Medicherla  
所属机构:独立研究  

###### 摘要  
随着智能体系统在安全关键型应用中快速普及,量化智能体行为的置信度变得至关重要。与传统机器学习系统相比,智能体工作流具有涉及规划、工具调用和动态环境交互的复杂故障模式。本文研究了在多轮智能体设置中,模型的内部表征是否能为最终任务成功提供更强信号。我们引入了两种互补方法:**潜在轨迹动态**(Latent Trajectory Dynamics, LTD),它总结交互轨迹中残差流表征的变化;以及**动作表征探针**(Action Representation Probe, ARP),它基于动作决策时形成的表征预测成功率。在三个交互基准(Bash、SQL、Python)和三个模型家族(Qwen-14B、Qwen-7B、DeepSeek-6.7B)上的实验表明,我们的方法始终优于基于表层生成和序列校准的基线,提供了一个零开销的可靠性监控器,既无需提示修改,也无需多次采样滚动。

## 1 引言  
自主智能体系统正日益普及,并逐渐部署于软件工程任务、交易、金融、临床决策和机器人系统等安全关键领域。因此,可靠性和故障检测对其部署至关重要。在实时执行过程中,智能体没有真实标签可供参考,因此通常依赖评估步骤来决定是否干预或实施任何回退策略。为单轮生成设计的传统置信度估计技术,如温度缩放、输出词元语义熵、语言化置信度等,在智能体工作流中面临挑战。与典型的文本生成任务不同,在智能体设置中,模型并非独立工作,而是在一个协调多轮规划、工具使用和外部环境反馈的框架内执行长周期任务。因此,由于智能体在长周期任务中复杂执行的本质,这些静态系统技术无法适用于多轮交互。  
近期工作如 Duan 等人 (2025)、Zhao 等人 (2025) 提出了考虑推理轨迹中步骤间错误传播的置信度估计技术,Zhang 等人 (2026) 则提出了一种基于轨迹推导信号的智能体置信度校准方法。由于这些方法仅利用输出级信号,可能无法捕捉模型故障前的内部状态。Azaria 和 Mitchell (2023) 已表明模型的内部状态比输出更能指示其真实性。受此启发,我们转向机制可解释性方法,以推导细粒度的模型置信度信号。机制可解释性在智能体环境中的相关工作主要基于单轮,并用于推理任务中的工具需求决策。基于这些基础工作,我们研究了不同的机制方法,以在多轮智能体设置中推导置信度。我们的主要贡献如下:
- • 我们引入了两种新颖的内部置信度提取框架,直接作用于智能体的隐藏激活:**潜在轨迹动态**(LTD),量化智能体执行路径的几何稳定性和漂移;以及**动作表征探针**(ARP),直接从动作跨度残差状态解码任务成功率。
- • 我们在无泄漏交叉验证协议下,对表层词元对数概率、轨迹动态和内部表征进行了基准测试,并表明在 InterCode-Bash、SQL 和 Python 上,三个开源编码模型(Qwen-14B、Qwen-7B、DeepSeek-6.7B)的内部方法始终优于表层基线,确立了内部状态探针作为已部署智能体可行的零开销可靠性保障。

## 2 方法学  
### 2.1 问题形式化  
对于任务 \(i\),编码智能体生成一个多步轨迹 \(\tau_i=\{(g_{i,t},o_{i,t})\}_{t=1}^{T_i}\),其中 \(g_{i,t}\) 是第 \(t\) 步的生成内容,\(o_{i,t}\) 是相应的观察结果,\(y_i\in\{0,1\}\) 表示任务成功。我们寻求一个轨迹级置信度估计 \(\hat{c}_{i}\approx P(y_i=1\mid\tau_i)\)。对于每个生成的词元,我们保留其对数概率 \(\ell_{i,t,j}\) 并恢复其概率为 \(p_{i,t,j}=\exp(\ell_{i,t,j})\)。我们还通过将存储的轨迹通过生成模型进行教师强制来恢复残差流状态 \(h^{(\ell)}_{i,t,j}\)(在实际部署中,这在生成过程中以零重放开销计算;见附录 I)。校准的对数概率和整体轨迹校准(HTC)从可观测的轨迹信息估计置信度,而 LTD 和 ARP 使用这些内部表征。外部置信度基线的更多详情见附录 G。

### 2.2 内部表征信号  
#### 2.2.1 潜在轨迹动态  
潜在轨迹动态(LTD)描述模型的内部状态在智能体轨迹中如何变化。我们对每个存储的生成进行教师强制,并保留对应于任务观察、推理、动作和后续反馈的语义上有意义端点的残差流状态。从相邻状态 \(h_t\) 和 \(h_{t+1}\),我们测量余弦位移 \(d_{\mathrm{cos}}(h_t,h_{t+1})=1-\frac{h_t^\top h_{t+1}}{\lVert h_t\rVert_2\lVert h_{t+1}\rVert_2}\),(1) 和相对位移 \(d_{\mathrm{rel}}(h_t,h_{t+1})=\frac{\lVert h_{t+1}-h_t\rVert_2}{\lVert h_t\rVert_2+\epsilon}\)。(2)  
我们使用这些量的均值、最终值、变异性及其趋势,在推理、承诺、动作和反馈转换中总结这些量。我们还测量路径效率,并包含不可用转换类型的指示器。完整的特征集见附录 E。这产生 \(x_i^{\mathrm{LTD}}\in\mathbb{R}^{28}\)。为了在这些内部动态中分离信息,同时匹配 HTC 的预测器类别,我们拟合了一个 L2 正则化的逻辑模型。

#### 2.2.2 动作表征探针  
动作表征探针(ARP)探究动作决策时的内部表征是否直接编码了最终任务成功。令 \(a_{i,t}\) 表示第 \(t\) 步动作跨度端点的最终层残差状态。我们排除终端提交动作,并对剩余动作状态进行平均池化:\(\bar{a}_{i}=\frac{1}{|\mathcal{A}_{i}|}\sum_{t\in\mathcal{A}_{i}}a_{i,t}\)(3)  
在每个训练折内,我们将这些情节表征标准化,并将其投影到其前 64 个主成分上:\(u_{i}=\operatorname{PCA}_{64}\left(\operatorname{Standardize}\left(\bar{a}_{i}\right)\right)\)。(4) 一个 L2 正则化的逻辑探针基于投影表征预测成功。单调 Platt 映射随后将此分数转换为报告的置信度。标准化、PCA、探针拟合和概率校准均在无法访问外部保留折的情况下执行。

## 3 实验  
### 3.1 实验设置  
**模型和智能体框架:** 我们使用三个模型进行评估 - Qwen2.5-Coder-7B-Instruct, Qwen2.5-Coder-14B-Instruct-AWQ, 和 DeepSeek-Coder-6.7B-Instruct,在单个 A100 GPU 上。所有模型使用 vLLM 通过其兼容 OpenAI 的 API 本地提供服务,该 API 暴露了每词元的对数概率。提示样本见附录 B。所有报告结果均使用贪心解码(温度 = 0)。随后,我们在相同的离线模型上对生成的轨迹进行教师强制,以获得残差流状态。对于每个模型和环境,所有方法在相同任务群体上使用相同的冻结外部折进行评估,为每个轨迹生成一个折外预测。更多详情见附录 H。  
**数据集:** 我们将研究基于交互式编码基准,因为它们通过程序单元测试和执行框架提供客观、确定性的真实验证,完全消除了 LLM 作为评估者的噪声,同时需要在多样化语法和语义模态中进行多轮交互式问题解决。我们使用了来自 intercode-bench 的三类交互式编码任务,包括 Python (MBPP)、SQL (SPIDER) 和 Bash 任务。更多详情见附录 C。  
**基线和评估指标:** 我们将我们的方法与外部置信度信号进行基准测试 - HTC 和校准的对数概率。我们使用三个标准的置信度校准分数。AUROC(受试者工作特征曲线下面积)衡量区分正确和错误推理轨迹的能力;ECE 衡量模型预测概率与观察到的准确性之间的差异;布里尔分数衡量预测概率与实际二元结果之间的平均平方差。对于良好的校准指标,我们期望更高的 AUROC 分数以及更低的布里尔分数和 ECE 分数。

### 3.2 校准和性能结果  
表 1 总结了所有三个评估环境和模型架构的折外区分(AUROC)和校准指标(布里尔分数、ECE)。我们的实证发现表明了三个核心趋势:
1. 1. **词元置信度是不充分的外部信号。** 校准的对数概率提供了最弱的区分度,表明仅聚合输出概率无法可靠地捕捉轨迹级成功。
2. 2. **轨迹结构增强了外部置信度估计。** HTC 在大多数设置中显著优于校准的对数概率,表明跨交互的置信度动态比单一聚合概率更具信息量。
3. 3. **内部表征提供了超越可观测输出的置信度信号。** LTD 和 ARP 在每个模型-环境设置中,在 AUROC 或布里尔分数上均优于外部基线,且在所有九个设置中,内部方法均达到了最佳 AUROC 和布里尔分数。  
这些结果共同表明,轨迹级动态和动作级表征都揭示了仅靠输出概率无法捕捉的关于最终成功的信息。

表 1:跨校准范式和模型家族的置信度评估。方法从表层输出(Logprob (Cal.))到序列动态(HTC)再到内部表征机制(LTD, ARP)逐步递进。所有指标均使用冻结协议上的 5 折嵌套交叉验证。  
(a) Qwen2.5-Coder-14B-Instruct-AWQ  
(b) Qwen2.5-Coder-7B-Instruct  
(c) DeepSeek-Coder-6.7B-Instruct

## 4 相关工作  
早期的智能体方法直接从静态语言模型调整,包括温度缩放、预测词元的语义熵以及语言化置信度。所有这些方法都专注于单轮输出,没有将轨迹中的多个步骤作为一个整体来处理。像 Duan 等人 (2025)、Zhao 等人 (2025) 这样的工作考虑了智能体推理轨迹中不同步骤的不确定性如何传播,而 Zhang 等人 (2026) 提出了一个基于轨迹的分类器。另一类工作则关注不同的机制信号——执行轨迹和基于嵌入的探针(Liu 等人 (2024)),以及层间的非嵌入相似性信号(Subramani 等人 (2025))用于指导工具使用,以及利用思维链推理中不同步骤的可解释性(Sun 等人 (2026))。我们的工作试图弥合当前机制可解释性与长周期智能体任务之间的差距。

## 5 结论  
在这项工作中,我们证明了对 LLM 智能体内部残差流的被动内省,比表层生成文本或序列级注意力统计提供了更可靠的置信度信号。在三个交互基准(Bash、SQL、Python)和三个模型家族(Qwen-14B、Qwen-7B、DeepSeek-6.7B)上,我们提出的内部框架 i) 潜在轨迹动态(LTD)和 ii) 动作表征探针(ARP)始终优于最先进的词元级校准方法。由于我们的方法完全在标准前向传播期间计算的表征上运行,无需提示修改或多次滚动采样,它为部署在现实环境中的自主智能体提供了一个高效、被动的可靠性保障。这些结果表明,内部状态监控是检测不可靠智能体行为并在部署期间实现置信度感知干预的有希望的基础。

## 参考文献  
- Austin 等人 (2021) J. Austin 等人。《使用大型语言模型进行程序综合》。arXiv 预印本 arXiv:2108.07732。被引用:条款 3。
- Azaria 和 Mitchell (2023) A. Azaria 和 T. Mitchell。《LLM 的内部状态知道它何时在说谎》。载于《计算语言学协会 findings:EMNLP 2023》,第 967–976 页。被引用:§1。
- Duan 等人 (2025) J. Duan, J. Diffenderfer, S. Madireddy, T. Chen, B. Kailkhura, 和 K. Xu。《Uprop:调查 LLM 在多步骤中的不确定性传播》。

相似文章

CALIBER:语言模型中推理前后的置信度校准

arXiv cs.CL

本文介绍了CALIBER,一种通过获取推理前后的置信度估计并匹配信息状态的监督目标来校准推理语言模型置信度的方法。它在多个基准测试上显著降低了期望校准误差(最多52.5%),并取得了强劲的Brier分数和AUROC。