超越单轮置信度:面向LLM智能体的轨迹自适应不确定性量化
摘要
本文研究单轮不确定性量化方法是否能迁移到交互式LLM智能体轨迹中,在五个LLM和四个工具使用数据集上评估了白盒、黑盒和反思型评分器。结果表明迁移效果参差不齐,黑盒自洽性通常最强,并建议在轨迹层面重新验证UQ方法。
arXiv:2608.11552v1 公告类型:新论文
摘要:针对语言模型的不确定性量化(UQ)方法通常在单轮输出上进行评估,即不确定性被附加到一个生成的答案上。然而,对于LLM智能体而言,观测单位是交互式轨迹,模型可以提出澄清性问题、调用工具、更新状态并做出中间决策,而这些决策的错误会传播到最终结果。我们研究了三类常见的单轮UQ方法是否能迁移到这一设置中。在来自BFCL-v4和$\tau^2$-bench的五个LLM和四个多轮工具使用数据集上,我们评估了基于动作令牌概率的白盒评分器、基于重采样轨迹的黑盒一致性评分器,以及基于模型对轨迹自我评估的反思型评分器。我们发现迁移通常有用但不均衡。令牌概率分数对跨轮使用的聚合器选择高度敏感,反思型分数在大多数评估设置中提供了最强且低成本的基线,而黑盒自洽性通常是最强的UQ家族,其中轨迹等价性和动作集一致性在其变体中通常排名最高。这些结果表明,为单次生成开发的UQ方法应在轨迹层面重新验证,并需谨慎关注一致性度量、聚合器选择和计算预算。
查看缓存全文
缓存时间: 2026/08/13 15:27
# 超越单轮置信度:面向LLM智能体的轨迹自适应不确定性量化
###### 摘要
不确定性量化(UQ)方法通常针对单轮输出进行评估,即不确定性被附着于单个生成答案上。然而,对于LLM智能体而言,观察单元是一个交互式轨迹,在此过程中模型可以提出澄清性问题、调用工具、更新状态,并做出中间决策,而这些中间决策的错误会传播至最终结果。我们研究了三种常见的单轮UQ方法家族是否能够迁移到这一设定中。在BFCL-v4和τ2-bench的四个多轮工具使用数据集上,跨越五个LLM,我们评估了基于动作词元概率的白盒评分器、基于重采样轨迹的黑盒一致性评分器,以及基于模型对轨迹进行自我评估的反思式评分器。我们发现迁移往往是有用的但并不均衡。词元概率分数对跨轮次的聚合器选择高度敏感,反思式评分器在大多数评估设定中提供了最强的低成本基线,而黑盒自洽性通常是最强的UQ方法家族,其中轨迹等价性和动作集一致性在其变体中通常排名最高。这些结果表明,为单次生成开发的UQ方法应在轨迹层面重新验证,并需仔细关注一致性度量、聚合器选择和计算预算。
## 1 引言
不确定性量化(UQ)方法已被广泛证明可以在单轮设定中用于分类大语言模型响应的事实正确性(13 (https://arxiv.org/html/2608.11552#bib.bib29);14 (https://arxiv.org/html/2608.11552#bib.bib26);18 (https://arxiv.org/html/2608.11552#bib.bib24);9 (https://arxiv.org/html/2608.11552#bib.bib22);15 (https://arxiv.org/html/2608.11552#bib.bib25))。与此同时,语言模型越来越多地被部署为智能体,与用户交互、调用外部工具、更新中间状态,并为单个任务做出多个决策。在智能体轨迹中,不确定性出现在许多节点,包括请求是否规格不明确、选择哪个动作或工具、如何填写参数,以及轨迹是否实现了用户目标。因此,量化这些系统的不确定性需要的不仅仅是对单次生成响应的置信度。
单轮UQ方法通常分为三个家族:使用词元概率的白盒评分器、通过采样多个响应并测量自洽性的黑盒一致性评分器,以及要求模型评估自身置信度或正确性的反思式评分器。当不确定性在轨迹中累积,当早期错误传播到后续决策,或者当模型必须在回答、澄清和行动之间做出选择时,这些评分器可能会性能下降。先前关于智能体UQ的工作提出了传播方法如SAUP和UProp(32 (https://arxiv.org/html/2608.11552#bib.bib5);7 (https://arxiv.org/html/2608.11552#bib.bib6)),而近期工作则用轨迹适配的符号和术语对该问题进行了形式化(19 (https://arxiv.org/html/2608.11552#bib.bib11))。目前尚不清楚的是,当预测单元变为交互式轨迹时,这三个UQ家族是否仍能提供有用的失败信号。
我们通过涵盖五个LLM和来自BFCL-v4(20 (https://arxiv.org/html/2608.11552#bib.bib2))和τ2-bench(1 (https://arxiv.org/html/2608.11552#bib.bib1))的四个智能体数据集的实验来研究这一问题,评估一系列广泛的UQ评分器在跨模型、跨领域和选择性预测预算下预测轨迹成功的能力。我们的贡献如下。首先,我们在多轮工具使用智能体中提供了这些UQ方法家族的可控实证比较,报告了判别力、校准性和选择性预测。其次,我们通过跨轮次的词元概率分数聚合以及新的黑盒一致性度量(包括基于模型的轨迹等价性评分器)将它们适配为轨迹级评分。第三,我们发现不同评分方法的可迁移性参差不齐。具体而言,在我们评估的设定中,白盒可靠性强烈依赖于聚合器的选择,反思式评分器在大多数考虑到的模型-数据集组合上表现良好,而黑盒自洽性通常是最强的方法家族,其中轨迹等价率和动作集一致性在其变体中通常排名最高。重要的是,在我们的评估中,没有任何一个方法家族在所有模型和领域上是一致可靠的。
## 2 相关工作
##### 语言模型输出的置信度估计。
已有工作开发了多种针对语言模型生成的后验不确定性评分方法家族。输出一致性方法对模型进行多次采样,并根据生成之间的分歧来估计不确定性,使用精确一致性、词法重叠、嵌入相似度、语义聚类或蕴含关系等价性(6 (https://arxiv.org/html/2608.11552#bib.bib32);18 (https://arxiv.org/html/2608.11552#bib.bib24);4 (https://arxiv.org/html/2608.11552#bib.bib14);31 (https://arxiv.org/html/2608.11552#bib.bib27);5 (https://arxiv.org/html/2608.11552#bib.bib21);14 (https://arxiv.org/html/2608.11552#bib.bib26);15 (https://arxiv.org/html/2608.11552#bib.bib25);9 (https://arxiv.org/html/2608.11552#bib.bib22))。长文本变体在声明层面应用类似技术(12 (https://arxiv.org/html/2608.11552#bib.bib20);2 (https://arxiv.org/html/2608.11552#bib.bib15);27 (https://arxiv.org/html/2608.11552#bib.bib23);28 (https://arxiv.org/html/2608.11552#bib.bib12))。基于概率的方法利用模型似然度,将词元级量聚合为响应级分数,例如序列概率、困惑度、熵、概率边际,或预测分布的相关摘要(17 (https://arxiv.org/html/2608.11552#bib.bib31);8 (https://arxiv.org/html/2608.11552#bib.bib30);10 (https://arxiv.org/html/2608.11552#bib.bib18))。反思式方法则要求模型自身报告置信度或评估生成的输出是否正确(13 (https://arxiv.org/html/2608.11552#bib.bib29);23 (https://arxiv.org/html/2608.11552#bib.bib13);25 (https://arxiv.org/html/2608.11552#bib.bib28))。这些方法最常在静态预测任务上进行评估,此时不确定性附着于单个生成的响应。智能体系统需要不同的分析单元,因为轨迹成功取决于一系列动作和交互,而不仅仅是单次生成。
##### 交互式和工具使用智能体中的不确定性。
越来越多的研究关注LLM智能体中的不确定性。UALA将不确定性纳入思考-行动-观察循环中,并利用其指导工具使用(11 (https://arxiv.org/html/2608.11552#bib.bib3))。ProbeCal利用执行轨迹和基于嵌入的探针来校准工具使用智能体(16 (https://arxiv.org/html/2608.11552#bib.bib4))。其他工作研究多步轨迹中的不确定性传播。SAUP使用情境相关权重,通过智能体推理轨迹传播步骤级不确定性(32 (https://arxiv.org/html/2608.11552#bib.bib5)),而UProp将当前决策固有的不确定性与从早期步骤继承的不确定性区分开来(7 (https://arxiv.org/html/2608.11552#bib.bib6))。多轮置信度估计也已在对话设定中得到研究,每轮校准和随信息累积的单调性是关键目标(29 (https://arxiv.org/html/2608.11552#bib.bib7))。近期针对智能体的工作进一步将不确定性视为控制信号:Agentic UQ使用言语化不确定性来指导记忆和反思(30 (https://arxiv.org/html/2608.11552#bib.bib8));一项工具使用校准研究发现,证据类工具会诱发过度自信,而验证类工具可以缓解错误校准(26 (https://arxiv.org/html/2608.11552#bib.bib9));面向澄清的智能体使用工具调用参数上的结构化不确定性来决定何时向用户询问缺失信息(22 (https://arxiv.org/html/2608.11552#bib.bib10))。近期面向基础理论的工作将轨迹级智能体不确定性形式化为完整轨迹上的联合不确定性,包括初始查询、动作和观测不确定性的贡献(19 (https://arxiv.org/html/2608.11552#bib.bib11))。虽然这些研究确立了不确定性对LLM智能体的核心重要性,但据我们所知,先前工作尚未在匹配条件下,跨一系列LLM智能体和数据集,系统地比较基于概率、基于采样和反思式方法。
## 3 方法
我们评估涵盖白盒、黑盒和反思式家族的基于UQ的置信度评分器,将其作为智能体轨迹成功的预测器。我们基于19(https://arxiv.org/html/2608.11552#bib.bib11)的智能体UQ形式化,其中一幕是一个轨迹F≤T,包含T轮,第i轮发出动作Ai(工具调用或发给用户的消息)并接收环境观测Oi。在轨迹完成时,一个二元奖励r(F≤T)记录是否成功。我们用F表示此类轨迹的空间,为符号简洁,将F≤T缩写为F。我们的目标是估计完整轨迹F的不确定性,其中有用的不确定性分数应将成功轨迹排在失败轨迹之上。1 设y为提示x的一次生成,包含词元{t1,...,tL},其中L是词元数量,pj是词元tj在生成序列中前序词元条件下的概率。在第i轮,该生成即动作Ai。我们将每个置信度评分器视为映射C:F→[0,1],数值越大表示轨迹成功的置信度越高。具体而言,白盒评分器由每轮词元概率计算并在轨迹上聚合;黑盒自洽性评分器在随机解码下采样m个额外候选轨迹F~={F~1,...,F~m}并测量轨迹一致性,将签名扩展为C:F×Fm→[0,1];反思式评分器在最终智能体动作可用的对话前缀上使用自我评估。下面详细介绍各家族的多种评分器。
### 3.1 白盒评分器
白盒评分器使用模型的词元概率来计算单次生成上的置信度。我们使用各种跨轮次聚合器将这些方法推广到轨迹级评分。
#### 3.1.1 单次生成评分器
此处我们定义文献中的三个单次生成白盒评分器,更多评分器在附录A(https://arxiv.org/html/2608.11552#A1)中定义。序列概率SP(y)=∏j=1Lpj(24 (https://arxiv.org/html/2608.11552#bib.bib17))计算为生成序列中词元概率的乘积。归一化版本称为长度归一化序列概率LNSP(y)=(∏j=1Lpj)1/L,是每词元几何均值,不会直接惩罚较长的生成(17 (https://arxiv.org/html/2608.11552#bib.bib31);4 (https://arxiv.org/html/2608.11552#bib.bib14))。第三个单轮评分器使用每个位置的前K个词元概率{pj,1,...,pj,K},归一化后和为1。平均词元负熵将每个位置的基于熵的置信度TN@K(tj)=1−TE@K(tj)/log K在该次生成上取平均(3 (https://arxiv.org/html/2608.11552#bib.bib19)),其中TE@K(tj)=−∑k=1Kpj,k log pj,k是截断的前K熵(21 (https://arxiv.org/html/2608.11552#bib.bib16);18 (https://arxiv.org/html/2608.11552#bib.bib24)):
ATN@K(y)=1L∑j=1LTN@K(tj)。
#### 3.1.2 词元跨度与轨迹聚合
沿轨迹应用上述评分器需要框架未明确规定的两个智能体选择:1)一轮中的哪些词元需要评分,2)如何将每轮值组合为轨迹级估计。
##### 词元跨度。
19(https://arxiv.org/html/2608.11552#bib.bib11)的框架将动作Ai视为原子性的,但一轮的生成将自由形式的推理与已承诺的动作交织在一起。本工作中的所有白盒分数均是在每轮的动作跨度上计算的(即已承诺动作的词元,无论是对用户的工具调用还是消息)。2
##### 跨轮次聚合。
19(https://arxiv.org/html/2608.11552#bib.bib11)将轨迹不确定性表达为这些每轮不确定性分数的广义聚合,包含特殊情况如跨轮次最大值或最小值、算术均值以及凸权重(32 (https://arxiv.org/html/2608.11552#bib.bib5);7 (https://arxiv.org/html/2608.11552#bib.bib6))。设si表示白盒评分器在第i轮的每轮置信度,我们评估置信度侧对应物,包括均值gmean=1T∑isi(长度归一化归约)、最小值gmin=mini si(最不确定步骤规则的置信度对应物),以及首轮和末轮值gfirst=s1和glast=sT。带早期或晚期权重的通用位置加权聚合器在附录A(https://arxiv.org/html/2608.11552#A1)中定义。我们注意到,在gmean下,LNSP和ATN@K是19(https://arxiv.org/html/2608.11552#bib.bib11)中评估的两种轨迹级白盒评分器的置信度类比。
### 3.2 黑盒一致性评分器
黑盒评分器采样m个额外轨迹,并衡量原始轨迹与采样轨迹之间的一致性,不访问词元概率。着眼于一致性度量定义清晰的方面,我们考虑最终消息、动作序列和完整轨迹文本上的一致性。
#### 3.2.1 最终消息一致性
智能体的结束消息是单轮答案的最接近智能体类比,但在工具使用智能体中,它往往只是对奖励相关动作的自我报告。考虑到这一点,我们的目标是评估标准单轮一致性UQ是否可以直接开箱即用地迁移到智能体。具体而言,我们将参考最终消息y与重采样轨迹的最终消息y~={y~1,...,y~m}进行比较,其方式与单轮问题中比较重采样答案完全相同。3 精确评分器定义如下。
##### 非矛盾概率(NCP)。
参考样本与采样样本不产生矛盾的平均概率,在NLI模型的两个方向上取平均(5 (https://arxiv.org/html/2608.11552#bib.bib21))。相似文章
面向LLM Agent澄清请求的不确定性分解
本文针对LLM Agent提出了一种基于提示的不确定性分解方法,将行动置信度与请求不确定性分离,使其能在未明确指定的任务中主动寻求澄清。该方法在五个LLM骨干网络上使用新的澄清增强基准进行了评估,显示出显著改进。
通过不确定性对齐的强化学习探索智能体工具调用决策
本文提出TRUST方法,将不确定性量化融入强化学习奖励设计,以改进LLM智能体的工具调用决策,提升决策质量并保持可靠的不确定性估计。
LLM置信度估计的不同方法基准测试
本文对LLM置信度估计的各种黑盒与白盒方法进行了基准测试,包括口头化置信度、语言不确定性、推理长度、P(Answer)、P(True)和自我一致性,比较它们在主动学习和安全分类等任务中的有效性。
LLM代理中的忠实不确定性:实践中校准与效用权衡
一位从业者讨论了LLM代理中的校准与效用权衡,分享了基于验证器的流水线经验,该流水线将幻觉工具调用减少了约60%,但引入了延迟成本并丢失了简单的正确答案。
判断、检索或放弃:具有可证明风险保证的不确定性防护LLM判断
本文提出一个风险控制框架,用于在事实评估中将LLM作为判断器。该框架校准不确定性阈值以维持用户指定的错误率,并在必要时路由到检索增强模式,从而实现具有可证明可靠性保证的更高覆盖率。