通过逐步置信归因诊断黑盒大语言模型中的多步推理失败

arXiv cs.CL 论文

摘要

提出逐步置信归因(SCA),一个无需内部访问即可为黑盒大语言模型的推理轨迹分配逐步置信度的框架,利用信息瓶颈原理区分合法变异性与错误。实验表明,SCA能可靠地识别低置信度步骤,并将自纠正成功率相比答案级别反馈提升高达13.5%。

arXiv:2605.19228v1 公告类型:新 摘要:大型语言模型通过生成逐步解决方案,在具有客观答案的推理任务上取得了强劲表现,但诊断多步推理轨迹可能失败的位置仍然困难。置信度估计提供了一种诊断信号,但现有方法仅限于最终答案或需要模型内部访问。在本文中,我们提出了逐步置信归因(SCA),一个针对闭源大语言模型的框架,仅基于生成的推理轨迹分配逐步置信度。SCA应用信息瓶颈原理:与正确解中共识结构一致的步骤获得高置信度,而偏差则被标记为潜在错误。我们提出了两种互补方法:(1)NIBS,一种无需图结构的非参数化IB方法,用于测量一致性;(2)GIBS,一种基于图的IB模型,通过可微掩码学习子图以捕捉逻辑变异性。在数学推理和多跳问答上的广泛实验表明,SCA能可靠地识别与推理错误高度相关的低置信度步骤。此外,使用步骤级置信度指导自纠正可将纠正成功率相比答案级别反馈提升高达13.5%。
查看原文
查看缓存全文

缓存时间: 2026/05/20 08:24

# 诊断黑盒大模型中的多步推理失败:基于逐步置信归因

来源:https://arxiv.org/html/2605.19228

###### 摘要

大语言模型通过生成逐步解决方案,在具有客观答案的推理任务上表现强劲,但诊断多步推理轨迹可能失败的位置仍然困难。置信度估计提供了一种诊断信号,但现有方法仅限于最终答案或需要模型内部访问。我们提出逐步置信归因(SCA),一个针对闭源LLM的框架,仅基于生成的推理轨迹为步骤分配置信度。SCA应用信息瓶颈原则:与正确解决方案中一致结构对齐的步骤获得高置信度,而偏离则被标记为可能出错。我们提出两种互补方法:(1) NIBS,一种非参数化IB方法,无需图结构即可测量一致性;(2) GIBS,一种基于图的IB模型,通过可微掩码学习子图以捕捉逻辑变异性。在数学推理和多跳问答上的广泛实验表明,SCA能可靠地识别与推理错误高度相关的低置信度步骤。此外,使用步骤级置信度引导自我修正,相较于答案级反馈,修正成功率提升高达13.5%。机器学习,ICML

## 1 引言

诊断多步推理轨迹何处失败的能力对于提高大语言模型(LLMs)的可靠性至关重要。诸如思维链(CoT)(Wei et al., 2022 (https://arxiv.org/html/2605.19228#bib.bib38))或思维图(GoT)(Besta et al., 2024 (https://arxiv.org/html/2605.19228#bib.bib18))等解决方案轨迹,为模型推理提供了透明度,但中间错误仍然难以识别,并可能严重影响最终预测。最近的工作探索了推理轨迹的步骤级诊断,大致分为两类。第一类使用逐步人工标注训练监督分类器,标记每个推理步骤是否正确(Jiao et al., 2025 (https://arxiv.org/html/2605.19228#bib.bib24); Zheng et al., 2024 (https://arxiv.org/html/2605.19228#bib.bib21); Lightman et al., 2023 (https://arxiv.org/html/2605.19228#bib.bib62))。第二类则提示LLM自身作为评判者,逐步批判每个解决方案步骤(Weng et al., 2023 (https://arxiv.org/html/2605.19228#bib.bib22); Li et al., 2024 (https://arxiv.org/html/2605.19228#bib.bib23))。虽然两种方向都能提供有用信号,但前者需要昂贵的人工标注,后者则继承了评判模型的偏差和不一致性,限制了可扩展性和可靠性。

参考图注

图1:GSM8K数据集中推理轨迹变异性示例。两条不同的解决方案路径(B和C)产生相同的正确答案,而另一条路径(A)包含一个错误步骤导致错误结果。逐步置信归因需要区分合理的变异性和真正的逻辑不一致。

置信度估计(CE)提供了一个评估可靠性的补充方向,因为它可以直接在模型输出上操作。先前工作表明,诸如跨采样生成结果的语义方差(Lin et al., 2023 (https://arxiv.org/html/2605.19228#bib.bib16); Golovneva et al., 2022 (https://arxiv.org/html/2605.19228#bib.bib64))或对数值的预测熵(Lin et al., 2024 (https://arxiv.org/html/2605.19228#bib.bib28); Kuhn et al., 2023 (https://arxiv.org/html/2605.19228#bib.bib17))等度量,为估计最终答案是否正确提供了有信息的信号。然而,将CE限制在最终答案只能产生一个粗略的可靠性信号,无法指出推理轨迹中哪个特定步骤导致了错误。这一局限性促使我们需要逐步置信归因(SCA),其目标是为各个推理步骤分配置信度分数,从而提供细粒度的诊断信号。

将置信度归因从最终答案级别扩展到步骤级别,引入了一个关键挑战。LLM生成的推理轨迹表现出显著的输出变异性:正确的解决方案可能在步骤顺序、表达方式或细节程度上有所不同。然而,尽管存在这些表面差异,正确的推理路径并非随机;它们受到问题底层逻辑的支配。因此,有效的轨迹往往汇聚到特定的关键逻辑不变量,即临界中间状态或语义里程碑,这些是推导正确答案所必需的(例如,在数学问题中计算中间成本)。一个稳健的SCA必须区分这种合理的变异性和真正的错误。合理变异性代表了这些逻辑锚点之间的替代轨迹,而错误则是偏离有效推理共识的偏差。例如,在图1中,解决方案B和C通过不同的计算顺序得出正确答案。尽管步骤顺序不同,两个解决方案都明确解析了必要的中间值(铅笔和笔记本的成本)。它们在推理逻辑上功能等价,应获得高置信度。相比之下,解决方案A虽在结构上与B相似,但在第4步引入了错误操作;这种偏差破坏了共同结构,应获得低置信度。

我们的关键思想是聚合多个正确解决方案的轨迹,并识别逻辑不变量。这些逻辑不变量作为可靠推理的锚点,被赋予高置信度;而缺席共识模式的步骤则被赋予低置信度,因为它们更可能反映虚假或易出错的推理。因此,共识模式充当了问题底层逻辑模式的代理,使得细粒度且稳健的置信度归因得以实现。

这种在噪声变异中寻找共享模式的直觉自然映射到信息瓶颈(IB)原则上。IB提供了一个形式化的语言来平衡两个竞争目标:通过丢弃非必要变异来压缩输入轨迹(压缩项),同时保留关于底层正确推理模式的最大信息(相关性项)。这里,输入\(X\)是一个由多个步骤组成的推理轨迹,压缩表示\(Z\)是轨迹在其步骤上的置信度权重表示,目标\(Y\)表示轨迹的正确性信号。目标是最小化 \(\min_Z I(X;Z) - \beta I(Z;Y)\),其中第一项通过只选择步骤的稀疏子集来鼓励压缩,第二项确保该子集保留正确性所需的关键信息。在此框架内,我们探索两种互补的实例化:

- **用于逐步置信度的非参数化IB**。\(Z\)被实现为从正确解决方案派生的共识步骤集合,步骤级置信度通过测量轨迹与该集合的对齐程度获得。
- **用于逐步置信度的图IB(GIBS)**。为了更好地处理结构变异性,轨迹被表示为图,而\(Z\)是通过可微掩码选择的子图。通过将所选子图与正确性信号对齐产生置信度分数,提供更灵活的处理方式。

实验结果表明,这两种基于IB的方法都能产生准确的置信度估计。除了诊断,我们展示了细粒度CE对下游LLM性能的影响,表明使用步骤级信号引导自我修正,相较于答案级反馈,修正成功率提升高达13.5%。消融研究验证了每个组件的贡献,鲁棒性分析展示了标签可用条件、跨推理格式的泛化能力以及领域迁移。

## 2 相关工作

#### LLMs中的置信度估计。

置信度估计(CE)旨在为单个输出分配可靠性分数(Lin et al., 2023 (https://arxiv.org/html/2605.19228#bib.bib16))。大多数CE方法关注最终答案,要么通过内部信号如熵(Kuhn et al., 2023 (https://arxiv.org/html/2605.19228#bib.bib17); Lin et al., 2024 (https://arxiv.org/html/2605.19228#bib.bib28)),要么通过黑盒信号如跨采样输出的一致性(Lin et al., 2023 (https://arxiv.org/html/2605.19228#bib.bib16))。然而,这些方法无法洞察中间步骤。最近的逐步CE方法(Ye et al., 2025 (https://arxiv.org/html/2605.19228#bib.bib19); Han et al., 2025 (https://arxiv.org/html/2605.19228#bib.bib20))试图沿着推理轨迹分配置信度,但需要内部访问token概率,限制了其只能用于开源模型。一些工作也将推理建模为图(Besta et al., 2024 (https://arxiv.org/html/2605.19228#bib.bib18); Pandey et al., 2025 (https://arxiv.org/html/2605.19228#bib.bib40)),但表示本身与我们的问题设置是正交的。我们的工作与这些不同之处在于,我们在黑盒设置中提出了逐步置信度归因的问题,仅使用生成的推理轨迹即可在步骤级别提供可扩展的置信度信号。

#### LLMs中的推理验证。

推理验证研究多步推理是否正确。推理验证分为答案级和步骤级方法。答案级方法,如自一致性(Wang et al., 2022 (https://arxiv.org/html/2605.19228#bib.bib55))、基于结果的验证器(Uesato et al., 2022 (https://arxiv.org/html/2605.19228#bib.bib47); Zhang et al., 2024 (https://arxiv.org/html/2605.19228#bib.bib48))和LLM评判者(Li et al., 2024 (https://arxiv.org/html/2605.19228#bib.bib23)),通常缺乏过程可诊断性(Tye et al., 2023 (https://arxiv.org/html/2605.19228#bib.bib53))。步骤级方法通过人工监督(Lightman et al., 2023 (https://arxiv.org/html/2605.19228#bib.bib62); Zheng et al., 2024 (https://arxiv.org/html/2605.19228#bib.bib21))、自动奖励(Wang et al., 2023a (https://arxiv.org/html/2605.19228#bib.bib49); Setlur et al., 2024 (https://arxiv.org/html/2605.19228#bib.bib50))或图结构(Cao, 2023 (https://arxiv.org/html/2605.19228#bib.bib51); Fang et al., 2025 (https://arxiv.org/html/2605.19228#bib.bib52); Mukherjee et al., 2025 (https://arxiv.org/html/2605.19228#bib.bib65))评估中间步骤。然而,这些方法依赖于昂贵的标注(Lightman et al., 2023 (https://arxiv.org/html/2605.19228#bib.bib62))或不可靠的主观判断(Szymanski et al., 2024 (https://arxiv.org/html/2605.19228#bib.bib43); Stechly et al., 2024 (https://arxiv.org/html/2605.19228#bib.bib44); Jacovi et al., 2024 (https://arxiv.org/html/2605.19228#bib.bib46))。我们通过引入定量置信度信号来解决这个问题,以减少成本和偏差。

## 3 问题陈述

标准答案级置信度估计(CE)为最终输出\(A\)分配一个可靠性分数。(关于答案级CE的形式定义以及白盒与黑盒设置的区别,请参阅附录B (https://arxiv.org/html/2605.19228#A2))。虽然有效,但答案级CE仅提供一个粗略信号,无法揭示哪些推理步骤导致了成功或失败。这一局限性在高风险决策中至关重要,因为识别错误位置是必要的。为了解决这个问题,我们将粒度转移到中间的推理过程。对于推理任务,模型会生成一个推理轨迹 \(y_i = (T_i, A_i)\),其中 \(T_i = \{t_{i1}, \dots, t_{iL_i}\}\) 是一个步骤序列。我们引入逐步置信度归因(SCA),利用最终答案的正确性来锚定步骤级可靠性。需要指出的是,在本文中,我们区分模型确定性和步骤可靠性。在白盒设置中,一个步骤可能以高token概率生成(高确定性),但在逻辑上有缺陷;相反,一个正确的步骤如果新颖,其概率可能较低。因此,在本文中,我们所谓的“置信度”并非主观的生成概率,而是量化一个步骤对正确答案贡献的可靠性分数。

###### 问题1(逐步置信度归因)。

给定一个输入\(x\)和\(N\)个采样轨迹 \(\mathcal{S} = \{ (T_i, A_i, z_i) \}_{i=1}^N\),其中正确性标签 \(z_i \in \{0,1\}\),目标是学习一个映射 \(f: (T_i, \mathcal{S}) \rightarrow \{c_{ij}\}_{j=1}^{L_i}\),其中 \(c_{ij}\) 是分配给步骤 \(t_{ij}\) 的置信度分数。这里,\(c_{ij}\) 反映了该步骤与正确轨迹中共同结构的对齐程度,作为正确性归因的代理。SCA的主要目标是诊断。对于一个错误轨迹(\(z_i=0\)),\(f\) 应为导致错误的步骤分配低置信度。对于一个正确轨迹(\(z_i=1\)),与有效解决方案的逻辑共识相匹配的步骤应获得高置信度。虽然这假设了最终答案标签,但此类信号在评估场景中自然可用(Liu et al., 2023 (https://arxiv.org/html/2605.19228#bib.bib2); Augenstein et al., 2024 (https://arxiv.org/html/2605.19228#bib.bib3); Gao et al., 2025 (https://arxiv.org/html/2605.19228#bib.bib4); Zhao et al., 2024 (https://arxiv.org/html/2605.19228#bib.bib6); Wang et al., 2023b (https://arxiv.org/html/2605.19228#bib.bib5)),避免了昂贵的步骤级标注。我们还在第5.5节((https://arxiv.org/html/2605.19228#S5.SS5.SSS0.Px1))展示了在无标签设置中可能的适配方法。

## 4 方法

将置信度估计扩展到逐步设置,引入了区分良性输出变异与真正推理错误的核心挑战。为了应对这一挑战,我们的方法基于一个关键见解:虽然单个正确解决方案可能在表面上有所变化,但正确的轨迹通常共享一个潜在的共同结构,反映了基本的推理模式。因此,一个稳健的归因方法必须学习识别这种共享结构,并根据每个步骤与其的一致性分配置信度分数。我们的方法通过从正确的推理轨迹中构建共识锚点来捕捉这些潜在结构。我们利用这些共识锚点来指导置信度归因,并将问题形式化在信息瓶颈(IB)原则下。

### 4.1 信息瓶颈形式化

我们将逐步置信度归因视为信息瓶颈(IB)原则的一个实例。给定一个从LLM采样的轨迹 \(T_i = \{t_{i1}, \dots, t_{iL_i}\}\),目标是在其步骤上生成一个置信度掩码 \(Z = \{c_{ij}\}_{j=1}^{L_i}\)。与具有步骤级标注的设置不同,我们无法观察到单个步骤的正确性。相反,我们只能访问每个轨迹的最终答案标签 \(z_i \in \{0,1\}\)。因此,目标 \(Y\) 必须从采样集 \(\mathcal{S} = \{ (T_i, A_i, z_i) \}\) 中推导得出。具体地,\(z_i\) 将 \(\mathcal{S}\) 划分为正确和错误子集,共识锚点 \(\mathbf{m}_{ij}\) 从 \(\mathcal{S}_{\text{correct}}\) 中聚合以近似潜在的推理结构。IB目标为 \(\min_Z I(T_i; Z) - \beta I(Z; Y)\),

相似文章

LLM置信度估计的不同方法基准测试

Reddit r/artificial

本文对LLM置信度估计的各种黑盒与白盒方法进行了基准测试,包括口头化置信度、语言不确定性、推理长度、P(Answer)、P(True)和自我一致性,比较它们在主动学习和安全分类等任务中的有效性。

置信度感知对齐让推理型大语言模型更加可靠

arXiv cs.AI

本文介绍了CASPO框架,该框架通过迭代直接偏好优化(DPO),将token级别的置信度与大型推理模型中的逐步逻辑正确性进行对齐。文章还提出了置信度感知思考(CaT),用于在推理过程中动态剪枝不确定的推理分支,以提高可靠性和效率。