通过结构不确定性量化LLM逻辑推理的一致性
摘要
本文引入结构不确定性框架,通过测量采样推理解中自偏好排名的稳定性来评估LLM推理一致性,补充了传统的答案离散度方法,用于识别不可靠的推理。
arXiv:2606.17312v1 公告类型:新
摘要:大语言模型可能通过不稳定、矛盾或难以一致排名的推理路径得出相同答案——这种失败模式在多步演绎推理中尤为普遍。现有方法主要通过输出离散度(衡量采样答案的差异程度)来评估可靠性,但这忽略了一个互补信号:模型能否持续对竞争性推理候选方案进行排名。我们提出结构不确定性,这是一个基于采样推理方案上自偏好排名稳定性的、考虑一致性的框架。给定一个查询,我们生成多个候选方案,并要求模型对自己的输出进行两两偏好判断。我们通过基于PageRank的Bradley-Terry模型将自偏好聚合为排名分布,并将信号分解为两个基于熵的分量:试验间的排名不稳定性和试验内的候选模糊性。在五个LLM和八个基准测试中,结构信号提供了与答案离散度互补的信息:在逻辑和数学推理任务中,两者结合提高了对不可靠实例的识别;而在事实检索中,结构信号趋于均匀,诊断出一个区域边界,在该边界上推理级一致性评估是无效的。这两个分量与准确性的关系不同:试验内模糊性与正确性正相关——这与多个合理方案路径保持竞争性的设置一致——而试验间不稳定性则负相关,标志着不可靠的推理。结构不确定性最好不理解为通用的置信度估计器,而是作为逻辑推理一致性的区域敏感评估器。
查看缓存全文
缓存时间: 2026/06/17 05:35
# 量化LLM逻辑推理中的一致性:基于结构不确定性
来源:https://arxiv.org/html/2606.17312
Baishali Chaudhury, Mengdie Flora Wang, Hyunji Hayley Park, Rahul Ghosh, Sungmin Hong, Jae Oh Woo
AWS Generative AI Innovation Center
\{baishch, florawan, parhyunj, rahulgh, hsungmin, jaeohwoo\}@amazon\.com
###### 摘要
大型语言模型可能通过不稳定、矛盾或难以一致排序的推理路径得出相同答案——这种失败模式在多步演绎推理中尤为常见。现有方法主要通过输出分散性(即衡量采样答案之间的差异程度)来评估推理可靠性,但这种视角丢弃了一个互补信号:模型是否能一致地排序竞争性的推理候选方案。我们提出**结构不确定性(structural uncertainty)**,这是一种基于对采样推理解决方案的自我偏好诱导排序稳定性的、关注一致性的评估框架。给定一个查询,我们生成多个候选方案,并让同一模型在其自身输出之间判断成对偏好。我们通过带有PageRank的Bradley–Terry模型将稀疏的自我偏好聚合成排序分布,并将信号分解为两个互补的基于熵的分量——**跨试验排序不稳定性**和**试验内候选歧义性**。在五个LLM和八个基准测试上,结构信号提供了与答案分散性互补的信息:在逻辑和数学推理任务中,两者结合能更好地识别不可靠的推理实例;而在事实检索任务中,结构信号趋向均匀,标志着推理级别一致性评估无效的机制边界。这两个分量与准确性的关系不同:试验内歧义性与推理任务上的正确性呈正相关——这与多个合理解决路径保持竞争的情况一致;而跨试验不稳定性则与正确性呈负相关,标志着推理不可靠。结构不确定性最好被理解为一种对逻辑推理一致性的机制敏感评估器,而非通用的置信度估计器。
## 1 引言
参考图注
图1:一个对比分散性评估与结构一致性评估的示例。(a) 当所有五个采样推理候选都同意同一个错误答案(20)时,分散性方法报告零熵和低不确定性,因为它们不使用候选之间的偏好排序信息。(b) 我们的结构方法要求模型在独立试验中对其自身推理输出进行排序。排序完全不稳定(r3从第1位变为第5位),揭示了仅靠答案分散性无法反映的推理不一致性。
大型语言模型在自然语言理解和生成方面取得了显著进展,但其逻辑推理能力仍然是一个重大瓶颈Xionget al\. (2024 (https://arxiv.org/html/2606.17312#bib.bib42)); Tianet al\. (2023 (https://arxiv.org/html/2606.17312#bib.bib20)); Kapooret al\. (2024 (https://arxiv.org/html/2606.17312#bib.bib16)); Zhouet al\. (2024 (https://arxiv.org/html/2606.17312#bib.bib44))。模型经常产生看似逻辑合理但实际上内部不一致的答案——通过不同的有缺陷推理路径得出相同的错误结论,或者在要求比较自身解决方案时无法保持稳定的偏好。评估逻辑推理可靠性不仅需要评估答案级别的正确性,还需要评估推理过程本身的*一致性*。虽然我们不直接建模跨问题矛盾,但我们的框架针对的是一个密切相关的的一致性问题:模型是否能稳定地评估同一查询的竞争性推理候选。现有的后验评估方法 (Linet al\.,2023 (https://arxiv.org/html/2606.17312#bib.bib3); Farquharet al\.,2024 (https://arxiv.org/html/2606.17312#bib.bib4); Wanget al\.,2024a (https://arxiv.org/html/2606.17312#bib.bib24); Lyuet al\.,2025 (https://arxiv.org/html/2606.17312#bib.bib2)) 将采样响应视为可交换的,并从答案*差异*程度(即输出分散性)评估可靠性。这种观点把握了推理可靠性的一个维度,但丢弃了一个互补信号:候选推理解决方案之间偏好的*结构一致性*。对于逻辑推理,这种遗漏是有后果的,因为多个候选可能共享相同的最终答案,但在推理质量、连贯性或相互一致性上存在差异;忽略这种结构会丢失关于模型更偏好哪些解决方案以及这些偏好有多稳定的信息。图1 (https://arxiv.org/html/2606.17312#S1.F1) 展示了这一差距:当所有采样响应都同意同一个错误答案时,分散性方法报告低不确定性,而跨试验的自我偏好排序可以揭示仅靠分散性无法反映的不稳定性。
我们提出一种关注一致性的逻辑推理评估框架,该框架通过测量对采样候选解决方案的自我偏好诱导排序的稳定性。给定一个查询,我们采样多个推理候选,并让*同一模型*在其自身输出之间判断成对偏好。除了响应*差异*多大之外,这还探测了模型是否对竞争性推理路径形成了稳定或波动的偏好排序——这是分散性单独丢弃的信号。我们通过带有PageRank归一化 (Langville and Meyer,2006 (https://arxiv.org/html/2606.17312#bib.bib38)) 的Bradley–Terry模型 (Bradley and Terry,1952 (https://arxiv.org/html/2606.17312#bib.bib34)) 将稀疏的成对判断聚合成排序分布,并在随机生成树比较试验中重复进行。这产生了结构不确定性的两个不同分量:**跨试验排序不稳定性**(不同引起试验间的推理不稳定性)和**试验内候选歧义性**(每个试验内竞争性推理候选之间的歧义性)。在五个LLM和八个基准测试上,我们表明自我偏好导出的结构信号提供了与输出分散性互补的信息。与准确性的交互是任务相关的:在数学推理中,试验内歧义性可能与正确性正相关——这与几个合理解决路径保持竞争的情况一致;而在事实检索中,结构信号趋向均匀,标志着推理级别一致性评估无效的机制。结合结构信号和分散性信号改进了在若干推理和知识任务上识别不可靠推理实例的能力,尽管在崩溃机制中未见增益。
##### 贡献。 (1) 一个评估逻辑推理一致性和可靠性的后验框架。我们提出一个模型无关的框架,通过测量模型对其自身候选解决方案的自我偏好排序的稳定性来量化推理一致性,提供了一个与输出分散性互补的可观测信号。 (2) 推理稳定性的结构分解。我们通过带有PageRank的Bradley–Terry模型将稀疏的成对自我偏好聚合成排序分布,得到两个互补的基于熵的分量:跨试验排序不稳定性(推理不稳定性)和试验内候选歧义性(竞争性推理候选之间的歧义性)。 (3) 区分推理与检索设置的机制分析。在五个LLM和八个基准测试上,我们表明结构信号在推理任务上补充了分散性,识别了信号在检索任务上何时以及为何崩溃,并刻画了每种信号类型在评估逻辑推理一致性时最有效的任务条件。
## 2 相关工作
##### LLM中的逻辑推理与自一致性。 思维链提示和自一致性 (Wanget al\.,2023 (https://arxiv.org/html/2606.17312#bib.bib59)) 已成为改进和评估LLM推理的标准方法。自一致性衡量多个采样推理路径之间的协议,而辩论和自我判断框架 (Zhenget al\.,2023 (https://arxiv.org/html/2606.17312#bib.bib57); Kadavathet al\.,2022 (https://arxiv.org/html/2606.17312#bib.bib58)) 表明模型可以评估输出质量。然而,自一致性将响应视为可交换的,仅衡量答案级别的协议,忽略了候选之间推理质量的结构差异。我们通过测量模型通过自我偏好稳定地对竞争性推理解决方案进行排序的程度,来补充答案级别的一致性。
##### 后验不确定性与基于偏好的评估。 基于分散性的方法从响应之间的语义变化 (Kuhnet al\.,2023 (https://arxiv.org/html/2606.17312#bib.bib60); Linet al\.,2023 (https://arxiv.org/html/2606.17312#bib.bib3); Farquharet al\.,2024 (https://arxiv.org/html/2606.17312#bib.bib4); Kossenet al\.,2024 (https://arxiv.org/html/2606.17312#bib.bib5))、输出密度 (Qiu and Miikkulainen,2024 (https://arxiv.org/html/2606.17312#bib.bib6))、核化熵 (Nikitinet al\.,2024 (https://arxiv.org/html/2606.17312#bib.bib7)) 或自一致性熵 (Wanget al\.,2024a (https://arxiv.org/html/2606.17312#bib.bib24); Lyuet al\.,2025 (https://arxiv.org/html/2606.17312#bib.bib2)) 中估计不确定性。基于比较的方法将成对偏好聚合成校准分数 (Shrivastavaet al\.,2025 (https://arxiv.org/html/2606.17312#bib.bib10)) 或通过多维表示 (Chenet al\.,2025 (https://arxiv.org/html/2606.17312#bib.bib12))、知识图谱 (Yuanet al\.,2025 (https://arxiv.org/html/2606.17312#bib.bib11)) 或最小贝叶斯风险 (Vashurinet al\.,2025a (https://arxiv.org/html/2606.17312#bib.bib33)) 融入更丰富的结构。当可以访问内部时,基于logit (Maet al\.,2025 (https://arxiv.org/html/2606.17312#bib.bib13))、思维链 (Zhang and Zhang,2025 (https://arxiv.org/html/2606.17312#bib.bib14)) 和基于代理的方法 (Leeet al\.,2024 (https://arxiv.org/html/2606.17312#bib.bib15)) 从模型内部推导不确定性。信息论和贝叶斯视角激发了原则性的分解 (Abbasi Yadkoriet al\.,2024 (https://arxiv.org/html/2606.17312#bib.bib1); Kendall and Gal,2017 (https://arxiv.org/html/2606.17312#bib.bib40); Woo,2022 (https://arxiv.org/html/2606.17312#bib.bib43);2023 (https://arxiv.org/html/2606.17312#bib.bib30))。我们的方法在完全黑盒设置下运行,无需内部访问或模型修改。
##### LLM输出中的一致性与矛盾。 越来越多的研究关注LLM输出中的逻辑矛盾和前后不一致。评估框架衡量不确定性与质量之间的对齐 (Huanget al\.,2024 (https://arxiv.org/html/2606.17312#bib.bib21); Yeet al\.,2024 (https://arxiv.org/html/2606.17312#bib.bib22); Vashurinet al\.,2025b (https://arxiv.org/html/2606.17312#bib.bib32)),而研究揭示了LLM可靠性具有很强的任务依赖性和模型依赖性 (Huanget al\.,2023 (https://arxiv.org/html/2606.17312#bib.bib23); Yanget al\.,2025 (https://arxiv.org/html/2606.17312#bib.bib31))。我们的工作通过为推理一致性提供结构视角来促进这一方向:我们不检查输出在答案级别是否相互矛盾,而是测量模型是否能对其自身推理候选形成稳定的偏好排序——直接揭示推理评估中的内部不一致性。与通过符号模块或外部求解器改进推理的方法不同,我们专注于在黑盒设置中对推理一致性进行后验评估。
参考图注
图2:关注一致性的推理评估框架概览。给定一个查询,我们 (1) 生成多样的候选推理解决方案,(2) 引出成对自我偏好,(3) 通过成对偏好模型(Bradley–Terry或TrueSkill)结合PageRank聚合成全局排序,以及 (4) 通过随机生成树采样分解一致性信号。
## 3 方法
我们的框架通过测量对采样候选解决方案的自我偏好诱导排序的稳定性来量化逻辑推理的一致性。我们的一致性概念是**同查询、候选相对**的:我们询问模型是否对同一问题的多个推理解决方案形成了稳定的偏好排序。给定一个查询,我们: (1) 生成N个多样的候选推理解决方案, (2) 通过让模型判断其自身输出来引出成对自我偏好, (3) 通过带有PageRank的Bradley–Terry模型将偏好聚合成全局排序,以及 (4) 通过随机生成树采样将一致性信号分解为跨试验和试验内分量。图2 (https://arxiv.org/html/2606.17312#S2.F2) 展示了该流程。
### 3.1 通过生成树实现自我偏好
给定输入x,我们通过多样提示和随机解码从模型的条件分布p_θ(·|x)中采样N个候选R(x)={r_1, ..., r_N}。我们不比较所有N选2对,而是对M个独立试验(m=1,...,M)重复以下步骤:
**稀疏图采样**。我们在N个候选上抽取一个均匀随机生成树T^{(m)},得到一个正好有N-1条边的连通图。这保证了全局连通性,同时注入跨试验的结构随机性,其精神类似于图结构(而非权重)上的蒙特卡洛dropout。
**自我偏好引出**。对于每条边(i,j)∈T^{(m)},我们查询*同一模型*以判断哪个响应更好,并可选择获取置信度分数。这些引出的自我偏好判断跨试验的一致性提供了一个无法直接从输出分散性中获得的额外不确定性信号。
**偏好聚合**。我们在N-1个观测比较上拟合一个成对偏好模型(Bradley–Terry或TrueSkill),以推断所有N^2对对的胜率,然后通过PageRank聚合成全局排序分布π^{(m)}。细节见第3.2节。来自M个试验的集合{π^{(m)}}_{m=1}^M使得第3.3节中的不确定性分解成为可能。
### 3.2 偏好聚合
**带L2正则化的Bradley–Terry**。我们为每个候选i赋予一个潜在效用θ_i∈R,并将成对偏好建模为 (Bradley and Terry,1952 (https://arxiv.org/html/2606.17312#bib.bib34)):
P(i ≻ j) = exp(θ_i) / (exp(θ_i) + exp(θ_j)). (1)
由于生成树允许完全的全序,未正则化的最大似然目标是无界的 (Ford,1957 (https://arxiv.org/html/2606.17312#bib.bib50))。我们添加一个L2惩罚以保证数值适定性:
L_reg(θ) = Σ_{(i,j)∈T^{(m)}} log P(i ≻ j) - (1/(2C)) ||θ||^2, (2)
其中C>0是逆正则化强度。我们根据消融实验(附录A.3)设置C=1:p
(注意:原文在公式后中断,根据上下文,剩余部分可能涉及PageRank聚合和不确定性分解,但用户提供的文本在此处截断。我们需要忠实地翻译提供的部分,并在意识到截断后,按原文内容继续翻译剩余部分,直到用户提供的文本结束。用户提供的文本在“C=1\)based on an ablation sweep \(AppendixA\.3 (https://arxiv.org/html/2606.17312#A1.SS3)\): p”处结束,但似乎不完整。然而,作为翻译,我们应严格按提供的文本输出。可能用户打算让我们翻译整个文件,但只提供了部分。由于指令是“Translate the given markdown article content”,我们只能翻译已提供的部分。所以输出到此处结束。)相似文章
我们能否信任LLM的逻辑?通过基于图的框架量化不确定性、一致性和稳健性
本文介绍了GraphEVAL,一个基于图的框架用于量化LLM推理中的不确定性,并提出了一种新的指标——图推理一致性得分(GRCS),该指标捕捉语义-结构共识并检测自信幻觉。作者还提出了图自一致性(GSC),一种优先考虑推理忠实度而非名义准确性的解码策略。
量化LLM基准中的排名不确定性
本文分析了MMLU等LLM基准中排名不确定性的来源,提出了对假设检验的修改,以构建排名置信区间,并表明不同主题间的变异性很大。
超越语义等价:用于LLM不确定性量化的逻辑图
本文提出逻辑图不确定性(LGU)框架,该框架对答案之间的蕴含关系与不相容性进行建模,以改进大语言模型的不确定性估计。在多个基准测试中,LGU相较语义熵基线方法,AUROC最高提升7.1%,AUARC最高提升3.5%。
重新审视LLM推理中的均匀信息密度假设
本文重新审视了LLM推理背景下的均匀信息密度(UID)假设,引入了一个基于熵的框架来量化信息流的均匀性。在七个推理基准上的实验发现,高质量的推理在步骤过渡上表现出局部均匀性,但在轨迹结构上呈现全局非均匀性,这表明LLM推理与人类交流模式存在根本性差异。
面向多LLM系统中不确定性感知的信任估计方法:基于结构化专家判断
本文介绍了一种面向多LLM预测聚合的不确定性感知信任估计方法,该方法改编自结构化专家判断,采用库克风格对数加权来惩罚过度自信的错误预测。在MMLU和MMLU-Pro上的评估表明,该方法在异构和受污染的专家面板下实现了优越的准确性与可靠性平衡。