我们能否信任LLM的逻辑?通过基于图的框架量化不确定性、一致性和稳健性
摘要
本文介绍了GraphEVAL,一个基于图的框架用于量化LLM推理中的不确定性,并提出了一种新的指标——图推理一致性得分(GRCS),该指标捕捉语义-结构共识并检测自信幻觉。作者还提出了图自一致性(GSC),一种优先考虑推理忠实度而非名义准确性的解码策略。
arXiv:2607.08017v1 公告类型:新
摘要:大型语言模型(LLM)可能容易出现有缺陷和不忠实的推理,而像自一致性(SC)这样的解码策略无法检测到这些,因为它们只评估最终答案的一致性而忽略了中间步骤的逻辑有效性。这引发了三个基本问题:我们如何可靠地量化LLM推理中的不确定性?与简单的多数投票相比,语义、结构和因果意识能否选择更忠实的推理?以及推理拓扑在对抗条件下有多稳健?为了解决这些问题,我们引入了GRAPHEVAL,一个基于图的推理框架,将不确定性量化(UQ)重新定义为整体推理忠实度问题。我们提出了一种新的UQ指标——图推理一致性得分(GRCS),该指标量化推理空间的语义-结构共识,并捕获病态模式崩溃和自信幻觉。我们发现GRCS是唯一一个在能力较强和较小的模型中始终与推理忠实度负相关的指标。此外,我们引入了图自一致性(GSC),一种基于质心的解码策略,用名义准确性换取推理忠实度,揭示了在较小模型中SC被不忠实的幸运猜测膨胀的程度,同时在能力较强的模型中保持或提高准确性。最后,通过对抗性质心消融,我们证明了GSC选择的路径充当了“承重路径”,迫使模型远离它会降低推理忠实度,并在特定情况下导致准确性下降。
查看缓存全文
缓存时间: 2026/07/10 06:12
# 我们能信任LLM的逻辑吗?通过基于图的框架量化不确定性、一致性和鲁棒性
来源:https://arxiv.org/html/2607.08017
Riccardo Revalor¶, Jalees Rehman‡, Debjit Pal¶
¶电气与计算机工程系 ‡生物化学与分子遗传学系
伊利诺伊大学芝加哥分校
芝加哥,IL 60607,美国
{rreva, jalees, dpal2}@uic.edu
###### 摘要
大型语言模型(LLM)容易出现有缺陷且不忠实的推理,而Self-Consistency(SC)等解码策略由于仅评估最终答案的一致性而忽略了中间步骤的逻辑有效性,因此无法检测到这些问题。这引发了三个基本问题:我们如何可靠地量化LLM推理中的不确定性?与朴素多数投票相比,语义、结构和因果意识能否选择更忠实的推理?在对抗性条件下,推理拓扑的鲁棒性如何?为解决这些问题,我们提出了GraphEVAL,一个基于图的推理框架,将不确定性量化(UQ)重新定义为**整体推理保真度**问题。我们提出了一种新的UQ度量——**图推理一致性分数(GRCS)**,它量化了推理空间的语义-结构共识,并捕获了病态模式坍缩和自信幻觉。我们发现,GRCS是唯一一个在更强大和更小的模型中均与推理保真度持续呈负相关的度量。此外,我们引入了**图自一致性(GSC)**,一种基于中心点的解码策略,它以名义准确性换取推理保真度,揭示了SC在较小模型中因不忠实的运气猜测而膨胀的程度,同时在更强大的模型中保持或提高准确性。最后,通过对抗性中心点消融,我们证明了GSC选择的路径充当了“**承重路径**”,迫使模型偏离该路径会降低推理保真度,并在特定情况下导致准确性下降。
## 1 引言
近年来,大型语言模型(LLM)通过单一模型在多个领域取得了显著成功,通常能在零样本和少样本设置下泛化到新任务(Brown等人,2020(https://arxiv.org/html/2607.08017#bib.bib3);Zhao等人,2023(https://arxiv.org/html/2607.08017#bib.bib69))。然而,它们的可信度因其倾向于产生合理但虚构的推理(俗称幻觉)而受限,且往往具有高统计置信度(Ji等人,2023(https://arxiv.org/html/2607.08017#bib.bib27))。这种可信度的缺失严重限制了它们在关键任务环境中的部署(Huang等人,2020(https://arxiv.org/html/2607.08017#bib.bib26))。为了提高LLM的性能,引入了思维链(CoT)提示(Wei等人,2022(https://arxiv.org/html/2607.08017#bib.bib63)),旨在让模型能够将复杂问题分解为中间步骤,并以类似人类的累加方式表达推理(Kahneman, 2011(https://arxiv.org/html/2607.08017#bib.bib30);Ziabari等人,2025(https://arxiv.org/html/2607.08017#bib.bib71);de Varda等人,2025(https://arxiv.org/html/2607.08017#bib.bib10))。模仿人类推理的解码策略,例如Self-Consistency(SC)(Wang等人,2023b(https://arxiv.org/html/2607.08017#bib.bib62)),已被广泛用于采样LLM答案。SC采样多条推理路径并选择最频繁的最终答案,假设推理一致性最终会导向正确性。然而,SC对最终输出应用多数投票,边缘化了不同的CoT,使其极易受到不忠实推理的影响。在某些情况下,幻觉会积极促成“运气猜测”,即LLM可能遵循有缺陷、不合逻辑甚至矛盾的推理过程,却得出正确答案。虽然答案可能正确,但该过程的不可靠性从根本上威胁了模型的可信度和鲁棒性。在错误可能导致灾难性物理(Shen等人,2023(https://arxiv.org/html/2607.08017#bib.bib55))、财务(Chen & Hu, 2025(https://arxiv.org/html/2607.08017#bib.bib5))或法律(Linna & Linna, 2026(https://arxiv.org/html/2607.08017#bib.bib38))后果的**关键任务**环境中,仅凭经验性能是不够的(Morey等人,2025(https://arxiv.org/html/2607.08017#bib.bib43))。我们假设,**量化LLM中的推理一致性和不确定性**对于确保真正的模型可信度至关重要。
最近的开创性工作,如Topo-UQ(Da等人,2025(https://arxiv.org/html/2607.08017#bib.bib9)),通过将CoT映射到拓扑图以进行不确定性量化(UQ),显著推动了该领域的发展。然而,简单的拓扑分散性往往无法捕捉模型产生幻觉的细微方式。在紧凑架构中,严重的模式坍缩(即模型以高置信度重复相同的缺陷推理捷径)仍然特别成问题(Ding等人,2024(https://arxiv.org/html/2607.08017#bib.bib13);Lin等人,2025(https://arxiv.org/html/2607.08017#bib.bib36))。为解决这些挑战,我们提出了一个基于图的推理框架——GraphEVAL,其愿景是将评估范式从最终答案共识转向**整体推理保真度**。实现这一愿景需要探索并有效解决以下三个研究问题(RQs):
**RQ1**:我们如何可靠地**量化**LLM推理过程中的不确定性,涵盖从简单到认知复杂度逐步增加的各种任务?
**RQ2**:结构和因果意识能否超越朴素多数投票,系统地过滤掉那些人为抬高标准准确性的不忠实“**运气猜测**”?
**RQ3**:在对抗性条件下,推理拓扑的**鲁棒性**如何?当模型的主导推理路径被对抗性消融时,不同表示能力的LLM如何响应?
为了回答这些问题,作为我们的主要贡献,我们在一个广泛且逐步复杂的任务谱系上设计、开发并严格测试了GraphEVAL(第3节(https://arxiv.org/html/2607.08017#S3))的以下三个组成部分。
**一种新的UQ度量**:我们提出了一种分布性不确定性度量——**图推理一致性分数(GRCS)**,基于结构-语义图编辑距离(SS-GED)。GRCS是唯一在所有模型规模上始终与推理保真度呈负相关的评估度量,有效捕捉有缺陷推理路径中的隐藏不确定性(RQ1,第5.1节(https://arxiv.org/html/2607.08017#S5.SS1))。
**GSC解码**:我们提出了**图自一致性(GSC)**,一种结构性解码策略,明确过滤掉不忠实的推理。我们通过实验证明,GSC有效隔离了人为抬高SC准确性的“运气猜测”(RQ2,第5.2节(https://arxiv.org/html/2607.08017#S5.SS2)和5.3节(https://arxiv.org/html/2607.08017#S5.SS3))。
**通过对抗性消融探测推理鲁棒性**:我们通过移除模型的主要推理拓扑(**中心点**)来研究模型推理的鲁棒性。在较小的LLM中,消融揭示了高度负相关,其中明显的准确性提升系统性地掩盖了推理崩溃,从而通过实验暴露了“运气猜测”。而能力更强的模型通过替代路径保留了其原始准确性,但仍表现出推理保真度的下降。这表明,中心点充当了可靠推理的承重结构(RQ3,第5.4节(https://arxiv.org/html/2607.08017#S5.SS4))。
## 2 背景与预备知识
**不确定性量化(UQ)与LLM**。机器学习(ML)中的传统UQ使用预测概率作为分类任务的置信度度量。对于给定输入x\\mathbf{x}和输出类y\\mathbf{y},多类问题中的置信度通常由最大概率类概括,公式化为p^\(x\)=maxcp\(y=c∣x\)\\widehat{p}\(\\mathbf{x}\)=\\max\_{c}p\(\\mathbf{y}=c\\mid\\mathbf{x}\)(Guo等人,2017(https://arxiv.org/html/2607.08017#bib.bib21))。这导出了标准的最大概率不确定性测度:UMP\(x\)=1−p^\(x\)\\text{U}\_{\\text{MP}}\(\\mathbf{x}\)=1-\\widehat{p}\(\\mathbf{x}\)。不确定性有两种类型:**认知不确定性**与模型缺乏知识相关,**偶然不确定性**源于数据中的噪声,使模型困惑(Kendall & Gal, 2017(https://arxiv.org/html/2607.08017#bib.bib31))。通过向模型提供更多输入数据,可以减少前者但无法减少后者。LLM中的主要挑战在于,认知和偶然度量无法量化多步推理的可变性及结构坍缩(Kadavath等人,2022(https://arxiv.org/html/2607.08017#bib.bib29);Liu等人,2025(https://arxiv.org/html/2607.08017#bib.bib39))。为解决此问题,**LLM中的UQ必须超越词元级别进行扩展,以评估整个推理流形的完整性**(Duan等人,2025(https://arxiv.org/html/2607.08017#bib.bib14))。
**序列级别解码**。为量化LLM输出的准确性,我们对其生成的序列进行解码。贪婪解码通过在每一步tt选择条件概率最大的词元来构建单个序列(Wei等人,2022(https://arxiv.org/html/2607.08017#bib.bib63))。虽然计算高效,但贪婪方法将模型严格锁定在单一逻辑轨迹中。如果在生成早期出现认知不确定性,则后续步骤中的错误会累积,导致次优推理路径。为缓解这些问题,SC(Wang等人,2023b(https://arxiv.org/html/2607.08017#bib.bib62))利用了这样的直觉:一个鲁棒的推理问题允许多条不同的逻辑路径,但它们最终收敛于同一正确结论。因此,SC生成一组NN个不同的中间推理路径及其对应的最终答案。然后通过对采样的推理路径应用多数投票来输出最终答案。采样路径的集合暴露了模型推理空间的结构,使得能够超越单词元概率进行分析(Zhang等人,2024b(https://arxiv.org/html/2607.08017#bib.bib68))。
**推理多样性与对抗性脆弱性**。分析中间推理流形的方差为不确定性量化提供了关键信号(Farquhar等人,2024(https://arxiv.org/html/2607.08017#bib.bib15))。采样推理路径的分布\{z1,...,zN\}\\{z\_{1},\\dots,z\_{N}\\}表现出不同程度的结构(Yao等人,2023(https://arxiv.org/html/2607.08017#bib.bib66))和逻辑(Wang等人,2023b(https://arxiv.org/html/2607.08017#bib.bib62))散布,我们称之为*推理多样性*,并使用分布的熵对其进行量化(Shannon, 1948(https://arxiv.org/html/2607.08017#bib.bib54))。低熵的LLM可能受到**模式坍缩**的影响,重复提出少量可能的推理路径(Hamilton, 2024(https://arxiv.org/html/2607.08017#bib.bib24)),而高熵的模型则表现出更多样化和创造性的推理(Wang等人,2025(https://arxiv.org/html/2607.08017#bib.bib61))。我们采用对抗性提示技术来测试生成的CoT在逻辑上是否鲁棒(Zhu等人,2024(https://arxiv.org/html/2607.08017#bib.bib70))。接下来,我们将定义第3节(https://arxiv.org/html/2607.08017#S3)中将使用的一些术语。
###### 定义1(一致性与发散性)
设G1,...,GNG\_{1},\\ldots,G\_{N}是针对给定问题qq采样的推理图,并设d:G×G→R≥0d:\\mathcal{G}\\times\\mathcal{G}\\to\\mathbb{R}\_{\\geq 0}是图距离函数。成对距离集定义为D\(q\)=\{d\(Gi,Gj\)∣1≤i0\\Delta\\text{Accuracy}\>0\)与推理保真度的**下降**(ΔFaithfulness<0\\Delta\\text{Faithfulness}\<0)相耦合。这通过实验捕捉了“运气猜测”现象。当被强制偏离其主要的承重路径时,GLLM可能仍能得出正确答案,但主要是通过有缺陷或幻觉的中间推理,而非有效的替代演绎。相比之下,DeepSeek R1未显示出显著的线性关联(r=−0.01r=-0.01, p=0.856p=0.856)。然而,15.2%的点仍聚集在Δ\\DeltaAccuracy=0=0附近,同时分布在负的ΔFaithfulness\\Delta\\text{Faithfulness}值上(最低降至−1.0-1.0),表明保真度轻度损失,但未出现系统性准确性下降。这与附录C.8(https://arxiv.org/html/2607.08017#A3.SS8)中的结果一致,其中该GLLM展现出更广泛、高熵的推理拓扑。
这些结果表明,GSC中心点通常充当承重路径,尤其是在较小的GLLM中,负相关表明准确性提升与保真度下降相关,从而通过实验揭示了运气猜测。
请参见图注
图5:StrategyQA的群体级消融。中心点消融通常使准确性保持不变(ΔAccuracy=0\\Delta\\text{Accuracy}=0),同时降低所有GLLM的保真度。在较小的GLLM中,高度负相关表明准确性提升往往反映的是不忠实的“运气猜测”,而非有效的恢复。
## 6 相关工作
随着LLM被部署到各种任务中,UQ对于确保可信使用变得至关重要,尤其是在安全关键环境中。在此背景下,Kuhn等人(2023(https://arxiv.org/html/2607.08017#bib.bib34))引入了*语义熵*,它估计语义似然并判断不同输出是否表达相同答案。Farquhar等人(2024(https://arxiv.org/html/2607.08017#bib.bib15))基于此概念,展示了语义熵是*幻觉检测*的有效工具,通过根据意义对多次生成进行聚类并测量这些语义聚类上的不确定性。Lin等人(2024(https://arxiv.org/html/2607.08017#bib.bib37))使用图拉普拉斯特征值研究输出不确定性,利用从采样响应构建的语义相似性图的谱性质。
然而,所有这些方法都是在最终输出层面量化不确定性,忽略了导致每个答案的推理拓扑。
在推理框架中,*思维树*(Yao等人,2023(https://arxiv.org/html/2607.08017#bib.bib66))搜索多个推理分支,而基于图的推理可以捕捉比链或树更丰富的依赖关系(Besta等人,2024(https://arxiv.org/html/2607.08017#bib.bib2))。然而,这些方法旨在指导推理,而非对采样的CoT进行建模、跨它们量化不确定性或根据其结构进行解码。
更详细的相关工作讨论请参见附录E(https://arxiv.org/html/2607.08017#A5)。
## 7 结论
我们认为,LLM的可信度不能仅凭答案一致性来判断。通过将采样的CoT建模为DAG,我们展示了推理结构揭示了关于不确定性、保真度和鲁棒性的信号。GRCS成为了一种强大的不确定性度量,GSC作为SC的更忠实替代方案,而中心点则作为承重推理路径。这些发现促使在关键任务环境中向推理级别分析的转变。
**局限性**:GraphEVAL具有比SC(O\(N\)\\mathcal{O}\(N\))更高的时间复杂度(O\(N2⋅m3\)\\mathcal{O}\(N^{2}\\cdot m^{3}\);NN:CoT数量,mm:DAG节点数),尽管与Topo-UQ等基线相当。此外,正如我们的实验所展示的(参见第5.1节(https://arxiv.org/html/2607.08017#S5.SS1)和5.4节(https://arxiv.org/html/2607.08017#S5.SS4)),统计强度……相似文章
通过结构不确定性量化LLM逻辑推理的一致性
本文引入结构不确定性框架,通过测量采样推理解中自偏好排名的稳定性来评估LLM推理一致性,补充了传统的答案离散度方法,用于识别不可靠的推理。
超越语义等价:用于LLM不确定性量化的逻辑图
本文提出逻辑图不确定性(LGU)框架,该框架对答案之间的蕴含关系与不相容性进行建模,以改进大语言模型的不确定性估计。在多个基准测试中,LGU相较语义熵基线方法,AUROC最高提升7.1%,AUARC最高提升3.5%。
LGMT:基于逻辑的变形测试用于评估LLM推理可靠性
本文介绍了LGMT,这是一个利用一阶逻辑生成语义不变测试用例以评估LLM推理可靠性的框架。在六个LLM上的实验表明,LGMT暴露了静态基准遗漏的隐藏缺陷,提示评估应侧重于逻辑不变性下的鲁棒性。
Debate-on-Graph: 基于不确定知识图谱的大型语言模型可靠自适应推理
Debate-on-Graph (DoG) 是一个框架,通过利用带有置信度的不确定知识图谱 (UKG) 增强 LLM 推理,采用启发式搜索和多智能体辩论机制生成可靠答案。在四个 QA 基准测试中达到最先进性能。
REAL: 一种用于LLMs长期记忆管理的推理增强图框架
REAL是一种用于LLMs长期记忆管理的推理增强图框架,它利用时间与置信度感知的有向属性图,采用非破坏性时间更新和混合波束搜索检索,平均性能提升22.72%。