Debate-on-Graph: 基于不确定知识图谱的大型语言模型可靠自适应推理
摘要
Debate-on-Graph (DoG) 是一个框架,通过利用带有置信度的不确定知识图谱 (UKG) 增强 LLM 推理,采用启发式搜索和多智能体辩论机制生成可靠答案。在四个 QA 基准测试中达到最先进性能。
arXiv:2607.17266v1 公告类型:新
摘要:大型语言模型(LLM)在自然语言处理中展现出卓越能力。然而,在处理问答(QA)任务时,LLM 常出现幻觉且缺乏相关知识。为缓解这些问题,知识图谱(KG)被用于增强 LLM 推理。但 KG 常包含噪声和错误,而现有的 KG 增强 LLM 方法通常无法识别和过滤这些噪声与错误内容,反而可能放大幻觉,给可靠推理带来挑战。不确定知识图谱(UKG)为每个三元组关联一个置信度分数以量化不确定性,为解决这一挑战提供了有希望的方向。与先前工作相比,我们研究如何利用 UKG 支持 LLM 进行问答。我们提出 Debate-on-Graph (DoG) 这一新框架,使 LLM 和 UKG 能自适应协作以实现可靠推理。具体而言,我们首先设计了一种专为 UKG 定制的启发式搜索算法,以提取可靠且与问题相关的子图,从而减少检索知识中的噪声和错误。随后引入多智能体辩论机制,通过自适应对抗辩论产生可靠答案,旨在充分利用 UKG 中的知识,同时保留检索证据的可靠性。在四个基准 QA 数据集上的大量实验表明,DoG 在现有 LLM 推理方法和基于 KG 的基线上达到了最先进的性能,同时实现了可靠且自适应的推理。我们的代码可在 https://github.com/seucoin/Debate-on-Graph 获取。
查看缓存全文
缓存时间: 2026/07/21 06:45
# 图上的辩论:大语言模型在不确定知识图谱上的可靠与自适应推理
来源:https://arxiv.org/html/2607.17266
11institutetext:东南大学计算机科学与工程学院,南京,中国 11email:\{213232231,213231269,tianxingwu\}@seu\.edu\.cn 22institutetext:新一代人工智能技术及其跨学科应用重点实验室(东南大学),教育部,中国
###### 摘要
大语言模型(LLMs)在自然语言处理中展现了卓越的能力。然而,在处理问答(QA)任务时,LLMs 常常出现幻觉和缺乏相关知识的问题。为了缓解这些问题,知识图谱(KGs)被用于增强 LLM 的推理能力。然而,KG 通常包含噪声和错误,而现有的 KG 增强 LLM 方法一般无法识别并过滤这类噪声和错误内容,这反而可能加剧幻觉,并给可靠推理带来挑战。不确定知识图谱(UKGs)为每个三元组关联一个置信度分数来量化不确定性,为解决这一挑战提供了有前景的方向。与先前工作相比,我们研究如何利用 UKG 来支持 LLM 进行问答。我们提出了 **图上的辩论**(DoG),一个新颖的框架,使 LLM 和 UKG 能够自适应协作以实现可靠推理。具体来说,我们首先设计了一种针对 UKG 的启发式搜索算法,以提取可靠且与问题相关的子图,从而减少检索知识中的噪声和错误。然后,我们引入了一种多智能体辩论(Multi-Agent Debate)机制,通过自适应对抗性辩论产生可靠答案,旨在充分利用 UKG 中的知识,同时保持检索证据的可靠性。在四个基准 QA 数据集上的大量实验表明,DoG 在现有 LLM 推理方法和基于 KG 的基线方法上达到了最先进的性能,同时实现了可靠且自适应的推理。我们的代码可在 https://github.com/seucoin/Debate-on-Graph 获取。
## 1 引言
大语言模型(LLMs)在自然语言处理中展现了卓越的能力 [2 (https://arxiv.org/html/2607.17266#bib.bib22),14 (https://arxiv.org/html/2607.17266#bib.bib16),31 (https://arxiv.org/html/2607.17266#bib.bib19),40 (https://arxiv.org/html/2607.17266#bib.bib15)]。然而,在处理问答(QA)任务时,LLMs 常常会出现幻觉 [15 (https://arxiv.org/html/2607.17266#bib.bib31)] 和缺乏相关知识的问题,这会削弱其回答的可靠性。为了缓解这些问题,知识图谱(KGs)[12 (https://arxiv.org/html/2607.17266#bib.bib35)](以三元组形式描述现实世界事实,表示为 `(head,relation,tail)` 或 `(h,r,τ)`)被频繁用于增强 LLM 的推理能力 [26 (https://arxiv.org/html/2607.17266#bib.bib25),16 (https://arxiv.org/html/2607.17266#bib.bib2)]。作为一种结构化且非参数化的外部知识源,KG 提供了一种补充策略来缓解 LLM 固有的局限性 [18 (https://arxiv.org/html/2607.17266#bib.bib47),21 (https://arxiv.org/html/2607.17266#bib.bib30)]。
先前关于 KG 增强 LLM 推理的研究大致可分为两类:**基于检索** 和 **基于智能体** 的方法 [17 (https://arxiv.org/html/2607.17266#bib.bib3)]。基于检索的方法 [16 (https://arxiv.org/html/2607.17266#bib.bib2),37 (https://arxiv.org/html/2607.17266#bib.bib28),19 (https://arxiv.org/html/2607.17266#bib.bib4)] 使用外部检索器从 KG 中获取相关事实,并将其融入 LLM 输入中进行推理;而基于智能体的方法 [26 (https://arxiv.org/html/2607.17266#bib.bib25),30 (https://arxiv.org/html/2607.17266#bib.bib26),10 (https://arxiv.org/html/2607.17266#bib.bib27)] 将 LLM 视为智能体,直接与 KG 交互,从初始实体开始,迭代地探索推理路径,直到 LLM 认为增强的知识足够为止。
然而,由于自动过程已广泛应用于 KG 的构建,它们可能经常包含噪声和事实错误 [43 (https://arxiv.org/html/2607.17266#bib.bib43)]。尽管取得了显著进展,两类 KG 增强方法对这些不完善之处仍然敏感,给可靠推理带来了挑战。具体来说,在基于检索的方法中,检索器可能检索到不相关或不正确的事实,从而误导生成;在这种情况下,注入的证据不仅不能减少幻觉,反而可能加剧幻觉 [19 (https://arxiv.org/html/2607.17266#bib.bib4)]。对于基于智能体的方法,噪声或错误的三元组可能在早期交互步骤中误导 LLM,使得整个多步过程不可靠 [26 (https://arxiv.org/html/2607.17266#bib.bib25)]。
不确定知识图谱(UKGs)最近受到越来越多的关注,非常适合捕捉现实世界场景中固有的不确定性。UKG 为每个三元组关联一个置信度分数来量化不确定性,该分数表示该三元组为真的概率 [3 (https://arxiv.org/html/2607.17266#bib.bib41),24 (https://arxiv.org/html/2607.17266#bib.bib12)]。因此,每个事实从三元组 `(h,r,τ)` 扩展为四元组 `(h,r,τ,c)`。例如,`(Twitter, competeswith, Facebook, 0.85)` 表示“Twitter 与 Facebook 竞争”这一事实的概率为 0.85。这种设计捕捉了现实世界知识的固有不确定性,为识别和过滤噪声或错误知识铺平了道路,为可靠推理开辟了新的机遇。
与先前工作相比,我们研究如何利用 UKG 来辅助 LLM 进行 QA(即 UKGQA 任务),以实现可靠推理。这里的一个关键新挑战是 **如何充分利用 UKG 中的知识,同时保持检索证据的可靠性**,因为知识效用和可靠性之间始终存在权衡。我们提出,理想的方法应适应每个问题,在知识效用和可靠性之间取得平衡,并利用这种平衡来引导检索,从而使 LLM 能够减少幻觉,进行可靠且有效的推理。
为了应对这一挑战,我们提出了 **图上辩论**(Debate-on-Graph, DoG),一个新颖的框架,使 LLM 和 UKG 能够自适应协作以实现可靠推理。具体来说,我们首先设计了一种针对 UKG 的启发式搜索算法,以提取可靠且与问题相关的子图,从而减少检索知识中的噪声和错误。该算法还支持可调超参数,必要时动态扩展子图。然后,我们引入了一种多智能体辩论(Multi-Agent Debate, MAD)机制 [9 (https://arxiv.org/html/2607.17266#bib.bib36),13 (https://arxiv.org/html/2607.17266#bib.bib37)],包含四个角色:支持者智能体(Proponent Agent)、挑战者智能体(Challenger Agent)、决策智能体(Decision-Making Agent)和法官智能体(Judge Agent)。支持者和挑战者在信息不对称的设置下进行对抗性辩论,这减少了 LLM 对检索内容的过度依赖,并提高了对噪声或错误事实的鲁棒性。决策智能体随后决定是扩展子图还是终止辩论,旨在充分利用 UKG 的同时保持检索的可靠性。最后,法官智能体综合辩论结果,确定最终答案。
总的来说,我们工作的贡献体现在三个方面:
- − 我们提出了 Debate-on-Graph,一个新颖的框架,促进 LLM 和 UKG 之间的自适应协作,以实现可靠推理。
- − 我们提出了一种针对 UKG 的启发式搜索算法,能够动态提取可靠且与问题相关的子图,从而减少检索知识中的噪声和错误。
- − 我们设计了一种基于 MAD 的答案生成策略,通过 LLM 与 UKG 子图的自适应交互来引导 LLM 产生可靠答案,旨在充分利用 UKG 的同时保持检索的可靠性。
## 2 相关工作
### 2.1 不确定知识图谱
确定性知识图谱(DKGs),如 Freebase [1 (https://arxiv.org/html/2607.17266#bib.bib38)] 和 Wikidata [32 (https://arxiv.org/html/2607.17266#bib.bib40)],由确定性事实组成,已被用于不同的应用 [11 (https://arxiv.org/html/2607.17266#bib.bib57),7 (https://arxiv.org/html/2607.17266#bib.bib56),25 (https://arxiv.org/html/2607.17266#bib.bib55)]。相比之下,UKG 为每个三元组关联一个置信度分数,从而捕捉现实世界知识的普遍不确定性和模糊性。UKG 的代表性示例包括 NELL [3 (https://arxiv.org/html/2607.17266#bib.bib41)] 和 ConceptNet [24 (https://arxiv.org/html/2607.17266#bib.bib12)]。
近年来,UKG 补全任务(包括置信度预测和链接预测)越来越受到关注 [33 (https://arxiv.org/html/2607.17266#bib.bib48)]。当前该领域的研究 [5 (https://arxiv.org/html/2607.17266#bib.bib50),8 (https://arxiv.org/html/2607.17266#bib.bib51),41 (https://arxiv.org/html/2607.17266#bib.bib44),6 (https://arxiv.org/html/2607.17266#bib.bib53),39 (https://arxiv.org/html/2607.17266#bib.bib49)] 主要侧重于常规关系学习,即嵌入实体和关系,同时保留图结构和置信度信息。此外,最近的研究将焦点扩展到小样本关系学习,以应对现实世界 UKG 中常见的长尾关系分布 [43 (https://arxiv.org/html/2607.17266#bib.bib43),34 (https://arxiv.org/html/2607.17266#bib.bib52)]。然而,利用 UKG 支持 LLM 进行 QA 的任务尚未得到探索。UKG 对于许多下游应用至关重要,例如饮食推荐 [23 (https://arxiv.org/html/2607.17266#bib.bib46)] 和上肢运动恢复 [38 (https://arxiv.org/html/2607.17266#bib.bib45)]。
### 2.2 KG 增强的 LLM 推理
为了缓解 LLM 固有的幻觉和知识空白,将 KG 与 LLM 集成已成为一个关键的研究方向 [21 (https://arxiv.org/html/2607.17266#bib.bib30),4 (https://arxiv.org/html/2607.17266#bib.bib54)]。现有的方法主要可分为 **基于检索** 和 **基于智能体** 两种范式。
基于检索的方法侧重于从 KG 中识别和提取相关知知识,以增强 LLM 的输入上下文。该领域的早期工作通常直接将知识三元组线性化,而近期的进展则利用了图的结构信息。例如,MindMap [37 (https://arxiv.org/html/2607.17266#bib.bib28)] 利用 KG 为 LLM 引出认知图,从而揭示推理路径。RoG [16 (https://arxiv.org/html/2607.17266#bib.bib2)] 生成关系路径作为计划,以检索有效的推理子图。类似地,GNN-RAG [19 (https://arxiv.org/html/2607.17266#bib.bib4)] 使用图神经网络来检索候选答案并提取连接问题实体的最短路径。虽然这些方法在直接事实检索方面很有效,但它们常常忽略 KG 内部丰富的结构依赖性,并且难以处理检索到的无关信息引入的噪声。
相比之下,基于智能体的方法将 LLM 视为一个自主智能体,以交互方式探索 KG 以进行复杂推理。与静态检索步骤不同,这些方法迭代地导航图结构以定位答案。例如,ToG [26 (https://arxiv.org/html/2607.17266#bib.bib25)] 实现了一种束搜索策略,使 LLM 能够逐步发现推理路径。PoG [30 (https://arxiv.org/html/2607.17266#bib.bib26)] 专注于修剪无关信息,以增强推理过程的忠实度和可解释性。KARPA [10 (https://arxiv.org/html/2607.17266#bib.bib27)] 利用 LLM 的全局规划能力来预规划关系路径,通过嵌入模型进行匹配,并聚合它们以避免逐步的局部最优。然而,基于智能体的范式容易出错,因为在交互过程中遇到的噪声或错误三元组可能会显著误导 LLM 在 KG 上的整个轨迹。
## 3 预备知识
在本节中,我们介绍贯穿全文的基本概念和符号。
###### 定义 1(不确定知识图谱)
不确定知识图谱定义为 `G(E,R,T)`,其中 `E`、`R` 和 `T` 分别表示实体集、关系集和不确定知识三元组集。
每个三元组 `t ∈ T` 是一个四元组:
```
t = (h, r, τ, c), h, τ ∈ E, r ∈ R, c ∈ (0,1],
```
(1)
其中 `c` 是置信度分数,表示三元组为真的概率。
###### 定义 2(不确定知识图谱问答)
给定自然语言问题 `Q` 和 UKG `G`,不确定知识图谱问答是一项任务,旨在设计一个函数 `f`,利用来自 `G` 的知识预测答案 `a`,即 `a = f(Q, G)`。
###### 定义 3(主题实体)
主题实体是一组实体:`E_topic = {e1, e2, ..., eJ}`,它们与基于 UKG 的问题相关,其中 `ej ∈ E` 表示问题 `Q` 中的第 `j` 个实体。
主题实体集可以通过命名实体识别(NER)和实体链接技术获得。
###### 定义 4(推理路径)
从实体 `u` 到实体 `v` 的推理路径是一个有序的三元组序列:
```
p = ⟨t1, t2, ..., tk⟩,
```
(2)
其中每个三元组的形式为 `ti = (hi, ri, τi, ci)`,且 `h1 = u, τk = v, τi = hi+1` 对于 `i = 1, ..., k-1`。
###### 定义 5(路径置信度)
给定推理路径 `p = ⟨t1, ..., tk⟩` 及其三元组置信度 `{ci}_i=1^k`,整个路径的置信度定义为其三元组置信度的乘积:
```
Conf(p) = ∏_{i=1}^k ci.
```
(3)
###### 定义 6(路径与问题语义相关性)
设 `f(·,·)` 表示路径 `p` 与问题 `Q` 之间的相似度函数:
```
SR(p,Q) = f(p,Q).
```
(4)
我们使用预训练语言模型(PLM),例如 SentenceBERT [22 (https://arxiv.org/html/2607.17266#bib.bib1)],来计算 `f(·,·)`。
###### 定义 7(推理路径得分)
给定问题 `Q`,路径 `p` 的推理路径得分由其语义相关性和路径置信度决定:
```
Score(p,Q) = SR(p,Q) · (Conf(p))^α
```
(5)
其中 `α` 是一个超参数,控制问题相关性与路径置信度之间的权衡。
这符合直觉:当路径在语义上与问题一致,并且受高置信度三元组支持时,它应被优先选择。
###### 定义 8(实体距离)
实体 `u` 和 `v` 之间的实体距离定义为:
```
Distance(u,v) = min_{p ∈ P(u,v)} Hop(p) / Conf(p).
```
(6)
其中 `P(u,v)` 表示相似文章
基于领域特定知识图谱的面向旅游的推理大语言模型
本文提出一个模块化流水线,使用领域特定知识图谱生成多跳问答对,并微调一个面向旅游领域的推理大语言模型 (Qwen3-4B),实现了82.4%的精确匹配准确率,显著优于基线模型。
我们能否信任LLM的逻辑?通过基于图的框架量化不确定性、一致性和稳健性
本文介绍了GraphEVAL,一个基于图的框架用于量化LLM推理中的不确定性,并提出了一种新的指标——图推理一致性得分(GRCS),该指标捕捉语义-结构共识并检测自信幻觉。作者还提出了图自一致性(GSC),一种优先考虑推理忠实度而非名义准确性的解码策略。
基于外部子图生成的大语言模型逐步推理增强
本文提出了SGR框架,通过查询相关的子图生成将外部知识图谱与大语言模型相结合,融合基于Cypher的推理与协同推理集成,从而增强大语言模型的逐步推理能力。在CWQ、WebQSP、GrailQA和KQA Pro上的实验表明,该框架相比标准提示方法和知识增强基线具有更高的推理准确性。
知识图谱中的可扩展不确定性推理
本论文提出了一个模块化框架,用于知识图谱中的可扩展不确定性推理,通过定制的代数、逻辑和几何技术,处理不精确的属性值、概率性三元组存在以及不完整的模式知识。
RSF-GLLM: 通过递归软流与解耦LLM生成弥合多跳知识图谱问答中的语义鸿沟
本文介绍了RSF-GLLM,一个将可微图推理与LLM生成解耦的框架,以解决多跳知识图谱问答中的语义鸿沟问题,在实现竞争性性能的同时,具有卓越的推理效率。