MissDiag:KGQA与KG-RAG中不完全知识鲁棒性的诊断评估
摘要
MissDiag 引入了一个诊断评估框架,该框架将 KGQA 和 KG-RAG 系统在不完全知识下的鲁棒性分解为类型化证据干预,以实现更可解释的比较。
arXiv:2608.18489v1 公告类型:新
摘要:知识图谱问答 (KGQA) 和基于知识图谱的检索增强生成 (KG-RAG) 旨在基于显式图证据来支撑答案,但现实世界中的知识图谱往往稀疏、过时且不完整。现有的鲁棒性评估通常在证据被移除或扰动后报告答案质量的聚合变化,这衡量了对不完全支持的敏感性,但未能明确指出退化的来源:相同的分数变化可能混淆了缺失证据的类型、被评估系统的响应以及答案匹配协议的敏感性。为解决这一差距,我们提出了 \textbf{MissDiag},一个用于 KGQA 和 KG-RAG 中不完全知识鲁棒性的诊断评估框架。MissDiag 在固定问题和标准答案的同时,对基准提供的支持图施加结构类型化的缺失干预,使得能够进行配对比较,通过证据类型、系统响应和评估协议来分解鲁棒性变化,而不是将其简化为单一的聚合分数下降。跨多个系统家族的实验表明,不完全知识鲁棒性应更好地理解为一种类型化的退化现象,而非统一属性:答案相邻证据的损失导致观察到的最大退化,源上下文移除通常是中性的甚至有益的,而语义答案匹配虽然改变绝对分数,但保留了主要的类型化退化模式。通过将聚合鲁棒性测量转化为类型化诊断归因,MissDiag 为在不完全知识下比较、诊断和压力测试 KGQA 和 KG-RAG 系统提供了更可解释的基础。
查看缓存全文
缓存时间: 2026/08/20 10:12
# 知识图谱问答与知识图谱增强生成中不完整知识鲁棒性的诊断评估 来源:https://arxiv.org/html/2608.18489 ## MissDiag:KGQA与KG-RAG中不完整知识鲁棒性的诊断评估框架 ###### 摘要 知识图谱问答(KGQA)与基于知识图谱的检索增强生成(KG-RAG)旨在将答案锚定于显式的图证据,但现实世界的知识图谱往往稀疏、过时且不完整。现有的鲁棒性评估通常在证据移除或扰动后报告答案质量的总体变化,这虽然衡量了对不完整支持的敏感性,却未明确区分性能下降的根源:相同的分数变化可能同时混杂了缺失证据的类型、被评估系统的响应特性以及答案匹配协议的敏感性。为填补这一空白,我们提出MissDiag——一个针对KGQA和KG-RAG不完整知识鲁棒性的诊断评估框架。MissDiag保持问题与标准答案固定,同时对基准提供的支持图谱施加结构类型的缺失干预,从而实现配对比较,能够按证据类型、系统响应和评估协议分解鲁棒性变化,而非将其简化为单一的总体分数下降。跨多个系统族的实验表明,不完整知识鲁棒性更应理解为一种类型化的退化现象,而非均匀属性:答案相邻证据的缺失导致观察到的最大退化,来源上下文的移除通常是中性的甚至可能有益,而语义答案匹配虽然改变绝对分数,但保留了主要的类型化退化模式。通过将总体鲁棒性测量转化为类型化的诊断归因,MissDiag为在不完整知识条件下比较、诊断和压力测试KGQA与KG-RAG系统提供了更具解释性的基础。 > 代码将在评审流程后发布。 ## 引言 知识图谱问答(KGQA)与基于知识图谱的检索增强生成(KG-RAG)旨在将答案锚定于显式的图证据,而非仅依赖参数记忆。这使其成为评估结构化推理、事实锚定和答案可信度的重要试验场。先前工作通过语义解析与查询图构建(1 (https://arxiv.org/html/2608.18489#bib.bib28); 43 (https://arxiv.org/html/2608.18489#bib.bib29))、基于嵌入与基于图的问答(14 (https://arxiv.org/html/2608.18489#bib.bib13); 31 (https://arxiv.org/html/2608.18489#bib.bib10); 28 (https://arxiv.org/html/2608.18489#bib.bib30); 41 (https://arxiv.org/html/2608.18489#bib.bib7); 8 (https://arxiv.org/html/2608.18489#bib.bib8); 22 (https://arxiv.org/html/2608.18489#bib.bib9))、针对知识库和文本的检索推理系统(10 (https://arxiv.org/html/2608.18489#bib.bib33); 18 (https://arxiv.org/html/2608.18489#bib.bib32))、基于大语言模型的知识库问答(38 (https://arxiv.org/html/2608.18489#bib.bib35))以及日益具有挑战性的基准(5 (https://arxiv.org/html/2608.18489#bib.bib31); 7 (https://arxiv.org/html/2608.18489#bib.bib3); 2 (https://arxiv.org/html/2608.18489#bib.bib6); 46 (https://arxiv.org/html/2608.18489#bib.bib1))推动了该目标。近期,图锚定的大语言模型研究探讨了知识图谱增强是否在开放式生成场景中提升了事实性、推理质量、检索效率与可信度(36 (https://arxiv.org/html/2608.18489#bib.bib36); 32 (https://arxiv.org/html/2608.18489#bib.bib34); 30 (https://arxiv.org/html/2608.18489#bib.bib26); 49 (https://arxiv.org/html/2608.18489#bib.bib2))。然而,贯穿这些工作线的一个持续性难题是:现实世界的知识图谱很少是完整的。它们往往稀疏、过时,且在不同实体和关系上填充不均衡,这使得在不完整知识下的鲁棒性成为可靠KGQA和KG-RAG系统的核心要求。 > **参考图1**:类型化退化分析的动机。相同的问答实例在结构不同的缺失条件下可能表现出相似的总体退化。仅凭总体分数下降无法揭示哪种证据类型被移除、答案局部证据是否受影响,或这种影响是否系统性。 现有研究已从多个互补角度研究了不完整知识问题,包括对部分图结构的上下文推理(21 (https://arxiv.org/html/2608.18489#bib.bib14))、文本证据的整合(39 (https://arxiv.org/html/2608.18489#bib.bib11); 11 (https://arxiv.org/html/2608.18489#bib.bib12); 33 (https://arxiv.org/html/2608.18489#bib.bib20))、知识图谱嵌入与关系预测(35 (https://arxiv.org/html/2608.18489#bib.bib37); 27 (https://arxiv.org/html/2608.18489#bib.bib38); 34 (https://arxiv.org/html/2608.18489#bib.bib39); 14 (https://arxiv.org/html/2608.18489#bib.bib13); 26 (https://arxiv.org/html/2608.18489#bib.bib15); 48 (https://arxiv.org/html/2608.18489#bib.bib18); 45 (https://arxiv.org/html/2608.18489#bib.bib21); 25 (https://arxiv.org/html/2608.18489#bib.bib16); 9 (https://arxiv.org/html/2608.18489#bib.bib19))、知识图谱补全(48 (https://arxiv.org/html/2608.18489#bib.bib18); 9 (https://arxiv.org/html/2608.18489#bib.bib19))、补全感知推理流程(20 (https://arxiv.org/html/2608.18489#bib.bib17); 42 (https://arxiv.org/html/2608.18489#bib.bib23); 12 (https://arxiv.org/html/2608.18489#bib.bib22))以及基于大语言模型或多智能体在不完整图上进行推理(40 (https://arxiv.org/html/2608.18489#bib.bib48); 19 (https://arxiv.org/html/2608.18489#bib.bib25))。与此同时,评估研究探讨了补全方法是否改善下游问答性能,以及当前的基准和指标在不完整或不完美知识下是否支持可靠结论(44 (https://arxiv.org/html/2608.18489#bib.bib24); 23 (https://arxiv.org/html/2608.18489#bib.bib4); 29 (https://arxiv.org/html/2608.18489#bib.bib5); 46 (https://arxiv.org/html/2608.18489#bib.bib1); 47 (https://arxiv.org/html/2608.18489#bib.bib27); 49 (https://arxiv.org/html/2608.18489#bib.bib2); 30 (https://arxiv.org/html/2608.18489#bib.bib26))。这些研究极大地增进了我们对系统如何恢复缺失事实、利用辅助证据或对部分结构进行推理的理解。然而,当前评估实践仍存在一个基本归因局限:大多数评估通过移除、破坏或恢复证据,然后报告由此产生的答案质量变化。这种基于退化的评估可以衡量性能是否变化,但无法解释变化发生的原因。 这种模糊性在图1(https://arxiv.org/html/2608.18489#Sx1.F1)中得到说明:相同的问答实例在结构不同的证据移除条件下可能表现出相似的总体分数下降,尽管其底层的失效机制不同。较低的分数可能表明关键的支持证据已变得不可用;也可能表明系统未能利用保留的证据,图转换或候选构建改变了有效搜索空间,或评估协议未能识别语义上可接受的答案。反之,在不完整证据下表现出的明显鲁棒性甚至提升,可能反映了支持信息的剪枝或指标行为,而非更强的推理能力。这一点很重要,因为在不完整知识下的鲁棒性常被用作推理能力和系统可靠性的证据。如果相似的分数变化可能由不同原因引起,那么仅凭总体退化就不足以解释鲁棒性主张。需要的不仅是一个性能测量协议,更是一个诊断评估框架,能够将退化归因于不同形式的缺失证据,比较不同系统族对相同干预的响应,并揭示结论在多大程度上依赖于评估指标。 为解决这一差距,我们提出MissDiag——一个针对KGQA和KG-RAG不完整知识鲁棒性的诊断评估框架。如图2(https://arxiv.org/html/2608.18489#Sx1.F2)所示,MissDiag从一个基准提供的评估实例开始,该实例包含问题、标准答案集和局部支持图谱。它保持问题和标准答案固定,同时将支持图谱转换为结构上不同的不完整证据条件。主要的缺失算子包括随机支持丢失、来源上下文丢失、关系级别移除和答案相邻移除。通过对同一系统在相同问答对上进行每次类型化干预前后的评估,MissDiag分离了通常在不完整知识评估中纠缠的三个因素:缺失类型、系统响应和评估敏感性。 > **参考图2**:MissDiag概览。\(1\) 输入:一个实例包含问题、标准答案集和局部支持图谱。\(2\) 类型化缺失算子:类型化算子为随机、来源上下文、关系级别和答案相邻缺失选择可移除的支持边。\(3\) 严重性控制的缺失:共享的严重性预算生成一个不完整支持图谱。\(4\) 配对评估:同一系统在完整和不支持条件下进行评估,以计算配对退化。\(5\) 类型化退化概况:退化值按缺失类型、严重性、系统和指标进行汇总。 MissDiag并非将不完整知识视为单一的鲁棒性条件,而是将其表示为一种类型化的退化现象。该框架通过按缺失类型、严重性、系统和评估指标索引的退化概况来报告鲁棒性,并使用结构切片进行进一步分析。这种设计使得在训练的KGQA模型、图结构提示方法、迭代KG智能体和直接大语言模型基线之间进行配对且可解释的比较成为可能。因此,它允许审视鲁棒性主张:退化源于何处、何时反映真实的证据损失、以及何时应归因于系统行为或评估敏感性。 我们的贡献如下: - • 我们将不完整知识鲁棒性评估构建为一个诊断归因问题,表明总体分数变化混杂了证据可用性、系统行为和评估协议,因此自身无法支持关于推理鲁棒性的可靠结论。 - • 我们引入MissDiag,一个受控诊断框架,它在基准支持图谱上施加结构类型的缺失干预,同时保持配对的问答比较,使得退化可以按缺失来源而非仅按整体性能损失进行分析。 - • 我们将MissDiag实例化于多个系统族、严重性级别、结构切片和答案匹配指标,证明相同的缺失证据干预根据系统设计和评估协议可能导致退化、近似不变或提升。这揭示了总体分数所掩盖的鲁棒性模式。 ## 相关工作 ### KGQA与图锚定问答 KGQA旨在使用结构化的图证据回答自然语言问题。早期工作常依赖语义解析或查询图构建,将问题映射为可执行的逻辑形式或图查询(1 (https://arxiv.org/html/2608.18489#bib.bib28); 43 (https://arxiv.org/html/2608.18489#bib.bib29))。后来的基于图的模型对局部证据子图进行检索和推理,使支持结构本身成为回答过程的一部分(31 (https://arxiv.org/html/2608.18489#bib.bib10); 13 (https://arxiv.org/html/2608.18489#bib.bib43); 22 (https://arxiv.org/html/2608.18489#bib.bib9))。同时,以检索为中心的问答和图锚定大语言模型方法使用检索到的知识来支持超出纯参数记忆的生成和推理(10 (https://arxiv.org/html/2608.18489#bib.bib33); 18 (https://arxiv.org/html/2608.18489#bib.bib32); 36 (https://arxiv.org/html/2608.18489#bib.bib36); 38 (https://arxiv.org/html/2608.18489#bib.bib35); 32 (https://arxiv.org/html/2608.18489#bib.bib34))。LC-QuAD 2.0、GrailQA、KQA Pro和KGQAGen等基准通过强调组合性、泛化性和数据集可靠性,将评估扩展到超越简单事实查找的范围(5 (https://arxiv.org/html/2608.18489#bib.bib31); 7 (https://arxiv.org/html/2608.18489#bib.bib3); 2 (https://arxiv.org/html/2608.18489#bib.bib6); 46 (https://arxiv.org/html/2608.18489#bib.bib1))。这些研究为我们的工作提供了系统和基准背景。MissDiag的不同之处在于,将现有系统视为在受控证据操作下的诊断对象,而非提出另一种KGQA架构。 ### 不完整知识问答 不完整知识是KGQA面临的持久挑战,因为现实世界的图谱是稀疏的、填充不均匀的,且常缺失多跳推理所需的事实。先前工作通过以下方式解决此问题:对部分图结构进行推理(21 (https://arxiv.org/html/2608.18489#bib.bib14))、整合辅助文本证据(39 (https://arxiv.org/html/2608.18489#bib.bib11); 11 (https://arxiv.org/html/2608.18489#bib.bib12))、使用图补全或补全感知的问答流程(44 (https://arxiv.org/html/2608.18489#bib.bib24); 42 (https://arxiv.org/html/2608.18489#bib.bib23)),以及应用以大语言模型为中心的推理处理不完整图证据(40 (https://arxiv.org/html/2608.18489#bib.bib48); 49 (https://arxiv.org/html/2608.18489#bib.bib2))。这些方法主要询问如何在知识缺失时恢复或维持答案质量。我们的工作提出一个互补的评估问题:当答案质量在不完整知识下发生变化时,应如何归因?MissDiag不是将缺失视为单一条件,而是分离不同结构形式的证据损失,并在配对协议下比较它们的影响。 ### 基准可靠性与评估敏感性 KGQA和图锚定问答的评估结论对数据集构建、证据可用性和答案匹配协议敏感。数据集审计和排行榜分析表明,KGQA基准可能包含标注问题、异质难度和不一致的报告实践(29 (https://arxiv.org/html/2608.18489#bib.bib5); 23 (https://arxiv.org/html/2608.18489#bib.bib4); 46 (https://arxiv.org/html/2608.18489#bib.bib1))。更广泛地说,对抗性评估和行为测试表明,总体指标可能将不同的失效机制隐藏在相似的分数变化背后(15 (https://arxiv.org/html/2608.18489#bib.bib42); 24 (https://arxiv.org/html/2608.18489#bib.bib40); 6 (https://arxiv.org/html/2608.18489#bib.bib41))。近期的KG-RAG和可信度研究进一步表明,图增强和不完整证据需要精心设计的评估(30 (https://arxiv.org/html/2608.18489#bib.bib26); 47 (https://arxiv.org/html/2608.18489#bib.bib27); 49 (https://arxiv.org/html/2608.18489#bib.bib2))。这些文献促使我们认识到,评估不是一个中立的报告层。MissDiag通过将不完整知识评估分解为缺失类型、系统响应、严重性和指标敏感性来扩展这一研究方向,从而使鲁棒性主张的解释能够超越单一的总体退化分数。 ## 方法 本节介绍MissDiag,一个针对KGQA和KG-RAG不完整知识鲁棒性的诊断评估框架。如图2(https://arxiv.org/html/2608.18489#Sx1.F2)所示,该框架保持问题、标准答案和局部支持图谱,同时将其转换为结构上不同的不完整证据条件。主要的缺失算子包括随机支持丢失、来源上下文丢失、关系级别移除和答案相邻移除。通过对同一系统在相同问答对上进行每次类型化干预前后的评估,MissDiag分离了通常在不完整知识评估中纠缠的三个因素:缺失类型、系统响应和评估敏感性。
相似文章
RAG 能知道检索错误吗?在知识冲突下诊断上下文遵从性
本文提出了一种名为“上下文驱动分解”(CDD)的探针,用于诊断检索增强生成(RAG)系统在面对检索上下文与参数化知识冲突时,是否遵从检索上下文。同时,发布了 Epi-Scale 基准测试,以便在多种模型家族中进行系统性研究。
SKG-Eval:基于增量语义知识图谱的多轮对话状态化评估
提出SKG-Eval,一种用于多轮对话的准确定性评估框架,利用增量语义知识图谱检测跨轮不一致性、矛盾及主题漂移,实现与人类判断更高的相关性。
TopoGuard:基于图论的RAG Split-Knowledge攻击防御
介绍了TopoGuard,这是一种基于图论的防御方法,用于抵御RAG系统中的Split-Knowledge攻击。该攻击中,多个单独无害的文档组合后会产生有害输出。该方法通过构建语义相似度图来检测恶意上下文,性能显著优于现有的逐文档过滤器(如LlamaGuard)。
Debate-on-Graph: 基于不确定知识图谱的大型语言模型可靠自适应推理
Debate-on-Graph (DoG) 是一个框架,通过利用带有置信度的不确定知识图谱 (UKG) 增强 LLM 推理,采用启发式搜索和多智能体辩论机制生成可靠答案。在四个 QA 基准测试中达到最先进性能。
识别与解决知识型VQA基准测试的陷阱:审计、修复与增强
本文对知识型VQA基准进行了审计,揭示了系统性的假设违反,使得准确率成为误导性指标。它提出了一种修复协议和多实体增强方法,以恢复答案可推导性和问题清晰度,表明修正后的设置产生了显著不同的模型排名。