知识图谱增强与检索增强生成在文化相关问答中的对比
摘要
本文对知识图谱增强和检索增强生成在文化特定问答中的表现进行了基准测试,使用LatamQA数据集展示了在拉丁美洲文化数据上的显著错误减少。
arXiv:2609.18317v1 Announce Type: new
摘要:大型语言模型(LLMs)存在长尾缺陷:文化特定事实,尤其是涉及拉丁美洲等代表性不足地区的事实,在预训练语料库中出现频率太低,无法可靠记忆。检索增强生成(RAG)通过将生成基于外部文本来解决这个问题,但结构化替代方案如知识图谱(KGs)可以更严格地控制进入上下文的内容,并可能提高可解释性和可更新性。我们在LatamQA上对Graph-RAG和标准RAG进行了基准测试,LatamQA是一个涵盖八个主题类别的文化基础多选题数据集。这些图是通过KGGen从维基百科文章中端到端构建的,KGGen是一个最近的开源域提取器,在我们的主要设置中无需手动策划。G-Retriever与RAG具有竞争力,并使用标准KG将基础LLM的错误减少72%,使用基准感知变体减少78%,随着图面向任务相关的内容,与RAG的差距进一步缩小。训练后的投影无需目标语言微调即可零样本迁移到葡萄牙语,表明了多语言能力。
查看缓存全文
缓存时间: 2026/09/17 09:16
# 基于知识图谱的增强方法与检索增强生成在文化类问题问答中的对比 来源:https://arxiv.org/html/2609.18317 作者:Pablo Poulenard 所属单位:智利大学计算机科学系,智利圣地亚哥;巴黎综合理工学院,法国帕莱索 作者:Yannis Karmim 所属单位:智利大学计算机科学系,智利圣地亚哥;法国国家信息与自动化研究所,巴黎Almanach团队;法国国家信息与自动化研究所智利中心,智利圣地亚哥 作者:Valentin Barrière 所属单位:智利大学计算机科学系,智利圣地亚哥;国家计算中心,智利马库尔 通讯邮箱:[[email protected]](mailto:[email protected]) ###### 摘要 大型语言模型(LLMs)存在长尾数据缺失问题:文化特有事实,特别是关于拉丁美洲等代表性不足地区的知识,在预训练语料中出现频率过低,难以被可靠记忆。检索增强生成(RAG)通过结合外部文本生成来解决这一问题,而知识图谱(KGs)等结构化替代方案则能更精准控制上下文输入内容,并可能提升可解释性与可更新性。我们在LatamQA——一个涵盖八大主题类别的文化基础选择题数据集上,对比测试了图谱增强检索(Graph-RAG)与标准RAG的性能。知识图谱通过KGGen(一种近期的开放域信息抽取工具)从维基百科文章端到端构建而成,主要场景下未进行人工筛选。G-Retriever在标准知识图谱下性能与RAG相当,可将基础LLM的错误率降低72%,在针对基准测试优化的变体下错误率降低78%;当图谱内容更聚焦于任务相关主题时,与RAG的性能差距进一步缩小。训练得到的投影模块无需目标语言微调即可零样本迁移至葡萄牙语,展现了跨语言适用性。代码已开源于此处(https://github.com/Payblito/KG-vs-RAG-QA)。 ## 1 引言与相关工作 LLMs通过预测下一个词元的方式获取事实知识,其记忆可靠性与预训练出现频率成正比(Mallen等人,2023 (https://arxiv.org/html/2609.18317#bib.bib18))。文化特有事实,尤其是涉及代表性不足地区的知识,因出现频率过低而难以被可靠记忆,这种缺失往往表现为模型虚构而非拒答。拉丁美洲文化即为典型案例:尽管西班牙语是高资源语言,但最先进LLM对伊比利亚西班牙文化的问答准确率显著高于拉丁美洲文化(Karmim等人,2026 (https://arxiv.org/html/2609.18317#bib.bib3))。参数自适应方法无法弥合此差距:在新分布上继续预训练会导致灾难性遗忘(Yang等人,2026 (https://arxiv.org/html/2609.18317#bib.bib21)),而监督微调在大规模场景中已被检索方法超越(Ovadia等人,2024 (https://arxiv.org/html/2609.18317#bib.bib12))。 检索增强生成(RAG)通过将生成过程锚定在外部文本存储中来解决这些局限,无需修改模型权重,在低频事实场景中效果显著(Mallen等人,2023 (https://arxiv.org/html/2609.18317#bib.bib18))。其主要缺点是令牌成本:检索到的段落会占满上下文窗口,且使用者难以控制进入提示词的内容。另一类研究方向则关注检索内容的推理方式:Ranaldi等人(2025 (https://arxiv.org/html/2609.18317#bib.bib1))通过让模型对异构检索段落进行辩证比较与调和来提升多语言RAG性能。 知识图谱(KGs)提供了结构化替代方案:显式关系三元组紧凑、易于检查、更新和溯源。近期KGGen(Mo等人,2025 (https://arxiv.org/html/2609.18317#bib.bib8))使得大规模自动构建知识图谱成为可能,该工具通过结构化LLM提示将原始文本转化为三元组,并通过实体关系消解降低图谱稀疏度。G-Retriever(He等人,2024 (https://arxiv.org/html/2609.18317#bib.bib15))结合了基于GNN的软提示与PCST子图检索,是目前领先的图谱增强LLM流程。其评估使用的数据集包括ExplaGraphs(Saha等人,2021 (https://arxiv.org/html/2609.18317#bib.bib7))、SceneGraphs(Hudson和Manning,2019 (https://arxiv.org/html/2609.18317#bib.bib6))和WebQSP(Yih等人,2016 (https://arxiv.org/html/2609.18317#bib.bib4)):这些数据集将每个问题与小型、干净、专用的图谱配对,且需要多跳推理——此类条件对图谱方法结构性有利。 我们在刻意设计的更难场景中评估:每个主题类别对应一个大型、含噪声的知识图谱,问题均为单跳类型,使RAG天然具备优势,从而可衡量将文本转化为三元组的真实成本。 图1:方法概览。从5,848篇西班牙语维基百科文章中,KGGen(Mo等人,2025 (https://arxiv.org/html/2609.18317#bib.bib8))为每个主题领域提取无模式知识图谱。针对LatamQA(Karmim等人,2026 (https://arxiv.org/html/2609.18317#bib.bib3))问题,G-Retriever(He等人,2024 (https://arxiv.org/html/2609.18317#bib.bib15))通过PCST选择子图,将其编码后前置到冻结的LLM;相同的三元组作为文本(DD)用于我们的RAG和Top-k基线。 我们在LatamQA(Karmim等人,2026 (https://arxiv.org/html/2609.18317#bib.bib3))上对比测试Graph-RAG与标准RAG,这是一个涵盖八大拉丁美洲主题类别的文化基础选择题数据集。我们的贡献包括: (i)将近期开放域抽取工具KGGen(Mo等人,2025 (https://arxiv.org/html/2609.18317#bib.bib8))大规模应用于5,848篇维基百科文章,并以端到端问答任务而非内在抽取指标进行评估; (ii)系统对比RAG、Top-k三元组与G-Retriever(He等人,2024 (https://arxiv.org/html/2609.18317#bib.bib15)); (iii)通过消融实验量化图谱结构与抽取质量的贡献; (iv)训练投影模块在葡萄牙语上的零样本跨语言迁移。 图1(https://arxiv.org/html/2609.18317#S1.F1)展示了本文提出流程的概览。 ## 2 实验流程设计 我们的设置结合了文化基础问答基准、从构建文章中抽取的知识图谱,以及用于回答问题的小型语言模型。 #### 数据集 我们基于LatamQA(Karmim等人,2026 (https://arxiv.org/html/2609.18317#bib.bib3))构建,这是一个从拉丁美洲国家文化维基百科文章中提取的文化基础事实知识选择题基准。我们从维基百科本体中定义八大主题类别(音乐、文学、电影等,见表1(https://arxiv.org/html/2609.18317#S2.T1)),递归爬取每个国家-主题母类(如“智利美食”)至深度二,并与LatamQA取交集,最终获得5,848篇文章。每篇文章对应一个问题,含一个正确答案与三个基于其内容的干扰项,因此无需跨文章组合信息。 #### 图谱构建 我们使用KGGen(Mo等人,2025 (https://arxiv.org/html/2609.18317#bib.bib8))进行构建,该抽取工具通过结构化LLM提示预测原始文本中的实体与关系,再通过迭代聚类消解重复项(提示模板见附录B(https://arxiv.org/html/2609.18317#A2))。此前该工具仅在最多500万词元的英语语料上评估;我们将其应用于5000万字符的西班牙语维基百科,在此规模下实体消解主导运行时间。文章被分割为5000字符段落,按类别聚合各文章图谱,并进行实体与边消解,每个类别生成一个统一知识图谱,通过中心节点链接至全局图谱。每个三元组在流程中可溯源,提供作为检索真值的来源信息。 我们还为每个类别构建了一个针对基准测试优化的变体,通过在抽取提示中注入从LatamQA问题衍生的实体与关系提示,引导知识图谱聚焦任务相关内容。Mistral Small 3.2(Mistral-Small-3.2-24B-Instruct-2506)作为KGGen的基础模型。 表1:八大主题知识图谱在实体与边消解后的统计信息 #### 语言模型 主要实验使用Qwen2.5-3B-Instruct(Qwen等人,2025 (https://arxiv.org/html/2609.18317#bib.bib9))。衡量外部知识贡献需要模型尚未记忆目标事实,否则强零样本性能将难以归因于检索增益。该模型零样本准确率为60.17%,参数化知识尚未使基准测试饱和。 #### 查询编码与检索 四个系统使用相同的编码器与查询格式。jinaai/jina-embeddings-v3(Sturua等人,2024 (https://arxiv.org/html/2609.18317#bib.bib11))是具有8192词元上下文窗口的多语言编码器,全篇使用其针对查询与段落的任务特定LoRA适配器(详情见附录A.1(https://arxiv.org/html/2609.18317#A1.SS1))。查询将问题与四个选项拼接:这在保持任务完整性的同时,对称丰富了检索器可用的词汇与语义信号,因为检索时未对任何选项加权。 第3节(https://arxiv.org/html/2609.18317#S3)描述了各系统如何利用此信号选择上下文。 ## 3 对比的检索方法 以下所有系统均使用第2节(https://arxiv.org/html/2609.18317#S2)描述的相同语言模型与嵌入模型,差异仅在于检索的上下文内容。RAG基于原始文本操作,作为我们的参考基线;三个基于图谱的系统对知识图谱的利用程度逐步增加,从无序三元组集合到训练的子图编码器。 #### RAG 每篇文章被分割为最多512词元、重叠64词元的段落,使用与查询相同的模型编码。与查询相似度最高的k=5个段落传递给阅读器。检索范围限定于对应类别的文章,与基于图谱方法使用的知识图谱范围一致。这些值通过网格搜索选定;完整扫描结果见附录A.2(https://arxiv.org/html/2609.18317#A1.SS2)。 #### Top-k三元组 此无需训练的基线独立评分每个三元组:每个(s,r,o)三元组被编码,按与查询的余弦相似度排序,前k个三元组被转化为自然语言置于提示中。这遵循KAPING(Baek等人,2023 (https://arxiv.org/html/2609.18317#bib.bib5))的相似度过滤方法,但省略其将候选范围限定于问题实体一跳邻域的实体链接阶段:由于我们的图谱来自开放抽取而非规范知识库,问题与图谱实体间无严格对应保证。该图谱被视作无序三元组集合,使其成为结构感知方法的自然下界。 #### G-Retriever G-Retriever(He等人,2024 (https://arxiv.org/html/2609.18317#bib.bib15))首先通过求解知识图谱上的奖励收集斯坦纳树(PCST)提取子图,使用查询与边的相似度作为节点奖励,与节点的相似度作为边成本。图编码器²(我们使用图Transformer(Yun等人,2019 (https://arxiv.org/html/2609.18317#bib.bib14))而非原工作的图注意力网络(Veličković等人,2018 (https://arxiv.org/html/2609.18317#bib.bib13)))将该子图映射为单向量,多层感知机(MLP)将其投影至语言模型嵌入空间作为软提示。两个模块在训练集上端到端训练以生成正确答案。 在第4.2节(https://arxiv.org/html/2609.18317#S4.SS2)中,我们还评估了一个变体,使用节点嵌入均值池化替代图编码器,其中拓扑结构决定哪些节点被检索,但从不编码拓扑。 ## 4 结果与分析 我们首先在LatamQA(Karmim等人,2026 (https://arxiv.org/html/2609.18317#bib.bib3))上对比所有四个系统(第4.1节(https://arxiv.org/html/2609.18317#S4.SS1.SSS0.Px1)),然后隔离G-Retriever各组件的贡献(第4.2节(https://arxiv.org/html/2609.18317#S4.SS2)),最后测试训练投影是否可迁移至未见语言(第4.3节(https://arxiv.org/html/2609.18317#S4.SS3))。 ### 4.1 主要对比 #### RAG vs Top-k三元组 vs G-Retriever 表2(https://arxiv.org/html/2609.18317#S4.T2)将所有方法与零样本基线(60.17%)对比。所有检索方法显著优于未增强模型。无需训练的Top-k三元组基线(+15.4百分点)证实即使无序三元组也具有判别信号,但仍远落后于G-Retriever和RAG。RAG整体最强(93.38% vs. 89.71%),差距可归因于三元组抽取时的信息损失。各类别结果显示出显著异质性;值得注意的是,G-Retriever在“美食”类别超越RAG(93.04% vs. 87.37%),其中关系抽象过滤了词汇密集检索的噪声。 表2:LatamQA各类别准确率(%) ### 4.2 消融实验 表3(https://arxiv.org/html/2609.18317#S4.T3)报告消融结果。 #### 图谱结构 移除训练投影(将PCST结果作为纯文本,73.10%)性能低于Top-k三元组,重现了He等人(2024 (https://arxiv.org/html/2609.18317#bib.bib15))的相应消融:训练的连续前缀是核心组件。有趣的是,线性投影与图编码器性能相当甚至更优(88.90% vs. 86.13% [无文本化图谱];89.50% vs. 89.71% [含文本化图谱])。我们归因于任务的单跳性质:训练模块提供的功能是针对任务的检索节点与边嵌入的连续摘要,本质上是基于检索内容的提示调优(Lester等人,2021 (https://arxiv.org/html/2609.18317#bib.bib17);Li和Liang,2021 (https://arxiv.org/html/2609.18317#bib.bib16)),在此场景下消息传递是过于复杂的实现方式。 #### 针对基准测试的抽取 使用问题衍生实体提示引导抽取同时提升了Top-k三元组(+2.3百分点)和G-Retriever(+1.7百分点,达91.41%),证实标准抽取会丢弃任务相关内容。与RAG的持续差距(91.41% vs. 93.38%)表明主要瓶颈在于抽取而非检索。 表3:不同KGGen选择方法、图编码器与基准设置下的准确率。GraphEnc指G-Retriever的训练图编码器,Linear指使用单投影的均值池化节点嵌入。Bench KGGen指使用LatamQA特定关系/实体构建的知识图谱。 ### 4.3 多语言迁移 西班牙语交叉验证折的五个检查点无需进一步训练直接应用于由397篇“文学”类别文章构建的葡萄牙语知识图谱,其中问题、三元组与生成均为葡萄牙语。由于投影模块对齐的是池化子图表示与阅读器的输入空间,而非建模特定语言,且编码器本身具有多语言能力(Sturua等人,2024 (https://arxiv.org/html/2609.18317#bib.bib11)),该映射应具有语言无关性。 G-Retriever在葡萄牙语上达91.18%,高于其在西班牙语文学类别的89.44%,而零样本基线从60.06%降至53.40%(表4(https://arxiv.org/html/2609.18317#S4.T4))。因此,只要检索骨干本身具有多语言能力,单个训练投影可服务多种语言。 表
相似文章
更健康的LLMs:面向公共卫生问答的检索增强生成
本文将PubHealthBench扩展至检索增强场景,系统评估了公共卫生问答中的检索与生成选择,结果表明混合检索能提升准确率,且使用检索的较小模型可媲美较大模型。
SelfGraphRAG:通过合成QA生成弥合基于图的RAG中的监督缺口
SelfGraphRAG引入了一个框架,该框架从知识图谱生成合成问答对,以解决基于图的检索增强生成中的监督缺口,提升检索精度和推理性能。
VisKG-LM: 将知识图谱编译为视觉记忆用于多项选择题问答
本文提出VisKG-LM,一种将知识图谱编译为视觉记忆以进行高效多项选择题问答的方法,通过将图编码与语言推理解耦,在基线上实现性能提升。
先修复再增强:面向多跳问答的上下文增强知识图谱推理
本文提出了一种上下文增强的多跳问答训练框架,表明结合上下文图与知识图谱并使用强化学习可以提高生物医学领域的性能。
MKG-RAG-Bench:多模态知识图谱增强生成中的检索基准测试
介绍了MKG-RAG-Bench,这是一个用于评估多模态知识图谱增强生成中检索效果的跨领域基准,表明有效的多模态检索仍然具有挑战性,并且对下游生成质量至关重要。