SelfGraphRAG:通过合成QA生成弥合基于图的RAG中的监督缺口

arXiv cs.CL 论文

摘要

SelfGraphRAG引入了一个框架,该框架从知识图谱生成合成问答对,以解决基于图的检索增强生成中的监督缺口,提升检索精度和推理性能。

arXiv:2608.25123v1 公告类型:新 摘要:检索增强生成(RAG)通过整合外部知识来改进大型语言模型,无需重新训练,但现有方法往往未能充分利用知识图谱中编码的关系结构。基于图的RAG能够捕获实体关系,然而监督式图检索通常需要标记的问答数据,这些数据可能对新构建的图不可用。我们通过SelfGraphRAG解决了这一限制,该框架直接从知识图谱结构生成问答对,并使用这些问答对来训练一个查询条件化的图检索器。生成的问题捕获了多跳路径和局部邻域,无需人工标注即可提供关系监督。在多跳问答和分类基准上的实验表明,SelfGraphRAG相比基于嵌入的基线方法提升了检索精度和下游推理性能。这些结果表明,当标记数据不可用时,知识图谱结构可以为训练图检索器提供有用的监督。
查看原文
查看缓存全文

缓存时间: 2026/08/27 09:16

# SelfGraphRAG:利用合成问答生成弥合基于图的RAG中的监督差距
来源:https://arxiv.org/html/2608.25123

###### 摘要

检索增强生成(RAG)通过在不重新训练的情况下整合外部知识来增强大型语言模型,但现有方法未能充分利用知识图谱中的关系结构。虽然基于图的RAG能够捕捉实体关系,但其效果受限于监督图检索所需的标记数据缺乏。我们研究从图谱本身派生的合成监督是否能够实现有效的条件子图检索学习。我们提出了SelfGraphRAG,这是一个从知识图谱结构生成问题-答案对,以生成图检索模型训练信号的框架。我们假设基于多跳和邻域的合成查询编码了足够多的关系约束,可以近似真实任务分布。在多跳和分类基准测试上的实证结果表明,使用此类合成监督训练的模型在检索精度和推理性能上优于基于嵌入的基线方法。这些发现表明,图结构数据可以作为自包含的监督来源,无需人工标注即可实现结构化检索的可扩展学习。

## 1 引言

大型语言模型(LLMs)展现出卓越的语言理解和生成能力,但它们仍然受到参数化知识的根本性限制;它们无法高效整合新信息,容易产生幻觉,且具有固定的上下文窗口,无法容纳大型私有语料库[10 (https://arxiv.org/html/2608.25123#bib.bib10)]。检索增强生成(RAG)通过索引外部知识库并在推理时提供相关上下文来解决这些限制,提高了准确性和透明度[10 (https://arxiv.org/html/2608.25123#bib.bib10)][4 (https://arxiv.org/html/2608.25123#bib.bib4)]。然而,标准RAG处理的是扁平的文档块。这种表示方式不适合需要跨实体关系进行推理的问题,而这恰恰是在复杂、知识密集型领域中会出现的查询类型。一个自然的补救措施是在索引期间从语料库中提取知识图谱,使实体关系可被显式检索[2 (https://arxiv.org/html/2608.25123#bib.bib2)][4 (https://arxiv.org/html/2608.25123#bib.bib4)]。实体级策略检索主题节点的局部邻域,并将周围的边作为上下文传递;语料库级策略则将图划分为社区,用LLM总结每个社区,并生成全局答案。然而,这两种方法都存在局限性:实体级检索依赖于固定跳数的嵌入相似度,可能导致冗余和不完全的多跳覆盖;语料库级总结则牺牲了单个三元组的粒度,降低了答案精度。

图检索模型能够学习从知识图谱中打分和提取任务相关的子图,从而克服这些局限性,但它们引入了一个新的要求:一个针对目标图谱标记的问答数据集用于监督训练[8 (https://arxiv.org/html/2608.25123#bib.bib8)][11 (https://arxiv.org/html/2608.25123#bib.bib11)]。当LLM从私有文档构建图谱时,不存在这样的标记数据。这就产生了图检索模型的表达能力与其在知识图谱增强RAG流程中的实际应用之间的根本差距。

我们提出了SelfGraphRAG,一个通过合成数据生成弥合这一差距的流程。给定一个自动提取的知识图谱,SelfGraphRAG提示LLM构建两种互补类型的问题-答案对:需要跨非相邻节点推理的多跳问题,以及需要整合节点直接邻域证据的节点总结问题,从而生成一个带标签的训练集。然后,我们在这个合成语料库上训练一个图检索模型,并在推理时使用它,取代标准图RAG方法中使用的基于嵌入的相似性检索。SelfGraphRAG的贡献有三方面。首先,我们证明了从提取的知识图谱生成的合成问答足以产生训练信号,使其在多跳和分类基准测试上优于标准RAG和LightRAG。其次,我们表明推理时的性能提升是通过一个紧凑、可在本地运行的模型栈实现的,无需依赖专有API。第三,我们提供了一个可重用的流程,可应用于任何拥有未标记文档语料库且人工标注成本高昂的领域。

## 2 相关工作

### 2.1 检索增强生成

检索增强生成(RAG)通过在推理时从索引的外部语料库中检索相关段落并将其前置为上下文来增强LLM的输出[10 (https://arxiv.org/html/2608.25123#bib.bib10)]。这种方法直接缓解了参数化LLM的关键失败模式,包括幻觉、过时知识以及无法容纳私有语料库,而无需进行昂贵的重新训练[10 (https://arxiv.org/html/2608.25123#bib.bib10), 4 (https://arxiv.org/html/2608.25123#bib.bib4), 20 (https://arxiv.org/html/2608.25123#bib.bib20)]。

标准RAG系统分三个阶段运行:将分块文档离线索引到向量存储、通过嵌入相似度在查询时检索相关块、以及基于上下文的生成[15 (https://arxiv.org/html/2608.25123#bib.bib15)]。虽然对表层事实回忆有效,但扁平的块检索无法支持跨实体关系的推理或语料库范围的综合,因为实体间的依赖关系分散在独立索引的块中[4 (https://arxiv.org/html/2608.25123#bib.bib4), 2 (https://arxiv.org/html/2608.25123#bib.bib2), 18 (https://arxiv.org/html/2608.25123#bib.bib18), 6 (https://arxiv.org/html/2608.25123#bib.bib6), 14 (https://arxiv.org/html/2608.25123#bib.bib14)]。SelfGraphRAG直接解决了这一局限性:通过使用在合成生成的监督上训练的图检索模型取代块级检索,它在保留核心RAG架构的同时,实现了扁平检索系统根本无法支持的多跳关系推理,这是对ISEEQ[3 (https://arxiv.org/html/2608.25123#bib.bib3)]的自然扩展。

### 2.2 知识图谱提取与基于图的RAG

为了解决标准RAG在关系方面的局限性,一类方法在索引期间从文档语料库构建知识图谱,并利用图结构来指导检索[2 (https://arxiv.org/html/2608.25123#bib.bib2), 4 (https://arxiv.org/html/2608.25123#bib.bib4)]。GraphRAG支持实体级检索(检索主题节点的局部邻域)和语料库级检索(通过社区检测和基于LLM的社区摘要),从而实现对大型语料库的全局理解。LightRAG[4 (https://arxiv.org/html/2608.25123#bib.bib4)]通过双层检索简化了该流程,但也同样依赖于嵌入相似度进行实体匹配。这两个系统都继承了一个根本局限性:基于嵌入的检索根据查询的表层语义相似度分配相关性,这对于多跳问题(其相关节点可能在语义上与查询字符串相距甚远)则会失效[11 (https://arxiv.org/html/2608.25123#bib.bib11)]。SelfGraphRAG直接构建在GraphRAG的Doc2Graph阶段之上,无需修改即可重用其实体和关系提取流程。然后,它通过将嵌入相似度检索替换为有监督的图检索模型,与GraphRAG和LightRAG分道扬镳,精准针对这两种方法都无法解决的多跳失效模式。

一项互补的工作方向提出了对检索文本层次结构进行递归抽象总结。RAPTOR[13 (https://arxiv.org/html/2608.25123#bib.bib13)]构建了一个逐步抽象的摘要树,并在多个粒度级别进行检索,提高了对语料库级问题的覆盖。与社区总结不同,RAPTOR在叶节点保留原始段落文本,部分缓解了粒度损失。然而,无论是RAPTOR还是基于总结的GraphRAG方法,都未能学习基于问题结构进行检索;无论查询复杂度如何,它们的检索质量都受限于嵌入相似度。SelfGraphRAG沿着RAPTOR的动机方向工作,在保留细粒度证据的同时支持广泛的查询覆盖,但这是通过训练有素的图检索实现的,而非层次总结,从而避免了伴随任何抽象步骤而来的信息损失。

HippoRAG[5 (https://arxiv.org/html/2608.25123#bib.bib5)]采取了一种受结构启发的替代方案,将图检索建模为在提取的知识图谱上运行的个性化PageRank,无需任何训练即可模拟联想记忆召回。虽然无需训练,HippoRAG的检索质量直接受限于提取的图谱结构的质量,无法通过有监督的标注或特定任务微调来改进。SelfGraphRAG改进了HippoRAG的核心思想——即图遍历应驱动检索,但用一个学习的打分函数取代了固定的PageRank启发式方法。这使得SelfGraphRAG能够根据问题类型(多跳推理与邻域总结)调整检索行为,而这是无训练的遍历策略无法做到的。

### 2.3 图检索模型

图检索模型学习从知识图谱中识别与问题相关的子图,用训练有素的打分取代启发式遍历[8 (https://arxiv.org/html/2608.25123#bib.bib8)][11 (https://arxiv.org/html/2608.25123#bib.bib11)]。G-Retriever[8 (https://arxiv.org/html/2608.25123#bib.bib8)]结合了图Transformer和冻结的LLM,在图问答数据集上进行端到端训练,以打分和检索问题相关的子图;它是SelfGraphRAG中使用的GraphLM主干。SelfGraphRAG直接构建在G-Retriever之上,保留其架构,同时解决其应用的核心障碍:针对私有提取的知识图谱缺乏标记的问答数据。SelfGraphRAG无需人工标注数据,而是从提取的图谱本身生成G-Retriever所需的训练集,使该模型能够应用于任何未标记的语料库,无需额外的标注工作。

SubgraphRAG[11 (https://arxiv.org/html/2608.25123#bib.bib11)]扩展了图检索范式,采用轻量级的基于MLP的三元组打分器和并行三元组打分机制,以实现高效、灵活的子图检索,但它需要标记的问答对*以及*主题实体标注来初始化检索。GNN-RAG[12 (https://arxiv.org/html/2608.25123#bib.bib12)]训练一个GNN对答案候选节点进行打分,并提取最短路径推理链供LLM使用,在WebQSP和CWQ上取得了最先进的成果;它同样需要预先指定问题实体和与目标图谱关联的标记问答数据。SelfGraphRAG沿着SubgraphRAG和GNN-RAG的方向,学习检索结构有意义的子图,而非依赖嵌入相似度,但移除了它们共同依赖的外部监督。SelfGraphRAG的SynthGen阶段生成的合成问答对提供了SubgraphRAG和GNN-RAG默认存在的标记信号,将有监督图检索的适用性扩展到未标记的、自构建的图谱场景[19 (https://arxiv.org/html/2608.25123#bib.bib19)]。

所有图检索模型共享的关键障碍是需要一个与目标知识图谱对齐的标记问答数据集[3 (https://arxiv.org/html/2608.25123#bib.bib3)]。当图谱是通过从私有文档中自动提取构建的(如GraphRAG和LightRAG),这样的数据集不存在。SynthKG[1 (https://arxiv.org/html/2608.25123#bib.bib1)]独立提出了针对互补任务(训练*图提取器*而非图检索器)的合成数据生成,证明LLM生成的监督在结构化提取任务上可以匹配或超过人工标注的质量。SelfGraphRAG将同样的自监督理念应用于检索阶段,将SynthKG视为一个概念验证,证明合成的图源数据可以替代人工标注,并将其扩展以为下游的图检索模型生成训练信号,而不是用于图构建。

## 3 SelfGraphRAG

参考标题图 1:SelfGraphRAG 流程。索引通过知识图谱摘要镜像 GraphRAG。SynthGen 随后生成一个问答数据集来训练图检索模型,该模型在推理时从图中检索信息。

**任务定义:** 我们考虑在私有、未标记文档语料库上进行的开放域问答任务。这种部署场景正是SelfGraphRAG所针对的:一个组织持有一系列内部文档——临床记录、技术报告或类似文档——并希望有一个系统能针对该语料库回答自然语言问题,但没有预先存在的与之关联的问答对,也没有实际的方法以训练有监督检索器所需的规模来手工制作它们。

形式化地,令 \(\mathcal{D}=\{D_1, D_2, \dots, D_d\}\) 表示 \(d\) 个文本文档的集合。给定一个自然语言查询 \(q\),目标是生成一个自然语言答案 \(a\),其内容应根植于 \(\mathcal{D}\),即 \(a\) 的内容应可追溯到 \(\mathcal{D}\) 中某处陈述的事实,而非来自回答模型自身的参数化知识。我们假设 \(\mathcal{D}\) 是未标记的:在索引之前不存在针对 \(\mathcal{D}\) 标注的问答对,也没有在索引时向任何系统提供真实监督。这一假设排除了直接在 \(\mathcal{D}\) 上训练有监督图检索器的可能性,也是本节后续部分形式化的前提。

SelfGraphRAG解决的核心挑战在于最佳检索策略所需与未标记环境所提供的之间的不匹配:图检索模型学习打分与问题相关的子图,但训练它们需要基于目标图谱的标记问答数据集,而根据假设,对于 \(\mathcal{D}\) 这样的数据集不存在。完全避免这一要求的一种方法是退回到基于嵌入的检索,它不需要标记数据——但正如第2节所讨论的,基于嵌入的检索系统性地无法满足多跳问题的需求(其答案相关节点与查询在词汇上不相似),而这正是图检索旨在纠正的失效模式。SelfGraphRAG没有选择这条路。相反,它采用自监督:不依赖外部标记数据集,而是利用语料库图谱自身的结构来决定问什么,并通过辅助LLM调用生成问题-答案对本身,从而使得有监督的检索器即使在没有针对 \(\mathcal{D}\) 的人工标注数据的情况下也能进行训练。

**问题表述:** 令 \(M(\cdot; \pi)\) 表示在系统提示 \(\pi\) 条件下调用大型语言模型,接受文本输入并返回文本输出。我们统一使用此符号表示所有LLM调用。

相似文章

ContextRAG:面向检索增强生成的无抽取层次图构建

arXiv cs.CL

ContextRAG引入了一种无抽取方法,用于构建面向检索增强生成的层次图索引。该方法利用残差量化K均值(Residual-Quantization K-Means)和形式概念分析(Formal Concept Analysis),将大语言模型(LLM)调用和Token数量减少数个数量级,同时在多跳问题上保持具有竞争力的F1分数。