结构胜于规模:面向RAG的架构约束因果图

arXiv cs.AI 论文

摘要

本文介绍了HCG-RAG,它利用架构约束因果图进行检索增强生成,在医疗基准测试中,节点数减少3-20倍,LLM调用次数减少8-135倍,同时答案质量与基线相当或更优。

arXiv:2607.22592v1 公告类型:新提交 摘要:基于图的检索增强生成(GraphRAG)将答案建立在结构化知识之上,但当前系统会穷举地提取实体和关系,生成的图的大小和构建成本随语料库长度扩展,而非随查询所需的推理量扩展。我们提出了HCG-RAG(分层因果图RAG),它用架构约束因果图替代了开放式提取:一个自动化管道将语料库提炼为固定、类型化的因果变量词汇表,并在此基础上实现一个紧凑的两层图。我们的架构约束图在答案质量上与实体关系基线相当,但成本大幅降低:节点数减少3-20倍,构建时LLM调用次数比LLM最密集的基线(MS-GraphRAG)减少8-135倍,并且图足够紧凑,领域专家可以审计、修正和扩展。在医疗和临床基准测试中,包括一个经神经科医生验证的癫痫数据集,HCG-RAG达到或超过了最佳实体关系系统。一项消融实验将因果图作为结构化检索过滤器,相比仅使用嵌入检索,贡献了+6个百分点的提升。在所有存在可发现的分层因果结构的领域中,只有强制实施更高层次组织的方法才能超越平面实体关系检索,这表明图中放置的内容比包含的节点数量更重要。
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:25

# 结构优于规模:基于模式约束因果图的RAG方法
来源:https://arxiv.org/html/2607.22592
Marc Saouda Rajprakash Bale Eren Aldis Cloves Almeida 波士顿咨询集团 saouda\.marc@bcg\.com bale\.rajprakash@bcg\.com aldis\.eren@bcg\.com almeida\.cloves@bcg\.com

###### 摘要

基于图的检索增强生成(GraphRAG)将答案锚定在结构化知识中,但当前系统穷尽地提取实体和关系,生成的图其规模和构建成本随语料库长度而非查询所需的推理量增长。我们提出HCG-RAG(层次化因果图RAG),它用**模式约束的因果图**取代开放式提取:一条自动化流水线将语料库提炼为固定的、类型化的因果变量词汇表,并在其上物化一个紧凑的双层图。我们的模式约束图在答案质量上与实体关系基线相当,但成本大大降低:节点数量减少3–20倍,构建时LLM调用次数比最消耗LLM的基线(MS-GraphRAG)减少8–135倍,且图足够紧凑,可供领域专家审计、修正和扩展。在医学和临床基准测试(包括一个经神经科医生验证的癫痫数据集)上,HCG-RAG匹敌或超越最佳实体关系系统。消融实验将因果图隔离为**结构化检索过滤器**,相比仅用嵌入检索提升了+6个百分点(pp)。在所有具有可发现层次化因果结构的领域中,只有施加高层级组织的方法才能超越扁平实体关系检索,这表明图中放置**什么**比包含多少个节点更重要。

## 1 引言

检索增强生成(RAG)将LLM的回答锚定在外部知识中,通过将知识访问与参数记忆分离来提高事实性和适应性(Lewis et al., 2020 (https://arxiv.org/html/2607.22592#bib.bib5); Guu et al., 2020 (https://arxiv.org/html/2607.22592#bib.bib8); Karpukhin et al., 2020 (https://arxiv.org/html/2607.22592#bib.bib7); Gao et al., 2024 (https://arxiv.org/html/2607.22592#bib.bib6))。现代系统检索段落、跨文档融合证据、决定何时检索,或将检索与推理步骤交错进行(Izacard and Grave, 2021 (https://arxiv.org/html/2607.22592#bib.bib9); Jiang et al., 2023 (https://arxiv.org/html/2607.22592#bib.bib10); Trivedi et al., 2023 (https://arxiv.org/html/2607.22592#bib.bib11); Asai et al., 2024 (https://arxiv.org/html/2607.22592#bib.bib12))。这很强大,但本质上缺乏结构化:一个top-k检索器可以找出相关段落,而无需表示概念、机制和结果之间如何相互依赖。Graph RAG范式(Edge et al., 2024 (https://arxiv.org/html/2607.22592#bib.bib2); Guo et al., 2024 (https://arxiv.org/html/2607.22592#bib.bib3))通过从语料库中提取实体关系图来弥补这一差距,用于结构化、多跳检索。然而在实践中,这些系统穷尽地提取实体,生成的图其规模随语料库长度而非任务相关结构增长:MS-GraphRAG(Edge et al., 2024 (https://arxiv.org/html/2607.22592#bib.bib2))、LightRAG(Guo et al., 2024 (https://arxiv.org/html/2607.22592#bib.bib3))和Fast-GraphRAG(Circlemind AI, 2024 (https://arxiv.org/html/2607.22592#bib.bib4))在GraphRAG-Bench医学数据集上各自构建了4,800–5,800个节点的图(表1 (https://arxiv.org/html/2607.22592#S5.T1))。

规模问题在专门的科学和临床领域尤为明显,这些领域中有用的答案通常需要追踪机制性联系,而不仅仅是检索共同提及的实体。医学QA基准和临床LLM评估强调,正确答案通常依赖于干预措施、患者状态和结果,而不仅仅是主题重叠(Pal et al., 2022 (https://arxiv.org/html/2607.22592#bib.bib26); Singhal et al., 2023 (https://arxiv.org/html/2607.22592#bib.bib27))。在这样的环境中,节点为每个提取出的实体的图可能既大又与检索所需的推理变量较弱对齐。一个较小的图如果其词汇表局限于领域专家认可的因果量,则可能是更优的选择。

我们质疑这种规模是否对强检索是必要的。基于LLM能够高效发现因果结构(Jiralerspong et al., 2024 (https://arxiv.org/html/2607.22592#bib.bib23))以及因果图改善RAG检索(Wang et al., 2025 (https://arxiv.org/html/2607.22592#bib.bib24))的工作,我们提出HCG-RAG,一种从非结构化语料库构建**模式约束的层次化因果图**的系统:一条由LLM驱动的自动化流水线产生固定的、类型化的因果变量词汇表(定义1 (https://arxiv.org/html/2607.22592#Thmdefinition1)),双层图构建物化的图比同一语料库上的实体关系基线小3–20倍,且构建时LLM调用次数比MS-GraphRAG减少8–135倍(附录L (https://arxiv.org/html/2607.22592#A12))。图里放置**什么**以及检索如何使用它,改变了质量-效率前沿。

我们在三个语料库上进行评估:GraphRAG-Bench医学(2,062个问答)、GraphRAG-Bench小说(2,010个问答)和EpilepsyQA,这是一个我们根据两本开放获取的临床癫痫教科书整理并经两名委员会认证的神经科医生验证的375个问题基准。这种设计有意识地测试了预期场景和边界情况:医学和癫痫语料库包含层次化因果结构,而文学叙事则奖励广泛的实体和事件追踪。模式引导的因果构建在结构化知识语料库上以更小的图规模匹敌最佳实体关系基线,而实体关系方法在文学叙事上保持优势,因为那里基本不存在可发现的层次化因果结构(第5节 (https://arxiv.org/html/2607.22592#S5))。

我们做出三项贡献:111代码、评估脚本、EpilepsyQA问题和注释以及语料库重建说明可在https://anonymous.4open.science/r/hcg-rag获取。(i) 紧凑、可审查的图,质量具有竞争力:在医学和癫痫数据集上,模式约束构建产生的图比实体关系GraphRAG小3–20倍,小到足以让领域专家审计和修正,同时通过一个三阶段自动化流水线匹配答案质量,其查询路径仅需一次LLM调用和两次嵌入调用;(ii) 在专门领域中以结构优于规模:只有施加更高层级组织的检索方法才能超越扁平实体关系检索,而模式引导的因果图是其中一种精简、高精度的实例;(iii) EpilepsyQA,一个经过精心整理的临床癫痫基准,包含375个问题,涵盖六种推理类型,源自两本开放获取教科书并经两名委员会认证的神经科医生验证,作为评估领域专用检索系统的公共资源发布(第5节 (https://arxiv.org/html/2607.22592#S5)、第6节 (https://arxiv.org/html/2607.22592#S6))。

## 2 相关工作

#### 检索增强生成。

开放域问答和检索增强语言建模建立了在生成前检索外部证据的基本模式(Karpukhin et al., 2020 (https://arxiv.org/html/2607.22592#bib.bib7); Guu et al., 2020 (https://arxiv.org/html/2607.22592#bib.bib8); Lewis et al., 2020 (https://arxiv.org/html/2607.22592#bib.bib5))。后续工作改进了检索文本的消费方式,从融合-解码器架构(Izacard and Grave, 2021 (https://arxiv.org/html/2607.22592#bib.bib9))到决定何时检索、批判检索到的证据、或将检索与多步推理交错进行的系统(Jiang et al., 2023 (https://arxiv.org/html/2607.22592#bib.bib10); Trivedi et al., 2023 (https://arxiv.org/html/2607.22592#bib.bib11); Asai et al., 2024 (https://arxiv.org/html/2607.22592#bib.bib12))。这些方法主要将检索语料库视为文本。HCG-RAG则离线构建一个类型化的图,并仅用它来选择证据段落,为回答LLM提供文本支持而非图三元组。

#### 基于图的检索增强生成。

GraphRAG系统在三个维度上有所不同:**提取策略**(无约束实体提取 vs. 模式引导构建)、**图组织**(扁平实体关系图 vs. 社区摘要或类型化模式等层次化结构)以及**检索机制**(键值查找、个性化PageRank、社区级map-reduce或图遍历)。我们将HCG-RAG与代表这些维度的三个基线进行比较。MS-GraphRAG(Edge et al., 2024 (https://arxiv.org/html/2607.22592#bib.bib2))提取实体关系三元组,并应用Leiden社区检测和层次化摘要用于局部和全局搜索;LightRAG(Guo et al., 2024 (https://arxiv.org/html/2607.22592#bib.bib3))在LLM提取的实体关系图上增加了双层键值检索;Fast-GraphRAG(Circlemind AI, 2024 (https://arxiv.org/html/2607.22592#bib.bib4))用个性化PageRank取代社区检测。三者都共享**无约束实体提取**,产生大型异构图,其结构反映表面层面的提及。早期的图和文本QA系统也展示了在段落旁遍历结构化连接的价值(Sun et al., 2019 (https://arxiv.org/html/2607.22592#bib.bib16); Oguz et al., 2022 (https://arxiv.org/html/2607.22592#bib.bib17)),但通常假设已有知识图谱或学习一个统一的检索器来处理现有图/文本源。HCG-RAG用模式引导的因果构建取代无约束实体提取,产生小3–20倍但仍能捕获复杂推理所需因果结构的图。相对于当前GraphRAG-Bench的领先者,我们的目标因此是一个不同的操作点:在无约束图预算下以可比质量换取更少、类型化、可审计的图节点。

#### 知识图谱与LLM。

知识图谱增强可以通过将三元组、子图或图导出的文本上下文注入提示来改善LLM的事实性和推理能力(Baek et al., 2023 (https://arxiv.org/html/2607.22592#bib.bib14); Pan et al., 2024 (https://arxiv.org/html/2607.22592#bib.bib13))。最近系统将这一思想扩展到文本图理解,例如检索图上下文用于生成(He et al., 2024 (https://arxiv.org/html/2607.22592#bib.bib15))。这些方法主要询问如何在推理时使用现有的结构化资源。我们的场景在两方面有所不同:图是从非结构化语料库构建的,并且在图构建前其模式受到约束,使得节点表示类型化变量而非任意实体。

#### 基于LLM的因果发现与因果RAG。

经典因果发现从数据中推断图结构,依赖统计假设,而近期综述强调了这类方法在复杂领域中的前景和脆弱性(Glymour et al., 2019 (https://arxiv.org/html/2607.22592#bib.bib21))。LLM提供了另一种信号来源:它们编码了能够支持因果推理的背景知识,但基准也显示这种能力不均匀且必须受到约束(Kıcıman et al., 2024 (https://arxiv.org/html/2607.22592#bib.bib22); Jin et al., 2023 (https://arxiv.org/html/2607.22592#bib.bib25))。Jiralerspong等人(2024 (https://arxiv.org/html/2607.22592#bib.bib23))通过基于广度优先搜索(BFS)的查询在**预定义**变量集上发现因果有向无环图(DAG),Wang等人(2025 (https://arxiv.org/html/2607.22592#bib.bib24))在标准提取构建的实体关系图内增加逐查询LLM调用来追踪因果路径。HCG-RAG将因果推理推至**构建时**:一个类型化的因果模式(定义1 (https://arxiv.org/html/2607.22592#Thmdefinition1))同时发现变量和关系,固定的度量词汇表从设计上约束图仅包含因果相关概念,而查询时检索仅需嵌入匹配和BFS遍历(无需逐查询LLM因果推理)。新颖之处在于这种自动化变量发现、模式约束的因果图构建与仅证据检索的组合;先前的因果RAG系统要么假设预定义的变量集,要么在查询时对因果路径进行推理。

## 3 方法

### 3.1 问题设定

我们研究在答案通常依赖于因果机制的领域中,基于非结构化语料库D={di}i=1n\\mathcal\{D\}=\\\{d\_\{i\}\\\}\_\{i=1\}^\{n\}的检索增强问答。系统接收一个**结果配置**O\\mathcal\{O\},指定图角色,包括终端汇点度量(例如“患者结局”)和检索结果度量,这些度量指定用于图引导证据选择的端点节点。终端度量接收因果边但不发出边;非终端结果度量可能仍然参与上游或下游机制,但在到达时被视为检索端点。对于查询qq,该方法构建一个图G=(V,E,φ)G=\(\\mathcal\{V\},\\mathcal\{E\},\\phi\),包含变量节点V\\mathcal\{V\}、有向因果边E\\mathcal\{E\}以及证据映射φ:E→2C\\phi:\\mathcal\{E\}\\to 2^\{\\mathcal\{C\}\},将每条边链接到D\\mathcal\{D\}的块级划分C={cj}\\mathcal\{C\}=\\\{c\_\{j\}\\\}中的支持块。检索策略RG(q)⊆CR\_\{G\}\(q\)\\subseteq\\mathcal\{C\}从GG中选择证据,答案模型返回a=LLM(q,RG(q))a=\\mathrm\{LLM\}\(q,R\_\{G\}\(q\)\)。我们通过回答正确性、图紧凑性和构建/查询成本之间的联合权衡来评估HCG-RAG:更小的图可由人类审计,并支持专家在环的策展,而更低的API成本拓宽了部署范围。

HCG-RAG从非结构化语料库构建层次化因果图,并在查询时用于图引导的证据检索。给定(D,O)\(\\mathcal\{D\},\\mathcal\{O\}\),它分三个阶段进行(图1 (https://arxiv.org/html/2607.22592#S3.F1)):自动化领域规范生成(§3.2 (https://arxiv.org/html/2607.22592#S3.SS2))、双层图构建(§3.3 (https://arxiv.org/html/2607.22592#S3.SS3))以及图引导检索(§3.4 (https://arxiv.org/html/2607.22592#S3.SS4));算法1 (https://arxiv.org/html/2607.22592#alg1)(附录A (https://arxiv.org/html/2607.22592#A1))给出了完整的形式化规范。

非正式地说,一个规范沿四个概念组织领域。**维度**是分类轴,对领域进行分层(例如,疾病类型、解剖部位)。**度量**是沿这些轴可测量或可评估的量(例如,5年生存率)。**变量**将度量与特定维度实体配对以产生具体的可测量量(例如,“化疗对NSCLC的疗效”)。**种子边**是变量之间的有向因果关系,带有机制描述注释。

###### 定义1(领域图规范)

领域图规范是一个元组S=(A,M,V0,R0)\\mathcal\{S\}=\(\\mathcal\{A\},\\mathcal\{M\},\\mathcal\{V\}\_\{0\},\\mathcal\{R\}\_\{0\}\),其中:

- •A={(δi,Ei)}\\mathcal\{A\}=\\\{\(\\delta\_\{i\},E\_\{i\}\)\\\}是一组维度,每个维度是一个命名的轴δi\\delta\_\{i\},带有实体集EiE\_\{i\};
- •M\\mathcal\{M\}是一个**固定的**类型化度量集,每个度量有一个维度签名sig(m)⊆{δi}\\operatorname\{sig\}\(m\)\\subseteq\\\{\\delta\_\{i\}\\\},指定它绑定的维度;
- •V0\\mathcal\{V\}\_\{0\}是一个选定的变量集,

相似文章

ContextRAG:面向检索增强生成的无抽取层次图构建

arXiv cs.CL

ContextRAG引入了一种无抽取方法,用于构建面向检索增强生成的层次图索引。该方法利用残差量化K均值(Residual-Quantization K-Means)和形式概念分析(Formal Concept Analysis),将大语言模型(LLM)调用和Token数量减少数个数量级,同时在多跳问题上保持具有竞争力的F1分数。