从关联到因果:通过因果关系与注意力机制提升检索增强生成(RAG)的检索精度
摘要
本文介绍了一种基于因果图的注意力机制,以提升检索增强生成(RAG)系统中的检索精度,并在专有知识库的关键词填充机制中显示改进。
arXiv:2608.21702v1 Announce Type: new
摘要: 检索增强生成(RAG)将大型语言模型(LLM)的生成基于检索到的文档,但标准终端检索阶段——密集向量相似度,可选择后跟重排序——通常返回与查询共享关键词但不包含所需信息的文档,这种失败模式随着知识库的增大而加剧。我们将其追溯到一个概念上的差距:相似度仅捕获关联关系,而重要文档与查询之间存在因果关联。我们使用基于赖兴巴赫共同原因原则的因果图对终端检索阶段建模:查询和检索文档共享的关键词形成一个潜在共同原因A,文档的残余关键词形成一个潜在集合B,将文档与理想输出连接。由于检索文档是一个碰撞器(A -> d <- B),检索本身打开了查询与B之间的关联路径,这允许一个无需训练的注意力式重新评分规则:查询嵌入与B加权质心嵌入之间的余弦相似度。与在知识内容内部建模因果关系的因果增强RAG变体不同,我们的图建模了检索过程本身的因果结构。在一个真实的471文档企业知识库上,该方法将相关指南从第6名提升至前3名;在一个重现关键词填充机制的受控诊断语料库上,它将平均目标排名从2.88改善至1.25,而训练过的交叉编码器重排序器几乎没有帮助(2.63)。相反,在三个BEIR基准测试上,该得分低于相似度基线,划定了适用边界:该方法保护不断增长的专有知识库的关键词填充机制,并补充神经重排序器;一个语料库级校准门以≥95%的可靠性选择正确的机制。一个完全本地的测试平台展示了可部署性。
查看缓存全文
缓存时间: 2026/08/25 04:23
# 通过因果关系与注意力机制提升检索增强生成的检索精度
来源:https://arxiv.org/html/2608.21702
作者:Yongxing Qi, Muchen Jiang, Chengnan Hu, Qingqing Peng, Haoming Wang, Yuqing Wang, Yang Yu, Xu Zhang, Ting Wu
单位:杭州创新研究院,北京航空航天大学,杭州,中国
邮箱:[1530454772@qq\.com](mailto:)
###### 摘要
检索增强生成(RAG)将LLM的生成基于检索到的文档,但标准的终端检索阶段——基于稠密向量相似度,可选地加上重排序——返回的文档往往只是与查询共享关键词,而未包含所需信息,这种失败模式随着知识库的增大而加剧。我们将此追溯到一个概念鸿沟:相似度仅捕获*关联*关系,而重要的文档是与查询存在*因果*联系的。我们使用基于赖欣巴哈共同原因原则的因果图对终端检索阶段进行建模:查询与检索文档共享的关键词构成一个潜在的共同原因AA,而文档的残余关键词构成一个潜在集合BB,它将文档与理想输出联系起来。由于检索到的文档是一个碰撞器(A→d←BA\\\!\\rightarrow\\\!d\\\!\\leftarrow\\\!B),检索本身在查询和BB之间开启了一条关联路径,这许可了一种无需训练、注意力风格的重评分规则:查询嵌入与BB的加权质心嵌入之间的余弦相似度。与那些以构建LLM图和额外LLM调用为代价来对知识内容内部因果关系建模的因果增强RAG变体不同,我们的图对*检索过程本身*的因果结构进行建模。在一个真实的471份文档的企业知识库上,该方法将一个真正相关的指南从排名第6提升至前3;在一个再现关键词堆砌机制的受控诊断语料库上,它将平均目标排名从2\.88改善到1\.25,而经过训练的交叉编码器重排序器几乎无帮助(2\.63)。相反,在三个BEIR基准测试上,该分数低于相似度基线,这界定了其适用性边界:该方法保护不断增长的专有知识库中的关键词堆砌机制,并与神经重排序器互补;一个语料库级别的校准门以≥95%\\geq 95\%的可靠性选择正确的机制。一个完全本地的Qwen3\-4B/BGE\-M3测试平台证明了其实际可部署性。
## 1 引言
大型语言模型(LLM),如GPT系列,发展迅速并引起了全球关注。然而,当部署在垂直领域时,LLM会遭受幻觉困扰,且企业数据通常过于敏感,无法直接用于微调。因此,检索增强生成(RAG)[2 (https://arxiv.org/html/2608.21702#bib.bib2),3 (https://arxiv.org/html/2608.21702#bib.bib3)]已成为知识密集型应用的标准架构:首先将内部文档和知识库向量化;给定用户查询,检索相关文档并将其注入LLM的提示中,以提高生成内容的准确性和可靠性。
传统的RAG系统包含(i)一个*检索器*,通过向量相似度或语义匹配,从大型语料库中返回一组候选文本片段;(ii)一个*生成器*,通常是基于Transformer的LLM,根据查询和检索到的片段生成连贯的答案;以及(iii)一个*融合机制*——拼接、注意力或相关方案——将检索到的片段与生成器输入相结合。
该架构的薄弱环节在于检索阶段的末端(图1 (https://arxiv.org/html/2608.21702#S1.F1))。工业界和学术界主要计算查询向量与知识库向量之间的相似度,可选地进行重排序。通过实证研究我们观察到,随着知识库的持续增长,该流水线越来越会返回那些包含查询*关键词*但并非真正相关的文档,导致真正有用的本地信息无法到达LLM。例如,对于查询“如何评估跨境数据传输的安全性?”,一个传统的检索器将一条关于汽车数据处理指南的解读排在前5位,仅仅因为它包含了更多次的关键词“数据”、“跨境”、“安全”和“评估”。而真正相关的国家指南《信息安全技术—数据出境安全评估指南》仅排名第6:这些关键词主要出现在章节标题中,而实际描述评估程序的正文段落使用了不同的词汇。
我们将此失败追溯到一个概念鸿沟:基于相似度的检索识别的是*关联*,而用户需要的是*因果*包含答案的文档。本文做出以下贡献:
- •我们使用基于赖欣巴哈共同原则构建的因果图形式化RAG的终端检索阶段,并证明了一个碰撞器开启观察:检索文档(A→d←BA\\\!\\rightarrow\\\!d\\\!\\leftarrow\\\!B)在查询与文档的残余关键词集BB之间诱导了一种关联——该集合承载着包含答案的词汇(第3\.2节 (https://arxiv.org/html/2608.21702#S3.SS2))。
- •我们从该图推导出一个实用的、无需训练的重评分规则,其计算形式为注意力机制——查询嵌入与潜在关键词集BB的加权质心嵌入之间的余弦相似度——并附带复杂性分析,表明其相对于传统流水线的开销可忽略不计(第3\.4节 (https://arxiv.org/html/2608.21702#S3.SS4))。
- •我们将该方法与近期关于自适应、纠正性、图结构化和因果增强RAG的工作进行定位(第2节 (https://arxiv.org/html/2608.21702#S2)),表明据我们所知,这是唯一一种对*检索过程本身*的因果结构进行建模的方法,而非对知识内容建模。
- •我们展示该构建与因果图模型的标准假设(DAG、因果充分性、因果马尔可夫性和忠实性)一致,并在三个层面上评估该方法:一个真实的471份文档的专有知识库、一个再现关键词堆砌机制的受控诊断实验,以及三个界定其适用性边界的公开BEIR基准测试,外加一个基于Qwen3\-4B和BGE\-M3的完全本地复现测试平台(第4节 (https://arxiv.org/html/2608.21702#S4))。
该方法的早期版本已于2024年在一个中国发明专利申请中公开,并已获得授权[1 (https://arxiv.org/html/2608.21702#bib.bib1)]。本文提供了完整的形式化、理论分析和实证评估,包括第3\.4节 (https://arxiv.org/html/2608.21702#S3.SS4)的语义吸收细化和第4\.5节 (https://arxiv.org/html/2608.21702#S4.SS5)的公开基准边界研究,这些内容超越了原始公开披露。
图1:在RAG终端检索阶段所提方法的统一视图(从底层发明公开[1 (https://arxiv.org/html/2608.21702#bib.bib1)]中的流程-因果图重绘为英文)。实线箭头:数据流。红色虚线箭头:查询qq、第一轮候选集S1S\_\{1\}、理想输出yy以及两个潜在关键词集AA和BB之间的因果方向(参见图2 (https://arxiv.org/html/2608.21702#S3.F2)中的抽象因果图)。步骤1使用查询嵌入与其残余关键词集BB的质心之间的注意力风格点积对每个候选进行评分;步骤2从重排序后的集合构建提示。候选集S1S\_\{1\}是一个碰撞器(A→d←BA\\\!\\rightarrow\\\!d\\\!\\leftarrow\\\!B),这为步骤1的评分提供了依据(观察1 (https://arxiv.org/html/2608.21702#Thmobservation1))。
## 2 相关工作
#### RAG及其检索阶段
RAG由[2 (https://arxiv.org/html/2608.21702#bib.bib2)]以及预训练时变体如REALM[4 (https://arxiv.org/html/2608.21702#bib.bib4)]和RETRO[5 (https://arxiv.org/html/2608.21702#bib.bib5)]普及,已成为LLM的标准落地机制[3 (https://arxiv.org/html/2608.21702#bib.bib3)]。关于检索阶段的工作改进了编码器(DPR[6 (https://arxiv.org/html/2608.21702#bib.bib6)]、Contriever[7 (https://arxiv.org/html/2608.21702#bib.bib7)]、BGE和BGE\-M3[8 (https://arxiv.org/html/2608.21702#bib.bib8),9 (https://arxiv.org/html/2608.21702#bib.bib9)])和重排序器(交叉编码器、ColBERT式后期交互[10 (https://arxiv.org/html/2608.21702#bib.bib10)])。所有这些都是优化从相关特征估计的关联分数;没有对文档为何相关进行建模。
#### 自适应和纠正性RAG
最近的一系列工作让系统决定*何时*以及*检索什么*,以及如何从检索错误中恢复:Self\-RAG教导生成器按需检索并通过反思标记进行自我批评[11 (https://arxiv.org/html/2608.21702#bib.bib11)];FLARE在生成过程中执行前瞻性的主动检索[12 (https://arxiv.org/html/2608.21702#bib.bib12)];CRAG对检索到的文档进行评分,并将低置信度结果路由到纠正性操作[13 (https://arxiv.org/html/2608.21702#bib.bib13)];RA\-DIT对检索器和生成器进行双指令微调[14 (https://arxiv.org/html/2608.21702#bib.bib14)]。这些方法提高了检索阶段周围的鲁棒性,但仍然通过学习到的关联对候选进行评分;决定什么进入提示的标准仍然是相关性的。
#### 查询扩展和假设文档
解决词汇不匹配的一个经典补救措施是扩展查询:相关反馈和Rocchio方法[15 (https://arxiv.org/html/2608.21702#bib.bib15)]、相关模型(RM3)[16 (https://arxiv.org/html/2608.21702#bib.bib16)],以及最近的LLM生成的伪内容,如HyDE[17 (https://arxiv.org/html/2608.21702#bib.bib17)]和Query2doc[18 (https://arxiv.org/html/2608.21702#bib.bib18)]。这些方法用假设的、承载答案的内容来增强*查询*,并嵌入结果。我们的构建是双重视角:与其在查询侧虚构内容,我们提炼每个候选*文档*为一个残余关键词集,其参与性由因果图证明,并将其与未修改的查询进行评分。这两个方向是互补的,可以结合起来。
#### 以术语为中心的和学习到的稀疏检索
我们对关键词集的使用与以术语为中心的神经信息检索相关:DeepCT根据上下文重要性重新加权术语[19 (https://arxiv.org/html/2608.21702#bib.bib19)],doc2query/DocT5Query使用预测的查询扩展文档[20 (https://arxiv.org/html/2608.21702#bib.bib20)],SPLADE系列端到端学习稀疏术语权重表示[21 (https://arxiv.org/html/2608.21702#bib.bib21)]。这些方法从相关性监督(即关联信号)中学习术语权重;而我们则*从检索过程的因果结构构建*术语集(AA,BB),这是无需训练的,且可在任何编码器之上工作。
#### 图结构化和因果增强RAG
GraphRAG构建一个LLM提取的实体图,带有社区摘要,用于面向查询的全局意义理解[22 (https://arxiv.org/html/2608.21702#bib.bib22)];LightRAG将图索引与双层检索结合以提高效率[23 (https://arxiv.org/html/2608.21702#bib.bib23)];HippoRAG使用个性化PageRank构建知识图谱记忆以进行关联检索[24 (https://arxiv.org/html/2608.21702#bib.bib24)]。与我们主题最接近的是CausalRAG,它将因果图集成到检索中,通过将查询匹配到图节点、沿边扩展,并使用LLM将*文档内容内部*的因果路径追踪到因果摘要[25 (https://arxiv.org/html/2608.21702#bib.bib25)];Samarajeewa等人类似地在预检索阶段检索因果图[26 (https://arxiv.org/html/2608.21702#bib.bib26)]。关键区别在于因果关系所在之处:这些方法对*知识内容内部*的因果关系进行建模(例如,*影响策略*→\\rightarrow*买家注意力*→\\rightarrow*合同授予*),代价是构建LLM图和在查询时额外的LLM调用。我们对*检索过程本身*的因果结构进行建模——查询、检索集和理想输出之间的生成关系——并从该结构的碰撞器分析推导出一个评分规则。两者是互补的:我们的重排序器可以处理由上述任何系统生成的候选集。
#### 因果推断
赖欣巴哈的共同原因原则指出,如果两个事件正相关且互不引起,则存在一个共同原因将它们屏蔽开[32 (https://arxiv.org/html/2608.21702#bib.bib32)]。现代因果发现通过因果马尔可夫和忠实性假设下的因果图形式化了此类推理[35 (https://arxiv.org/html/2608.21702#bib.bib35),36 (https://arxiv.org/html/2608.21702#bib.bib36),33 (https://arxiv.org/html/2608.21702#bib.bib33),37 (https://arxiv.org/html/2608.21702#bib.bib37)],近期工作探讨了LLM能在多大程度上从相关性推理到因果性[27 (https://arxiv.org/html/2608.21702#bib.bib27)]。碰撞器(X→Z←YX\\rightarrow Z\\leftarrow Y)在边际上阻断其父节点之间的路径,但对其进行条件化则诱导了它们之间的依赖性——“消除解释”效应[36 (https://arxiv.org/html/2008.21702#bib.bib36)]。在推荐系统中,因果结构被用于*消除*偏差,例如通过后门调整对流行度混杂因素进行干预[28 (https://arxiv.org/html/2608.21702#bib.bib28)]。我们以相反的方向使用因果结构,并且根本不做调整:我们利用碰撞器在查询和残余关键词集之间*创造*的依赖性。
#### 定位
综上所述,现有工作沿着关联轴改进RAG检索——更好的编码器、重排序器、查询扩展、自适应性或图结构——而因果增强变体则对知识内容内部的因果关系进行建模,并以构建LLM图和每次查询LLM调用为代价。据我们所知,没有先前的工作对检索过程本身的因果结构进行建模,或从该结构的碰撞器/共同原因分析中推导出重新评分规则。本文所提方法同时具有因果动机、无需训练、查询时无需额外LLM调用,并且与上述所有方法正交;其目标失败模式——在不断增长的知识库中的关键词堆砌假阳性——正是纯关联分数退化的领域。
## 3 方法
### 3\.1 问题设定与符号
令qq为用户查询,K\\mathcal\{K\}为包含NN个文档的知识库。标准的终端检索阶段计算稠密嵌入E\(⋅\)∈RhE\(\\cdot\)\\in\\mathbb\{R\}^\{h\}(例如,BGE\-M3的h=1,024h\{=\}1\{,\}024),通过余弦相似度对文档进行排序相似文章
为什么检索增强生成会失败:图视角
本文探讨了检索增强生成(RAG)系统即使在获取到正确证据的情况下仍然失败的原因。通过电路追踪和归因图,作者发现正确的预测展现出更深的推理路径和更分散的证据流,而失败则表现为浅层、碎片化的模式。他们提出了一个基于图的错误检测框架和有针对性的干预措施,以提高RAG的可靠性。
故障传播之时:智能体检索增强生成中的因果故障归因
本文介绍了AgenticRAG-FP,一个用于智能体RAG系统中因果故障归因的干预基准,分析了故障如何在检索跳数间传播,并评估了诊断性能。
结构胜于规模:面向RAG的架构约束因果图
本文介绍了HCG-RAG,它利用架构约束因果图进行检索增强生成,在医疗基准测试中,节点数减少3-20倍,LLM调用次数减少8-135倍,同时答案质量与基线相当或更优。
检索增强生成解决了大多数团队实际上并不存在的问题
文章论点是检索增强生成(RAG)在AI系统中经常被误用,真正的问题在于上下文策展而非检索。它表明RAG仅对大规模、频繁变化的语料库真正有益。
面向检索增强生成的源感知重排序:一种可靠性先验方法
本文介绍了一种面向RAG的源感知重排序方法,该方法引入了基于领域信息的源可靠性先验,在一个由120份文档组成的健康领域语料库上将Precision@5从0.48提升至0.72,并减少了对抗性文档的检索。