ContextRAG:面向检索增强生成的无抽取层次图构建
摘要
ContextRAG引入了一种无抽取方法,用于构建面向检索增强生成的层次图索引。该方法利用残差量化K均值(Residual-Quantization K-Means)和形式概念分析(Formal Concept Analysis),将大语言模型(LLM)调用和Token数量减少数个数量级,同时在多跳问题上保持具有竞争力的F1分数。
arXiv:2605.19735v1 公告类型:新
摘要:图结构检索增强生成(RAG)系统能够提升多跳问题的回答质量,但当前许多系统在索引构建时依赖大语言模型(LLM)来抽取实体、关系和摘要。这些调用增加了Token和时间成本,且随语料库规模增长。我们提出ContextRAG,一种图RAG系统,其图拓扑结构无需基于LLM的实体或关系抽取即可构建。ContextRAG利用残差量化k均值和基于Lukasiewicz剩余逻辑的形式概念分析,从分块嵌入中推导出模糊概念图。桥接类和交派生上下文节点通过软模糊连接和交运算生成,而非LLM撰写的图边。在包含130个任务的UltraDomain子集上,ContextRAG构建索引仅需30次LLM调用和22,073个Token。相比之下,本地HiRAG复现的压力测试在20个任务的子集上需要870次索引调用和354万个Token,随后在图构建过程中失败;线性外推至130个任务意味着超过2300万个索引Token。ContextRAG整体F1得分为33.6%,多跳任务F1为36.8%。激活分析显示,在前五名中检索到至少一个格派生节点的查询,其F1比未检索到的查询高+3.9个百分点;这种关联是诊断性的而非因果性的。
查看缓存全文
缓存时间: 2026/05/20 08:26
# 免提取的层次化图构建方法用于检索增强生成
来源:https://arxiv.org/html/2605.19735
Roman Prosvirnin 高等经济大学 rprosvirnin@hse\.ru & Sergei Kuznetsov 高等经济大学 skuznetsov@hse\.ru & Seungmin Jin 高等经济大学 sedzhin@hse\.ru
###### 摘要
基于图结构的检索增强生成(RAG)系统能够提升多跳问题的回答质量,但当前系统在索引阶段常依赖大型语言模型(LLM)来提取实体、关系和摘要。这些调用带来的令牌开销和时间成本会随语料规模增长。我们提出 ContextRAG,一个无需基于 LLM 进行实体或关系提取即可构建图拓扑的图 RAG 系统。ContextRAG 通过残差量化 K 均值聚类和基于 Łukasiewicz 剩余逻辑的形式概念分析,在文本块嵌入基础上推导出模糊概念图。桥接节点和基于交的上下文节点通过软模糊并、交操作生成,而非通过 LLM 编写的图边。在包含 130 个任务的 UltraDomain 子集上,ContextRAG 仅用 30 次 LLM 调用和 22,073 个令牌完成索引构建。而本地 HiRAG 复现压力测试在 20 个任务的子集上已消耗 870 次索引调用和 354 万个令牌,并在图构建过程中失败;外推至 130 个任务意味着超过 2300 万索引令牌。ContextRAG 整体 F1 得分为 33.6%,多跳任务 F1 为 36.8%。激活分析表明,检索时前五结果中包含至少一个格派生节点的查询,其 F1 比不含的查询高 3.9 个百分点;该关联为诊断性而非因果性。
ContextRAG:免提取的层次化图构建方法用于检索增强生成
Roman Prosvirnin 高等经济大学 rprosvirnin@hse\.ru & Sergei Kuznetsov 高等经济大学 skuznetsov@hse\.ru & Seungmin Jin†† 通讯作者。 高等经济大学 sedzhin@hse\.ru
## 1 引言
检索增强生成(RAG)是将大型语言模型(LLM)回复扎根于外部知识的广泛使用范式 (Lewis et al., 2020 (https://arxiv.org/html/2605.19735#bib.bib1))。早期系统基于平坦向量索引进行检索,但近期工作表明,图结构索引(编码实体、关系和层次社区)在多跳和全局摘要查询上能带来显著收益 (Edge et al., 2024 (https://arxiv.org/html/2605.19735#bib.bib3); Guo et al., 2024 (https://arxiv.org/html/2605.19735#bib.bib4); Huang et al., 2025 (https://arxiv.org/html/2605.19735#bib.bib6))。当前最先进的图 RAG 系统,如 GraphRAG、LightRAG、KAG 和 HiRAG,在构建索引时需要发出大量 LLM 调用来提取实体、总结社区并构建层次化知识图。这种索引阶段的 LLM 使用构成了严重操作瓶颈。在 UltraDomain 基准的一个子集上,我们的本地 HiRAG 复现压力测试在仅 20 个任务上就发出了 870 次 LLM 调用并消耗 354 万令牌,随后在图构建过程中失败;线性外推至 130 个任务子集,则需超过 5600 次 LLM 调用和 2300 万索引令牌。该成本随语料规模增长,且每当语料更新、分块策略改变或采用不同 LLM 时都需要重新支付。对于许多实际部署场景(企业内部语料、科学文献检索、不断演变的知识库),这种成本结构令人望而却步。我们提出疑问:LLM 提取对于图 RAG 是否*绝对必要*?或者能否从数据派生的代数结构中获得有用的结构优势?我们发现,在此设定下,构建可用的图索引并不严格需要 LLM 提取,尽管 LLM 提取的图可能仍能提供更强的回答质量。我们引入 ContextRAG,一个图构建流程无需提取的图 RAG 系统。该系统建立在三大理论支柱之上:
- • 残差量化 K 均值聚类(RQ-KMeans),用于对密集文本块嵌入进行层次聚类,提供多级属性集;
- • 基于模糊形式背景的形式概念分析(FCA),生成格启发的图节点,其外延和内涵定义了检索结构;
- • 用于模糊伽罗瓦连接和原则性查询时路由得分的 Łukasiewicz 剩余逻辑。
图拓扑由数据几何结构通过模糊 FCA 启发的结构决定,而非由 LLM 提取质量决定。在我们的实现中,结构图的构建是免提取的;唯一在索引阶段使用 LLM 的是独立的一组 30 个聚类摘要虚拟块,并且此成本已计入所有统计中。
1. 本文提出了一种基于模糊形式概念分析和 Łukasiewicz 剩余逻辑的免提取图构建流程,该路径不依赖 LLM 提取的实体或关系来实现图 RAG。
2. 我们在 130 个任务的 UltraDomain 子集上的结果表明,ContextRAG 仅用 30 次 LLM 调用和 22,073 个令牌即可完成语料索引,而本地 HiRAG 复现压力测试的索引成本高出数个数量级。
3. 对 FCA 启发的模糊图进行的激活分析(当格派生节点出现在检索结果中时 F1 提升 3.9 个百分点)报告了诊断性关联而非因果证据。
4. 成本模式分析表明,ContextRAG 在语料频繁重新索引的低查询量和中等查询量工作负载中最具吸引力。
论文剩余部分组织如下:第 2 节 (https://arxiv.org/html/2605.19735#S2) 回顾图 RAG 方法以及形式概念分析在信息检索中的应用。第 3 节 (https://arxiv.org/html/2605.19735#S3) 介绍代数背景。第 4 节 (https://arxiv.org/html/2605.19735#S4) 描述 ContextRAG 架构。第 5–7 节 (https://arxiv.org/html/2605.19735#S5) 报告实验、结果和激活分析。第 8 节 (https://arxiv.org/html/2605.19735#S8) 分析成本与权衡。
## 2 相关工作
#### 向量 RAG 与图 RAG。
标准的*朴素 RAG* 流程使用密集或混合稀疏-密集评分从向量索引中检索文本块 (Karpukhin et al., 2020 (https://arxiv.org/html/2605.19735#bib.bib2))。虽然对于单跳事实性查询有效,但朴素 RAG 在答案需要跨多个文档组合证据时表现不佳。图 RAG 系统通过在语料上构建结构化索引来弥补这一差距。GraphRAG (Edge et al., 2024 (https://arxiv.org/html/2605.19735#bib.bib3)) 使用 LLM 提取实体和关系,通过 Leiden 聚类检测社区,并生成层次化社区摘要,在检索时被查询。LightRAG (Guo et al., 2024 (https://arxiv.org/html/2605.19735#bib.bib4)) 将此流程简化为双层(实体级和关系级)知识图,同样由 LLM 提取填充。KAG (Liang et al., 2024 (https://arxiv.org/html/2605.19735#bib.bib5)) 引入了模式引导的提取步骤,施加类型化实体和关系,以提高提取可靠性,代价是更重的 LLM 使用。HiRAG (Huang et al., 2025 (https://arxiv.org/html/2605.19735#bib.bib6)) 构建了一个三级层次化知识图(实体、摘要和桥接层),使用广泛的 LLM 提取和社区聚类流程。这四个系统共享同一个架构承诺:*LLM 在索引阶段处于循环之中*,且图结构全部或部分由 LLM 输出决定。
#### 基于 LLM 的索引成本。
近期调查强调,LLM 驱动的索引可能是图 RAG 的主要成本 (Gao et al., 2023 (https://arxiv.org/html/2605.19735#bib.bib7); Zhao et al., 2024 (https://arxiv.org/html/2605.19735#bib.bib8))。令牌消耗可能随语料规模扩展不佳,因为提取流程在剪枝前常多次访问大量文本块、实体或关系候选,且当实体变化时社区摘要必须重新生成。一些工作提出了部分缓解措施——缓存提取输出、选择性摘要或使用较小蒸馏提取器——但据我们所知,此前未有工作展示一种图 RAG 系统,能在图构建中移除 LLM 提取的同时保留非平凡图结构。
#### 信息检索中的形式概念分析。
形式概念分析 (Ganter and Wille, 2024 (https://arxiv.org/html/2605.19735#bib.bib9)) 在信息检索中有着悠久历史,作为从术语-文档关联矩阵中组织文档成概念层次的方法 (Carpineto and Romano, 2004 (https://arxiv.org/html/2605.19735#bib.bib10); Priss, 2006 (https://arxiv.org/html/2605.19735#bib.bib11))。FCA 的模糊扩展 (Bělohlávek, 2002 (https://arxiv.org/html/2605.19735#bib.bib12)) 用分级隶属度替代二元关联,并依赖剩余格作为代数结构。尽管基于 FCA 的检索已被广泛研究,但其与现代密集嵌入、残差层次聚类和 LLM 答案生成的集成,据我们所知此前未被探索。ContextRAG 将 FCA 定位为现代 RAG 中 LLM 提取知识图的结构性替代。
#### 层次量化。
残差量化 (Gray, 1984 (https://arxiv.org/html/2605.19735#bib.bib14); Babenko and Lempitsky, 2015 (https://arxiv.org/html/2605.19735#bib.bib15)) 是最近邻搜索中的经典技术,将向量分解为来自连续码本的码字之和,每个码本拟合前一级别的残差。近期工作使用 RQ 风格结构进行检索索引压缩 (Matsui et al., 2018 (https://arxiv.org/html/2605.19735#bib.bib16))。ContextRAG 将 RQ-KMeans 重新用于获得多级聚类分配,这些分配成为形式概念格中的属性,而非用于压缩。
## 3 背景
### 3.1 形式概念分析
形式概念分析 (Ganter and Wille, 2024 (https://arxiv.org/html/2605.19735#bib.bib9)) 提供了从数据中推导层次化概念结构的数学框架。一个*形式背景*是一个三元组 \(K=(G,M,I)\),其中 \(G\) 是对象集,\(M\) 是属性集,\(I\subseteq G\times M\) 是关联关系。由 \(I\) 诱导的伽罗瓦连接为:
\[
\begin{aligned}
A^{\uparrow} &= \{m\in M\mid \forall g\in A: (g,m)\in I\}, \tag{1} \\
B^{\downarrow} &= \{g\in G\mid \forall m\in B: (g,m)\in I\}. \tag{2}
\end{aligned}
\]
一个*形式概念*是一个对 \((A,B)\),满足 \(A^{\uparrow}=B\) 且 \(B^{\downarrow}=A\)。所有形式概念按 \((A_1,B_1)\leq(A_2,B_2)\iff A_1\subseteq A_2\) 排序,构成一个完备代数格,具有下确界(交)和上确界(并)运算。这种代数完备性使得 FCA 可作为形式概念上的导航结构;我们的实现使用该结构作为有限图构建模板,而非枚举每个概念。
### 3.2 基于 Łukasiewicz 逻辑的模糊扩展
经典 FCA 基于二元隶属度,当文本块部分属于多个聚类时会丢失信息。FCA 的模糊扩展(例如 Bělohlávek, 2002 (https://arxiv.org/html/2605.19735#bib.bib12))将二元关联替换为模糊隶属度 \(I:G\times M\to[0,1]\)。此时代数结构是一个剩余格 \(([0,1],\leq,\wedge,\vee,\otimes,\to)\),其中剩余对 \((\otimes,\to)\) 满足伴随条件:
\[
a\otimes b\leq c\iff a\leq b\to c. \tag{3}
\]
我们使用 Łukasiewicz t-模 (Hájek, 1998 (https://arxiv.org/html/2605.19735#bib.bib13)):
\[
\begin{aligned}
a\otimes b &= \max(0, a+b-1), \tag{4} \\
a\to b &= \min(1, 1-a+b). \tag{5}
\end{aligned}
\]
选择此 t-模出于三个性质:(i) Łukasiewicz 逻辑诱导的标准否定是对合的 (\(\neg\neg a=a\)),这为分级缺失和存在提供了简单解释;(ii) 剩余项具有闭式解析表达式,能高效计算模糊伽罗瓦连接;(iii) t-模在 0 和 1 处饱和,保持层次聚合数值稳定。模糊伽罗瓦连接为:
\[
\begin{aligned}
A^{\uparrow}(m) &= \inf_{g\in G} \bigl( A(g)\to I(g,m) \bigr), \tag{6} \\
B^{\downarrow}(g) &= \inf_{m\in M} \bigl( B(m)\to I(g,m) \bigr). \tag{7}
\end{aligned}
\]
模糊形式概念的集合在模糊集的逐点序下形成完备模糊概念格 (Bělohlávek, 2002 (https://arxiv.org/html/2605.19735#bib.bib12))。计算初始隶属度值时,我们使用标准 FCM 模糊指数 \(m=2.0\),以平衡硬聚类行为 (\(m\to1\)) 和完全扩散隶属度 (\(m\to\infty\))。
### 3.3 格算子作为图节点类型
两个基本格运算在 ContextRAG 图中催生了两种衍生节点类型。在实现中,我们在检索时剪枝之前使用这些算子的软模糊版本。
#### 并 (\(\vee\)) —— 最小上界。
在模糊外延的逐点序下,并是覆盖两个输入概念的最小概念。两个概念之并的外延是概念外延模糊并的闭包:
\[
A_{1\vee 2}= \left( \max(A_1, A_2) \right)^{\uparrow\downarrow}. \tag{8}
\]
实践中,我们通过模糊并 \(\max(A_1(g), A_2(g))\) 来实例化软并。这些并节点编码了覆盖来自任一聚类的文本块的*泛化*,充当跨聚类桥接。它们扮演的角色类似于 HiRAG 的桥接知识,但来源于聚类几何而非基于 LLM 的实体共现。
#### 交 (\(\wedge\)) —— 最大下界。
交捕获两个概念共享的部分。对于模糊外延,软交实现为模糊交集:
\[
A_{1\wedge 2}^{\mathrm{soft}}(g)=\min(A_1(g), A_2(g)). \tag{9}
\]
交节点编码*特化*:同时以高隶属度属于多个聚类的文本块。我们将这些主题密集的交集用作基于交的上下文节点。
### 3.4 残差量化 K 均值聚类
为了获得 FCA 所需的属性集 \(M\),我们使用残差量化 K 均值聚类(RQ-KMeans),这是一种受经典残差向量量化启发的层次聚类过程 (Gray, 1984 (https://arxiv.org/html/2605.19735#bib.bib14); Babenko and Lempitsky, 2015 (https://arxiv.org/html/2605.19735#bib.bib15))。设 \(X=\{x_1,\dots,x_n\}\subseteq\mathbb{R}^d\) 为文本块嵌入矩阵。我们定义 \(L\) 个级别,码本为 \(C_0, C_1, \dots, C_{L-1}\):
\[
\begin{aligned}
r^{(0)}(x) &= x, \tag{10} \\
Q^{(\ell)}(x) &= \arg\min_{c\in C_\ell} \| r^{(\ell)}(x)-c \|^2, \tag{11} \\
r^{(\ell+1)}(x) &= r^{(\ell)}(x) - c^{(\ell)}_{Q^{(\ell)}(x)}. \tag{12}
\end{aligned}
\]
我们使用 \(|C_0|=96\),\(|C_1|=24\),\(|C_2|=12\)。三个性质促成了此设计:(i) 层次特异性——\(L_0\) 捕获粗粒度主题,\(L_1\) 捕获主题内变化,\(L_2\) 可捕获更细的残差。相似文章
LightRAG:简单高效的检索增强生成框架
本文介绍了 LightRAG,这是一个开源框架,通过整合图结构来提升检索增强生成(RAG)的上下文感知能力与信息检索效率。
上下文感知与关系感知的图检索增强生成的统一框架
本文提出了HyGRAG,一种层次化图RAG框架,整合了上下文与关系信息以支持多跳推理,在现有方法基础上实现了平均准确率提升9.7%。
结构胜于规模:面向RAG的架构约束因果图
本文介绍了HCG-RAG,它利用架构约束因果图进行检索增强生成,在医疗基准测试中,节点数减少3-20倍,LLM调用次数减少8-135倍,同时答案质量与基线相当或更优。
上下文优化下的检索增强生成:从梯度下降视角
本文研究检索增强生成作为上下文优化过程,表明线性自注意力可以在统一的RAG目标上实现梯度下降。它提出了一种轻量级方法,适用于冻结的RAG大语言模型,通过预测上下文条件的更新,在多个问答基准上提升了性能。
HyCE-RAG: 基于超图证据链的检索增强生成用于可解释的多跳问答
HyCE-RAG 是一种新颖的基于超图的检索增强生成框架,专为多跳问答设计,通过置信度感知的启发式搜索构建显式证据链,在准确性、相关性和忠实度方面优于标准 RAG 和基于图的 RAG 方法。