语义压缩树:通过分层语义残差实现多分辨率知识检索

arXiv cs.AI 论文

摘要

介绍语义压缩树(SCT)用于检索增强生成(RAG)中的分层知识检索,展示了在令牌使用上的效率提升,但与扁平方法相比检索性能表现不一。

arXiv:2608.21610v1 公告类型:新 摘要:检索增强生成主要依赖于扁平的、固定粒度的索引:文档被切割成均匀的块并通过相似性检索,丢弃了源数据的分层结构。我们引入语义压缩树(SCT),这是一种分层索引,其中每个节点仅存储其语义残差——即它在父节点之上添加的信息——检索通过从根节点逐级下降进行,因此每次查询的成本由树深度而非集合大小决定。 我们在QASPER(50篇论文,173个问题)上评估,使用两种协议,仅在基准是否提供相关文档方面有所不同,全程使用bootstrap置信区间和配对显著性检验。结果表现不一,我们如实报告。当文档提供时,使用零LLM提取压缩器的SCT在答案质量上与密集检索相当(0.274 vs. 0.277 F1,$p = 0.37$),使用30%更少的上下文令牌且无需LLM调用来构建索引,并且残差存储优于在每个节点存储完整摘要(0.274 vs. 0.205,$p < 0.001$)。将集合增加五十倍,扁平检索的每次查询评分工作乘以48.9倍,SCT的乘以6.4倍。 渐进式下降本身不受支持。在没有树的情况下检索相同的残差,当文档提供时表现相同($p = 0.27$),而当系统必须选择文档时,下降性能显著更差(0.122 vs. 0.165,$p < 0.001$)。路由准确性定位了原因:下降仅在20.2%的时间内选择正确论文,而扁平检索为39.3%,因为该选择是从根残差做出的,根残差是树中最压缩的节点。我们得出结论,残差表示值得保留,而自上而下的路由则不值得。
查看原文
查看缓存全文

缓存时间: 2026/08/25 04:21

# 通过层次化语义残差实现多分辨率知识检索
来源: https://arxiv.org/html/2608.21610
## 语义压缩树:通过层次化语义残差实现多分辨率知识检索

###### 摘要

检索增强生成主要依赖于扁平、固定粒度的索引:文档被切割成均匀的块并通过相似度检索,忽略了源文档的层次结构。我们引入**语义压缩树(SCT)**,这是一种层次化索引结构,其中每个节点仅存储其*语义残差*——即它在父节点基础上新增的信息。检索通过从根节点逐层下降进行,从而使得每次查询的代价由树的深度而非集合的大小决定。

我们在 QASPER(Dasigi 等人,2021 (https://arxiv.org/html/2608.21610#bib.bib5))(50 篇论文,173 个问题)上进行了评估,实验采用两种协议,唯一区别在于基准数据集是否提供相关文档。整个评估过程使用了 bootstrap 置信区间和配对显著性检验。结果是混合的,我们如实报告了这些结果。当文档已给定时,使用零 LLM 提取式压缩器的 SCT 在答案质量上与密集检索相当(0.274 vs. 0.277 F1, p=0.37),但使用的上下文 token 减少了 30%,且构建索引时无需进行 LLM 调用。此外,残差存储在每个节点优于存储完整摘要(0.274 vs. 0.205, p<0.001)。当集合大小增加 50 倍时,扁平检索的每次查询评分工作量增加了 48.9 倍,而 SCT 仅增加了 6.4 倍。

逐层下降本身并不理想。在文档已给定时,不使用树结构而检索相同的残差结果相同(p=0.27);而当系统必须选择文档时,逐层下降的表现显著更差(0.122 vs. 0.165, p<0.001)。路由准确率揭示了原因:逐层下降仅 20.2% 的时间选择了正确的论文,而扁平检索为 39.3%,因为这个选择是在根节点残差(树中最压缩的节点)上做出的。我们得出结论:值得保留的是残差表示,而非自上而下的路由。

## 1 引言

检索增强生成(RAG)已成为将大型语言模型(LLMs)与外部知识相结合的主流范式(Lewis 等人,2020 (https://arxiv.org/html/2608.21610#bib.bib24); Guu 等人,2020 (https://arxiv.org/html/2608.21610#bib.bib12))。标准流程——将文档分块为固定大小的段落,将其嵌入到稠密向量空间(Karpukhin 等人,2020 (https://arxiv.org/html/2608.21610#bib.bib19)),并在查询时检索最相似的 top-k 个块——概念简单且应用广泛(Gao 等人,2024 (https://arxiv.org/html/2608.21610#bib.bib8))。然而,这种扁平检索方法存在三个根本性局限,本文旨在解决这些问题。

**相似性 ≠ 相关性**。稠密检索模型衡量的是嵌入空间中的语义邻近度(Karpukhin 等人,2020 (https://arxiv.org/html/2608.21610#bib.bib19); Izacard 等人,2022 (https://arxiv.org/html/2608.21610#bib.bib17); Khattab 和 Zaharia,2020 (https://arxiv.org/html/2608.21610#bib.bib20)),但邻近度并不意味着信息相关性。关于“北极温度变化”的段落在语义上*更接近*关于“南极洲气候”的查询,而关于“对北极变暖的政策响应”的段落可能在回答“哪些政策针对北极变暖?”时*相关性*更强。相似性与相关性之间的这种区别在信息检索领域已有充分记录(Thakur 等人,2021 (https://arxiv.org/html/2608.21610#bib.bib34); Zhao 等人,2022 (https://arxiv.org/html/2608.21610#bib.bib39))。

**固定粒度并非最优**。某些查询只需要高层次摘要(“这篇论文是关于什么的?”),而其他查询则需要具体细节(“模型 X 在数据集 Y 上取得了多少 F1 分数?”)。固定大小的分块对所有查询一视同仁。近期关于自适应分块(Zhong 等人,2024 (https://arxiv.org/html/2608.21610#bib.bib41); Günther 等人,2024 (https://arxiv.org/html/2608.21610#bib.bib9))和层次化分块(Zhang 等人,2025 (https://arxiv.org/html/2608.21610#bib.bib13))的工作已开始解决此问题,但这些方法仍在扁平检索范式内运作。

**文档结构被丢弃**。文档具有固有的层次组织——章节、节、小节、段落——这编码了语义关系和范围。传统的 RAG 流程在分块过程中破坏了这种结构(Wang 等人,2025 (https://arxiv.org/html/2608.21610#bib.bib29))。层级注意力网络(Yang 等人,2016 (https://arxiv.org/html/2608.21610#bib.bib37))证明了保留文档层次结构对于分类的价值;我们认为这一原则可以扩展到检索。

我们提出**语义压缩树(SCT)**,一个解决所有三个局限性的框架。SCT 是一棵层次树,其中:(1) 每个节点代表特定*分辨率层级*上的一个知识单元;(2) 每个节点存储一个*语义残差*——仅包含它在父节点基础上贡献的信息;(3) 检索是*渐进式*的——从根节点开始,下降到相关分支,直到累积的上下文足够。关键洞见是,检索成本变得与查询的*特异性*成正比,而非语料库大小。

**贡献**。我们做出以下贡献:

1.  我们形式化了用于层次化知识表示的*语义残差*概念,定义了具有保证累积属性的 SCT 数据结构(第 3 节 (https://arxiv.org/html/2608.21610#S3))。
2.  我们提出了一个与来源无关的树构建算法,支持可插拔的压缩函数,适用于文档、数据库和纯文本(第 4 节 (https://arxiv.org/html/2608.21610#S4))。
3.  我们将渐进式下降检索定义为在残差嵌入上的固定宽度束搜索,带有一个可选的相似度阈值,当进一步的细节不太可能有帮助时停止下降,并给出了其按节点评分的成本(第 5 节 (https://arxiv.org/html/2608.21610#S5))。
4.  我们在 QASPER(Dasigi 等人,2021 (https://arxiv.org/html/2608.21610#bib.bib5))上评估了 SCT,采用了两种将索引质量与文档路由分开的协议,使用了生成答案指标、黄金证据检索指标、LLM 即评判者评分(Zheng 等人,2023 (https://arxiv.org/html/2608.21610#bib.bib40); Es 等人,2024 (https://arxiv.org/html/2608.21610#bib.bib7))、置信区间和配对显著性检验(第 6 节 (https://arxiv.org/html/2608.21610#S6))。
5.  我们报告了混合的结果并对其组成部分进行了分离分析。残差存储和成本模型是有效的;渐进式自上而下下降则不行,我们确定了从根节点残差进行文档路由是其失败的机制(第 7 节 (https://arxiv.org/html/2608.21610#S7))。
6.  我们表明,更好的压缩器取决于协议——当文档已给定时是零 LLM 提取式压缩器,当需要寻找文档时是基于 LLM 的压缩器——并且差异背后的机制在证据召回中可见,而不仅仅是在答案分数中(第 7 节 (https://arxiv.org/html/2608.21610#S7))。

## 2 相关工作

#### 检索增强生成

RAG 由 Lewis 等人(2020 (https://arxiv.org/html/2608.21610#bib.bib24))引入,建立在 REALM(Guu 等人,2020 (https://arxiv.org/html/2608.21610#bib.bib12))的基础上,后者首次展示了如何将知识检索器与语言模型联合预训练。融合解码器(Izacard 和 Grave,2021 (https://arxiv.org/html/2608.21610#bib.bib16))证明了生成模型可以有效地聚合来自多个检索段落的证据。后续工作探讨了何时进行检索:Self-RAG(Asai 等人,2024 (https://arxiv.org/html/2608.21610#bib.bib1))训练模型自适应地决定是否需要检索,而 FLARE(Jiang 等人,2023 (https://arxiv.org/html/2608.21610#bib.bib18))在生成过程中当产生低置信度 token 时进行迭代检索。近期综述(Gao 等人,2024 (https://arxiv.org/html/2608.21610#bib.bib8); Gupta 等人,2024 (https://arxiv.org/html/2608.21610#bib.bib10))追溯了从“朴素 RAG”(分块-嵌入-检索)到“高级 RAG”(查询重写、重排序)再到“模块化 RAG”(可组合流水线)的演变。我们的工作引入了一种与这些检索时改进正交的根本不同的索引策略。

#### 稠密与稀疏检索

稠密段落检索(DPR)(Karpukhin 等人,2020 (https://arxiv.org/html/2608.21610#bib.bib19))建立了双编码器检索架构,在段落检索上比 BM25 高出 9-19%。ColBERT(Khattab 和 Zaharia,2020 (https://arxiv.org/html/2608.21610#bib.bib20))引入了后期交互以实现高效且有效的检索,并通过带有残差压缩的 ColBERTv2(Santhanam 等人,2022 (https://arxiv.org/html/2608.21610#bib.bib31))进一步改进。Contriever(Izacard 等人,2022 (https://arxiv.org/html/2608.21610#bib.bib17))表明,无监督对比预训练可以在没有标签数据的情况下产生具有竞争力的检索器,而 E5(Wang 等人,2022 (https://arxiv.org/html/2608.21610#bib.bib36))和 GTR(Ni 等人,2022 (https://arxiv.org/html/2608.21610#bib.bib27))展示了嵌入模型的规模化效益。Zhao 等人(2022 (https://arxiv.org/html/2608.21610#bib.bib39))提供了一篇涵盖 300 多篇稠密检索论文的全面综述。这些方法处理固定大小的文本片段;SCT 是互补的——它结构化了*索引*,而任何检索器都可以在渐进下降中用于子节点选择。

#### 层次化与基于树的检索

RAPTOR(Sarthi 等人,2024 (https://arxiv.org/html/2608.21610#bib.bib32))是最相关的工作。它递归地自底向上聚类和摘要文本块,构建一个树,其中每个层级存储*完整摘要*。这实现了多级检索,但也引入了显著的冗余:父节点摘要中捕获的信息在其子节点中重复。SCT 通过语义残差公式消除了这种冗余。PageIndex(VectifyAI,2025 (https://arxiv.org/html/2608.21610#bib.bib35))使用 LLM 调用从 PDF 构建目录式树,但仅限于单一文档格式,构建需要 50-200 多次 LLM 调用并伴有顺序验证循环,并且没有形式化树层级之间的关系。HiChunk(Zhang 等人,2025 (https://arxiv.org/html/2608.21610#bib.bib13))使用微调 LLM 进行层次化文档结构化,并采用自动合并检索。Chen 等人(2025 (https://arxiv.org/html/2608.21610#bib.bib4))提出了使用概念层次结构的从粗到细的检索。层次化重排序检索器(Li 等人,2025 (https://arxiv.org/html/2608.21610#bib.bib14))同时利用父级、中间级和句子级块。与这些方法不同,SCT 提供了一个具有累积保证和与来源无关的形式化残差框架。

#### 知识图谱方法

GraphRAG(Edge 等人,2024 (https://arxiv.org/html/2608.21610#bib.bib6))提取带有社区摘要的实体知识图谱,在全局理解查询上实现了改进。HippoRAG(Gutierrez 等人,2024 (https://arxiv.org/html/2608.21610#bib.bib11))受海马体索引理论启发,结合 LLMs、知识图谱和个性化 PageRank 用于多跳 QA,报告称相比现有 RAG 改进了高达 20%,同时成本降低了 10-30 倍。KG-RAG(Soman 等人,2024 (https://arxiv.org/html/2608.21610#bib.bib33))将生物医学知识图谱与 LLMs 集成。这些方法捕获了实体级关系,但未提供 SCT 所支持的多分辨率文本访问。

#### 分块策略

分块对 RAG 质量的影响日益受到关注。粒度混合(Mix-of-Granularity,Zhong 等人,2024 (https://arxiv.org/html/2608.21610#bib.bib41))使用路由器为每个查询动态确定最佳分块大小。延迟分块(Late Chunking,Günther 等人,2024 (https://arxiv.org/html/2608.21610#bib.bib9))提议在分段之前使用完整文档上下文嵌入所有 token,以保留长程依赖性。Wang 等人(2025 (https://arxiv.org/html/2608.21610#bib.bib29))系统地评估了高级分块策略,发现传统的固定大小分块常常破坏上下文并降低连贯性。SCT 完全规避了分块问题:边界遵循文档的自然结构,且残差公式确保在段落边界处不会丢失信息。

#### 评估

LLM 即评判者评估已成为人类评估的一种可扩展替代方案。Zheng 等人(2023 (https://arxiv.org/html/2608.21610#bib.bib40))表明 GPT-4 在人类偏好一致性上达到 >80%,而 G-Eval(Liu 等人,2023 (https://arxiv.org/html/2608.21610#bib.bib26))展示了用于自然语言生成的思维链评分。RAGAS(Es 等人,2024 (https://arxiv.org/html/2608.21610#bib.bib7))提供了无需参考的 RAG 评估,衡量忠实度、答案相关性和上下文相关性。Prometheus 2(Kim 等人,2024 (https://arxiv.org/html/2608.21610#bib.bib21))提供了开源评判模型。我们采用这一范式进行评估,并辅以标准的 token 级别指标(Rajpurkar 等人,2016 (https://arxiv.org/html/2608.21610#bib.bib28))。

#### 定位

SCT 与所有先前工作的区别在于三个关键方面:(1) 语义残差公式提供了一种有原则的、*无冗余*的多分辨率表示,并具有形式化的累积保证;(2) 该框架与来源无关,统一适用于文档、数据库和纯文本;(3) 渐进式检索使查询成本与查询特异性成正比。表 1 (https://arxiv.org/html/2608.21610#S2.T1)总结了比较。

表 1:与相关方法的比较。*使用提取式压缩;也支持基于 LLM 的压缩。†无冗余性是公式的一个属性,而非实现的保证:语义减法是近似的,我们在第 7 节 (https://arxiv.org/html/2608.21610#S7) 中量化了残差损失。

## 3 语义压缩树

### 3.1 形式定义

设 D 为一个知识源,其文本为 T(D)。D 上的语义压缩树是一棵有根树 \mathcal{T} = (V, E),其中每个节点 v \in V 关联着:

- • c(v):节点 v 所代表的源区域的原始内容
- • \ell(v) ∈ {0, 1, ..., L}:压缩层级(0 = 根节点,最抽象)
- • \mathcal{R}(v):v 的*语义残差*

###### 定义 1(语义残差)。

设 \mathcal{C}(\cdot, \ell) 是一个压缩函数,用于生成第 \ell 层的摘要。语义残差 \mathcal{R}(v) 定义为:

\[
\mathcal{R}(v) = \begin{cases}
\mathcal{C}(T(D), 0) & \text{if } v = r \text{(根节点)} \\
c(v) \ominus \mathcal{C}(c(\mathrm{pa}(v)), \ell(\mathrm{pa}(v))) & \text{otherwise}
\end{cases} \quad (1)
\]

其中 \mathrm{pa}(v) 表示 v 的父节点,\ominus 表示*语义减法*:仅从 c(v) 中提取未被压缩的父节点捕获的信息。

###### 属性 1(累积性)。

对于任意节点 v,其从根节点 (r = v_0, v_1, ..., v_k = v) 的路径:

\[
\mathrm{Context}(v) = \bigoplus_{i=0}^{k} \mathcal{R}(v_i) \quad (2)
\]

其中 \bigoplus 表示连接。累积的上下文重构了从根到 v 的路径上所包含的语义内容。

相似文章

RAGOCR:基于视觉表示的检索增强文本光学压缩

arXiv cs.CL

RAGOCR 是一种新颖框架,根据输入查询将检索到的文档压缩为紧凑的视觉表示,并利用查询感知的动态分辨率来平衡压缩率与信息保真度。实验表明,其在仅使用八分之一输入 token 的情况下,准确率比朴素 RAG 高出 15% 以上。

ContextRAG:面向检索增强生成的无抽取层次图构建

arXiv cs.CL

ContextRAG引入了一种无抽取方法,用于构建面向检索增强生成的层次图索引。该方法利用残差量化K均值(Residual-Quantization K-Means)和形式概念分析(Formal Concept Analysis),将大语言模型(LLM)调用和Token数量减少数个数量级,同时在多跳问题上保持具有竞争力的F1分数。