MCompassRAG:主题元数据作为段落级检索的语义指南针

arXiv cs.CL 论文

摘要

MCompassRAG 通过用主题元数据丰富文本块表示,并利用 LLM 教师蒸馏来增强检索增强生成,在信息效率上平均提升 8.24%,同时延迟比强基线低 5 倍以上。

arXiv:2606.18508v1 公告类型:新 摘要:检索增强生成(RAG)系统严重依赖于文档的分块和搜索方式。细粒度分块可以提高检索精度,但会扩大搜索空间,增加延迟和成本;较大的分块减少了候选数量,但使得密集相似度更不可靠,因为每个分块的表征混合了多个主题并引入了更多语义噪声。这种权衡在深度研究任务中尤其受限,因为检索必须在大规模异构语料库中既快速又精确。我们提出 MCompassRAG,一种元数据引导的检索框架,利用主题级信号作为选择相关证据的语义指南针。MCompassRAG 不仅依赖查询与噪声分块嵌入之间的余弦相似度,而是在同一嵌入空间中用主题元数据丰富分块表征,并通过 LLM 教师蒸馏训练轻量级检索器。在推理时,MCompassRAG 无需额外 LLM 调用即可执行主题感知检索,从而提高效率和证据质量。在六个复杂检索基准上,MCompassRAG 的信息效率(IE)平均提升 8.24%,延迟比最强的高效 RAG 基线低 5 倍以上。代码可在 https://github.com/AmirAbaskohi/MCompassRAG 获取。
查看原文
查看缓存全文

缓存时间: 2026/06/18 05:45

# MCompassRAG:主题元数据作为段落级检索的语义指南

来源: https://arxiv.org/html/2606.18508

Amirhossein Abaskohi1††通讯作者:[email protected], Raymond Li1, Gaetano Cimino2, Peter West1, Giuseppe Carenini1, Issam H. Laradji1,3

1 不列颠哥伦比亚大学, 2 萨莱诺大学, 3 ServiceNow Research

###### 摘要

检索增强生成(RAG)系统关键依赖于文档如何被切分和搜索。细粒度切块可以提高检索精度,但会扩大搜索空间,增加延迟和成本;较大的切块减少候选项数量,但使得稠密相似度变得不那么可靠,因为每个切块的表示会混合多个主题并引入更多语义噪声。这种权衡在深度研究任务中尤其受限,因为在大型异构语料库上,检索必须既快速又精确。我们提出 MCompassRAG,一个元数据引导的检索框架,利用主题级信号作为选择相关证据的语义指南。MCompassRAG 不仅依赖查询和带噪块嵌入之间的余弦相似度,还在相同嵌入空间内用主题元数据丰富块表示,并通过 LLM 教师蒸馏训练一个轻量级检索器。在推理时,MCompassRAG 在无需额外 LLM 调用的情况下执行主题感知检索,同时提高效率和证据质量。在六个复杂检索基准上,MCompassRAG 平均信息效率(IE)提升 8.24%,延迟比最强的高效 RAG 基线低 5 倍以上。111代码可在 GitHub (https://github.com/AmirAbaskohi/MCompassRAG) 上获取。

![[未标注图像]](https://arxiv.org/html/2606.18508v1/figures/logo.png)

MCompassRAG: 主题元数据作为段落级检索的语义指南

Amirhossein Abaskohi1††通讯作者:[email protected], Raymond Li1, Gaetano Cimino2, Peter West1, Giuseppe Carenini1, Issam H. Laradji1,3

1 不列颠哥伦比亚大学, 2 萨莱诺大学, 3 ServiceNow Research

## 1 引言

检索增强生成(RAG)已成为将大型语言模型(LLM)建立在外部知识基础上的标准范式 (Lewiset al. (2020); Karpukhinet al. (2020))。然而,RAG 的效率和质量取决于一个简单但至关重要的设计选择:文档如何被划分为可检索单元。这一选择在深度研究任务 (Zhanget al., 2025b) 中尤为重要,因为这些任务需要搜索大型语料库,并且在生成最终答案之前通常需要多次检索调用。标准稠密检索基于固定大小切块 (Zhaoet al., 2024) 面临粒度权衡。细粒度切块(如句子或短段落)提供精确证据,但会大大增加索引和搜索的候选项数量。较大的切块减少搜索空间并提高检索效率,但会混合多个主题和话语角色到单个嵌入中。结果,相似度得分变得嘈杂:相关证据可能被不相关文本稀释,而部分相关的切块可能因为包含大量不相关内容而被检索到。

参考说明(a)
参考说明(b)

图 1: MCompassRAG 概览。(a) MCompassRAG 使用粗粒度切块以提高效率,并用主题向量丰富这些切块以实现主题感知检索。在查询时,相关的主题信息指导对较大切块的检索。(b) MCompassRAG 在强 RAG 基线之上改善了性能-延迟权衡,性能由 HotpotQA (Yanget al., 2018) 和 DRBench (Abaskohiet al., 2026) 上的平均 F1 度量。

先前的工作通过使切块更小、更结构化或层次化组织来解决切块粒度问题。基于命题的检索将文档分解为原子单元 (Chenet al., 2024b),LLM 引导的分段改善切块边界 (Zhaoet al., 2025b, a),而层次化方法如 RAPTOR 跨多个抽象级别进行检索 (Sarthiet al., 2024)。尽管这些方法有效,但通常会增加预处理成本,需要额外索引,或引入额外的评分和选择阶段。基于 LLM 的重排序和证据选择可以进一步提高质量 (Taoet al., 2025),但在推理时增加延迟,这对于在大型语料库上重复检索证据的深度研究代理来说是有问题的 (Zhenget al., 2025)。

在这项工作中,我们采取不同的方法:不是让切块变得日益细粒度,添加层次化检索阶段,或依赖昂贵的检索后过滤,而是让粗粒度切块更可搜索。如图 1(a) 所示,MCompassRAG 用主题元数据丰富每个切块,这些元数据充当检索的语义指南。具体来说,一个主题建模编码器将文档和切块映射到检索器相同的语义空间中的主题感知向量。这些主题向量暴露了每个粗粒度切块覆盖的主要语义方向,使检索能够超越单个带噪块嵌入。在查询时,MCompassRAG 从元数据库推导出紧凑的查询端主题表示,并用它对元数据丰富的切块进行评分。MCompassRAG 与具体主题模型无关,只要求主题嵌入到检索器的语义空间中。我们通过 LLM 教师蒸馏将 MCompassRAG 训练为极端多标签分类器 (Prabhuet al., 2025),其中轻量级学生学会从元数据丰富的表示中识别多个相关切块,而在推理时不调用 LLM。这保留了较大切块的效率优势,同时减少了使粗粒度余弦检索不可靠的语义噪声。

在六个复杂检索基准上,MCompassRAG 平均信息效率比最强的非 LLM 基线提高 8.24%,同时运行延迟比基于 LLM 的强 RAG 基线低 5 倍以上,反映了图 1(b) 所示的效率-质量权衡。

我们的贡献有三方面。
首先,我们引入 MCompassRAG,一个元数据引导的检索框架,通过使用选定的主题元数据使粗粒度检索得到改进,使大块更精确地可搜索,而不增加检索搜索空间。
其次,我们设计了一个元数据选择和抽象机制,先从语料级元数据库中选择与查询最相关的主题元数据,然后将这些信号总结成一个紧凑的查询-主题向量,用于块评分。这使得查询表示在匹配粗粒度块之前就具有主题感知能力。
第三,我们将 LLM 教师蒸馏为一个轻量级学生检索器,使用极端多标签目标进行训练,无需推理时的 LLM 调用即可实现高效的主题感知证据选择,同时保持大部分教师引导的检索质量。

## 2 相关工作

参考说明
图 2: MCompassRAG 概览。训练时,LLM 教师提供相关性监督,查询扩展仅用作额外的教师端元数据信号。元数据库由切块构建,并用文档-主题向量和主题中心嵌入丰富。推理时,MCompassRAG 选择和抽象查询相关的主题元数据,然后用轻量级学生检索器对查询-块对进行评分。图标表示可训练性: 表示已训练组件, 表示冻结组件。

#### RAG 中的检索粒度和结构化检索。RAG 将语言模型生成建立在检索到的外部证据上 (Lewiset al., 2020; Karpukhinet al., 2020; Izacard and Grave, 2021)。一个关键设计选择是检索粒度:细粒度单元提高证据精确性但扩大搜索空间并可能失去上下文,而粗粒度单元保留上下文并减少候选项但使稠密相似度因混合主题和不相关内容而更嘈杂。先前的工作通过替代检索单元或索引结构来解决这一权衡,包括基于命题的检索 (Chenet al., 2024b)、LLM 引导和自适应切块 (Zhaoet al., 2025b, a)、查询自适应粒度选择 (Zhanget al., 2026) 以及跨抽象级别的层次化检索 (Sarthiet al., 2024)。其他系统通过丰富检索到的证据来减少上下文碎片 (Taoet al., 2025) 或在选择时促进多样性和覆盖度 (Khanet al., 2026)。虽然这些方法有效,但通常需要更细粒度的索引、自适应选择、层次化结构、额外评分阶段或基于 LLM 的过滤。相比之下,MCompassRAG 保留了粗粒度检索的效率,同时用主题级元数据使更大切块更可搜索。

#### 语义引导和高效检索。另一条互补的工作线通过修改查询或检索过程而非切块策略本身来改进 RAG。查询增强方法如 HyDE (Gaoet al., 2023)、查询扩展 (Wanget al., 2023; Zhouet al., 2024) 和基于分解的检索 (Trivediet al., 2023; Zhenget al., 2024) 旨在通过生成假设答案、添加相关术语或将复杂问题分解为更简单的检索步骤来更好地使查询与相关证据对齐。自适应和迭代检索方法进一步通过重复检索、重排序或充分性检查来精炼证据集 (Vermaet al., 2026)。这些方法在查询未充分指定所需证据时有效,但通常引入额外的推理时计算。另外,生成端效率方法在检索后压缩或重组检索到的上下文以减少解码成本 (Linet al., 2025; Louiset al., 2026)。MCompassRAG 与这些方向正交:它不是在检索前生成额外查询文本、重复检索或压缩上下文,而是在检索前使用语料库衍生的主题元数据作为紧凑的语义指南。这引导检索朝向查询相关的主题,无需推理时的 LLM 调用,并且与查询扩展、迭代检索、重排序和上下文压缩兼容。

## 3 MCompassRAG

MCompassRAG 是一个元数据引导的检索框架,使粗粒度切块更可搜索,而不增加检索搜索空间。给定切块 C = {c1, ..., cN} 和查询 q,目标是检索前 k 个为查询提供有用证据的切块。MCompassRAG 不仅依赖查询和块嵌入之间的余弦相似度,还使用主题级元数据增强查询和切块,使检索器能更好地识别大块内部的哪些语义方向是相关的。图 2 展示了完整流程。

首先,每个切块由主题模型处理以获得切块-主题分布,而主题中心提供主题在嵌入空间中的表示。切块-主题分布被缓存在语料级元数据库中,并随后用作查询端指导。推理时,基础查询由学生编码器编码,选择策略将查询嵌入与库中的元数据条目进行比较,选择最相关的主题分布。抽象模块随后将选定的元数据分布总结为精炼的查询-主题分布,减少任何单个选定条目带来的噪声和偏差。这个精炼分布被转换为一个紧凑的查询端主题向量,并与查询嵌入拼接形成元数据丰富的查询表示。学生 MLP 分类器随后对此表示与每个元数据丰富的块表示进行评分,并返回前 k 个切块。训练时,LLM 教师使用扩展查询提供相关性监督,而学生只接收基础查询,并通过 BCE 和知识蒸馏损失进行学习。因此,查询扩展和 LLM 教师评分仅用于训练;推理只需要元数据选择、抽象和学生评分。该框架可以使用任何主题模型,其主题在检索器嵌入空间中表示,并提供块级主题分布。在我们的实现中,我们使用 CEMTM (Abaskohiet al., 2025),一个 LLM 蒸馏的主题模型,它也利用注意力信号产生文档-主题分布。

### 3.1 主题元数据和元数据库

让 {tk}_{k=1}^K 表示主题中心,其中每个 tk ∈ R^d 位于检索器嵌入空间中,作为主题 k 的向量表示或原型。每个切块 c 与一个主题分布 θc ∈ R^K 相关联,其中 θc,r 衡量主题 r 在切块 c 中的强度。由于切块比查询更长且信息更丰富,它们的主题分布可以可靠地计算并离线缓存。MCompassRAG 将这些切块级主题分布存储在一个元数据库中:
M = {θc1, ..., θcN}. (1)

元数据库表示语料库的主题结构,并在推理时作为查询端指导的来源。直觉上,它提供了语料库级语义区域的地图,查询可能需要搜索这些区域,而不只是依赖查询本身稀疏的信号。对于新查询,MCompassRAG 不直接依赖查询自身的主题分布(由于其短长度可能不可靠),而是从 M 中选择相关的主题分布,并将它们抽象为紧凑的查询端主题表示。这个抽象步骤减少对任何单个选定切块的偏见,并产生更平滑的主题信号,如第 3.2 节所述。

### 3.2 元数据选择和表示

推理时,MCompassRAG 从库中选择与输入查询相关的主题元数据。查询首先由学生编码器 fψ 编码:eq = fψ(q) ∈ R^d。

相似文章

Disco-RAG: 话语感知检索增强生成

arXiv cs.CL

Disco-RAG 提出了一个话语感知的检索增强生成框架,通过块内话语树和块间修辞图整合话语信号,以改进大语言模型的知识综合能力。该方法在问答和摘要生成基准测试中达到最先进的效果,无需微调。

RAGOCR:基于视觉表示的检索增强文本光学压缩

arXiv cs.CL

RAGOCR 是一种新颖框架,根据输入查询将检索到的文档压缩为紧凑的视觉表示,并利用查询感知的动态分辨率来平衡压缩率与信息保真度。实验表明,其在仅使用八分之一输入 token 的情况下,准确率比朴素 RAG 高出 15% 以上。

MM-BizRAG:重新思考面向通用企业问答的多模态检索增强生成

arXiv cs.CL

MM-BizRAG 是一个面向企业问答的多模态检索增强生成系统,通过文档结构感知分割和版式感知解析,在异构企业文档上的表现比以视觉为中心的基线方法最高提升 32%。该论文还提出了 FastRAGEval——一种基于 LLM 的高效评估指标,其与人类判断的对齐程度优于 RAGChecker,且成本更低。