Multimodal CoLRAG-TF: 面向复杂PDF的三重过滤检索

arXiv cs.LG 论文

摘要

介绍了Multimodal CoLRAG-TF,一种四轴融合架构,用于在复杂PDF上进行检索增强生成,整合了稠密文本、BM25、知识图谱三重过滤和图像相似性。在日文灾难教训PDF基准上,多跳推理取得了显著改进。

arXiv:2607.20517v1 Announce Type: new Abstract: 异构PDF集合上的检索增强生成(RAG)因多模态内容、领域特定术语以及需要在分散证据上进行多跳推理而仍然具有挑战性。我们提出了Multimodal CoLRAG-TF,一种四轴融合架构,整合了稠密文本嵌入、BM25关键词匹配、知识图谱三重过滤和基于图像的相似性,以实现对复杂文档的鲁棒检索。我们的系统构建了一个包含从43份日文灾难教训PDF中提取的2,403个块的多模态索引,并辅以混合OCR流水线和基于LLM的标题生成。为了增强组合推理,我们提取了11,414个OpenIE三元组并使用FAISS进行索引,实现了亚秒级的三元组查找和相关性信号的分层传播。受HippoRAG2启发的粗到细检索器(卷 $\to$ 章 $\to$ 块)在最终融合评分前缩小了搜索空间。对融合权重的贝叶斯优化揭示,三重轴必须占主导地位($\alpha_\text{triple} = 0.44$),以抵消词汇偏差并保持多跳检索质量。在包含457对的基准上评估,Multimodal CoLRAG-TF实现了0.9909的检索召回率,并且多跳答案相似性比单跳查询提高了71.6$\%$。使用视觉语言模型的图像到课程流水线进一步展示了该方法对视觉输入的适用性。这些结果表明,三重过滤的多模态融合对于在嘈杂、异构PDF上进行结构化推理至关重要,并提供了一个可应用于灾难领域之外的通用框架。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:10

# 多模态 CoLRAG-TF:面向复杂 PDF 的三重过滤检索
来源:https://arxiv.org/html/2607.20517
\(2026 年 7 月 8 日\)

###### 摘要

针对异构 PDF 集合的检索增强生成(RAG)因多模态内容、领域专用术语以及跨分散证据的多跳推理需求而仍然充满挑战。我们提出 **Multimodal CoLRAG-TF**,一种四轴融合架构,集成了稠密文本嵌入、BM25 关键词匹配、知识图谱三元组过滤以及基于图像的相似度,以实现对复杂文档的鲁棒检索。我们的系统构建了一个包含从 43 份日本灾害教训 PDF 中提取的 2,403 个多模态块的索引,并辅以混合 OCR 流水线和基于 LLM 的标题生成。

为了增强组合推理能力,我们提取了 11,414 个 OpenIE 三元组,并使用 FAISS 建立索引,实现亚秒级的三元组查询和相关性信号的分层传播。受 HippoRAG2 启发的由粗到精检索器(文集→章节→区块)在最终融合评分前缩小搜索空间。融合权重的贝叶斯优化表明,三元组轴必须占主导地位(\(\alpha_{\text{triple}}=0.44\)),以抵消词汇偏置并维持多跳检索质量。

在包含 457 对问题的基准测试上评估,Multimodal CoLRAG-TF 实现了 0.9909 的检索召回率,多跳答案相似度相比单跳查询提升了 71.6%。使用视觉 LLM 的图像到教训流水线进一步证明了该方法对视觉输入的适用性。

这些结果表明,三重过滤多模态融合对于在嘈杂、异构 PDF 上进行结构化推理至关重要,并为超越灾害领域的通用框架提供了基础。

**关键词:** 检索增强生成,三元组过滤,多模态检索,知识图谱,异构 PDF,贝叶斯优化。

## 1 引言

### 1.1 问题设定

针对异构、多模态 PDF 集合的检索增强生成(RAG)提出了标准检索系统无法解决的基本挑战。此类文档——政府灾害教训报告、临床指南、法规手册和工程手册——在单一集合中集成了密集文本、统计表格、照片、地图和领域专用术语。核心挑战是在保持对事实性(单跳)和组合性(多跳)查询的检索精度的同时,实现跨异构内容的多跳、基于证据的问答。

在本工作中,我们使用日本政府的灾害教训文档作为 **代表性案例研究**:一个包含 43 份国土交通省出版物的语料库,涵盖了 67 年间的洪水、地震、滑坡和台风事件[18]。该领域展现了异构 PDF 检索中存在的所有关键困难——多模态布局变化、扫描文档 OCR 噪声、密集的行政术语以及跨文档的多跳推理需求——同时提供了可追溯的金标准标注以进行严格评估。所提出的架构具有通用性,适用于任何具有这些 PDF 特征的领域。

标准 RAG 流水线[16]将文档视为纯文本序列,丢弃了结构和视觉信息。稠密嵌入模型无法捕获精确的数值实体(例如,“财产损失总计 1263 亿日元”),而仅基于关键词的 BM25 检索则遗漏了叙事形式中编码的语义关系。这一挑战因需要跨多个文档进行证据综合的多跳查询而进一步加剧。

### 1.2 挑战

异构多模态 PDF 集合上的检索涉及五个相互作用的挑战:

1. C1: **多模态异构性**:单个文档页面可能结合叙事文本、统计表格、卫星地图和照片,每种类型都需要不同的提取和索引策略。
2. C2: **数值精度**:稠密嵌入模型无法捕获需要结构化事实检索的精确数值实体(例如,“财产损失总计 1263 亿日元”、“8,667 栋建筑物被毁”)。
3. C3: **多跳推理**:组合性查询需要通过因果关系链综合分散在多个文档中的证据,这是稀疏或稠密检索均无法单独捕获的。
4. C4: **OCR 噪声**:来自 1950 年代至 1990 年代的扫描政府 PDF 导致单一方法 OCR 在 31.6% 的表格块上失败,截断了可检索的索引。
5. C5: **领域专用术语**:高度专业化的词汇(例如,“ 応急危険度判定 ”(应急建筑危险度判定))会产生人为的高 BM25 分数,除非应用纠正性权重校准,否则会压倒知识图谱信号。

我们探究三个相应的研究问题:

1. RQ1: 将结构化知识图谱三元组集成到后期交互检索器中,是否能改善跨领域特定文档的多跳问答?(C3)
2. RQ2: 四轴 BM25-三元组融合能否提高检索召回率而不降低语义精度?(C1, C2)
3. RQ3: 基于视觉 LLM 的图像查询流水线能否从纯视觉输入中恢复主题相关的教训区块?(C1)

### 1.3 贡献

1. 1. **四轴融合架构**:一种新颖的多模态检索评分函数,结合了稠密文本嵌入、BM25 关键词匹配、知识图谱三元组过滤和图像相似度,应对多模态异构性(C1)和数值精度(C2)。
2. 2. **贝叶斯三元组过滤**:基于 LLM 的 OpenIE 提取了 11,414 个结构化三元组(成功率 86%),使用 FAISS 索引,并结合贝叶斯权重校准,将 \(\alpha_{\text{triple}}\) 提升至 0.44,克服了 BM25 的词汇偏置(C5)。
3. 3. **混合 OCR 流水线**:两阶段布局分析,结合 Table Transformer 检测与 PyMuPDF 主提取和 Tesseract 回退,将表格覆盖率从 68.4% 提升至 86.8%,应对 OCR 噪声(C4)。
4. 4. **分层由粗到精检索**:受 HippoRAG2 启发的三层检索器(文集→章节→区块),无需 PageRank 传播即可实现亚秒级三元组查找,支持组合性多跳推理(C3)。
5. 5. **图像到教训检索流水线**:基于视觉 LLM 的接口,将灾害照片转换为文本查询,用于知识图谱增强检索,在 12 张灾害图像上实现了 0.6556 的平均 Top-1 分数。

### 1.4 论文组织

第 2 节回顾了关于 RAG、知识图谱检索和多模态文档理解的相关工作。第 3 节展示了完整的流水线架构。第 4 节描述了评估语料库和基准。第 5.1 节详述了实验设置。第 5 节报告了实验结果。第 6 节解释了关键发现。第 7 节阐述了系统局限性。第 8 节总结并提出未来方向。实现细节见附录 A。

## 2 相关工作

### 2.1 检索增强生成

RAG[16] 通过检索到的证据增强 LLM 生成,无需重新训练即可改善事实性基础。后续工作探索了密集段落检索[20]、后期交互架构[15, 22] 以及混合密集-稀疏融合[21]。综合调研[8] 将多跳推理和领域适应确定为关键开放挑战。我们的工作在日本的灾害管理文档背景下同时解决了这两个问题。

### 2.2 知识图谱增强检索

HippoRAG[9] 将检索索引建模为受海马体启发的知识图谱,使用个性化的 PageRank 通过 OpenIE 提取的实体关系传播相关性。HippoRAG 2[10] 通过分层索引和校准对方法进行了改进。GraphRAG[6] 在实体图上构建社区级摘要,用于全局问答。

我们的 CoLRAG-TF 在三个关键方面与 HippoRAG 和 GraphRAG 不同。首先,它用 FAISS 索引的三元组存储替代了个性化 PageRank 传播,将查询时间降至 \(O(\log N)\) 且无需图遍历——这对应急响应的延迟约束至关重要。其次,它将三元组检索作为多轴融合评分的一个轴,而非将其作为唯一的相关性信号,从而允许在词汇、语义和结构化检索之间灵活权衡。第三,它通过贝叶斯权重校准显式地解决了 BM25 主导偏置,这是先前的 KG-RAG 工作未检验的、术语密集领域语料库特有的挑战。

### 2.3 多模态文档理解

Table Transformer[24] 实现了从 PDF 图像中进行结构感知的表格检测,而 LayoutLMv3[12] 则联合编码文本和布局以进行文档理解。MuRAG[5] 开创了结合图像嵌入与文本段落搜索的多模态检索。对于灾害文档 AI,日益增长的文献[13, 2] 探索了社交媒体分析,但结构化的政府 PDF 集合仍探索不足,尤其是在日语方面。

### 2.4 用于扫描 PDF 的混合 OCR

现代 PDF 提取流水线将布局检测与分层 OCR 回退相结合[23, 3]。在我们的日本灾害语料库中——其中许多 PDF 是扫描的政府报告,具有复杂的表格布局——单一方法 OCR 仅能达到 68.4% 的覆盖率;添加 Tesseract 回退将其提升至 86.8%,这与混合数字/扫描文档集合上的发现一致。

## 3 方法论

### 3.1 概述:Multimodal CoLRAG-TF

图 1 展示了完整的 Multimodal CoLRAG-TF 流水线。系统分为两个主要阶段:**离线索引**(第 3.2–3.4 节)和 **在线检索与生成**(第 3.5–3.7 节)。实现细节(模型配置、FAISS 设置、GPU 内存和 Optuna 超参数)见附录 A。

**(a) 离线处理**
43 份灾害 PDF
Table Transformer
布局分析
混合 OCR (PyMuPDF + Tesseract)
标题生成 (Qwen2.5-7B)
2,403 个多模态块
文本嵌入 (FAISS 1024 维)
BM25 索引 (Bigram)
三元组提取 (通过 LLM 的 OpenIE)
11,414 个三元组 (FAISS IndexFlatIP)

**(b) 在线检索**
用户查询 (文本/图像)
查询分析器 (图形关键词)
4 轴融合: \(\alpha_t \cdot s_t + \alpha_b \cdot s_b + \alpha_{tr} \cdot s_{tr} + \alpha_i \cdot s_i\)
由粗到精 (文集 → 章节 → 区块)
Top-\(k\) 区块
答案生成 (Qwen2.5-7B)

**图 1:** 多模态 CoLRAG-TF 流水线。*(a) 离线*:灾害 PDF 经过布局分析、混合 OCR(PyMuPDF + Tesseract)和标题生成,产生 2,403 个多模态块,索引为文本嵌入(FAISS 1024 维)、BM25 关键词索引和 11,414 个知识三元组。*(b) 在线*:分析用户查询以确定图形意图;四轴融合结合文本嵌入、BM25、三元组和图像嵌入分数;由粗到精的分层检索呈现用于答案生成的 Top-\(k\) 区块。虚线箭头显示离线索引数据流入在线融合阶段。

### 3.2 文档处理流水线

#### 布局分析。

每个 PDF 页面以 150 DPI 渲染,并传递给 Table Transformer[24],一个经过微调用于表格结构识别的基于 DETR 的目标检测模型。我们应用 0.7 的置信度阈值来过滤虚假检测,在灾害语料库的一个 52 页 OCR 评估子集(用于第 5 节中的混合 OCR 基准测试)中产生 38 个表格区域;在整个语料库中,检测到 1,399 个图形区域。检测到的表格边界框从渲染的页面图像中裁剪出来,并作为单独的 PNG 文件存储,用于后续的 OCR 和标题生成。

#### 混合 OCR。

每个裁剪后的表格图像经历两阶段提取过程。**阶段 1**:PyMuPDF 直接从 PDF 层提取嵌入文本,在 68.4% 的表格块上成功。**阶段 2**:当阶段 1 失败时(例如,扫描图像或复杂布局),采用带有日语语言模型(jpn.traineddata)的 Tesseract OCR[23] 作为回退。组合后的混合流水线达到了 86.8% 的 OCR 成功率(38 个表格中的 33 个),比单阶段基线提高了 18.4 个百分点。PaddlePaddle 经过评估但由于与共部署的 PyTorch 环境存在 GPU 内存冲突而被排除。

图 2 展示了在每个流水线阶段达到的累计 OCR 覆盖率。

[图例说明] 图 2: 针对 38 个表格块的混合 OCR 流水线覆盖率。阶段 1(PyMuPDF)达到 68.4%;添加 Tesseract 回退(阶段 2)将覆盖率提升至 86.8%,提高了 18.4 个百分点。

#### 标题生成。

对于每个成功提取的表格块,Qwen2.5-7B-Instruct[19] 生成一个结构化标题,总结表格的内容、灾害背景和关键数值。标题生成在 86.8% 的块上成功。失败的块(13.2%)被分配原始 OCR 文本作为回退标题。表格区域之外的文本段落通过 PyMuPDF 直接提取,并分割为重叠的 500 字符块,重叠 100 字符。

此阶段的输出是一个包含 2,403 个 **多模态块** 的集合,每个块包含块 ID、类型(文本—表格)、标题、原始提取文本、来源 PDF、页码和边界框坐标。

### 3.3 多模态索引构建

#### 稠密嵌入索引。

所有块的标题和文本使用 `hotchpotch/static-embedding-japanese`[11] 编码,这是一个针对检索优化的 1024 维静态日语嵌入模型。向量进行 L2 归一化,并使用 FAISS `IndexFlatIP`[14](内积相似度)建立索引,允许在 2,403 个块的语料库上进行精确最近邻搜索。

#### BM25 关键词索引。

为了进行词汇检索,我们在相同的 2,430 个块(2,403 个布局块 + 27 个额外文本段)上构建了一个 BM25Okapi[21] 索引。日语文本通过字符和双字母组策略进行分词:

\(T(s) = \text{chars}(s) \cup \{s[i:

相似文章

基于门控关联检索的通用三重潜在压缩

arXiv cs.CL

本文介绍了通用三重潜在循环模型,该模型将令牌对交互压缩为潜在状态,并提出一种改进精确召回的门控关联检索变体。该混合模型在字节级WikiText-2和分词语言基准上优于Transformer,实现了高达41.9%的关联召回率(对比25%)。

MM-BizRAG:重新思考面向通用企业问答的多模态检索增强生成

arXiv cs.CL

MM-BizRAG 是一个面向企业问答的多模态检索增强生成系统,通过文档结构感知分割和版式感知解析,在异构企业文档上的表现比以视觉为中心的基线方法最高提升 32%。该论文还提出了 FastRAGEval——一种基于 LLM 的高效评估指标,其与人类判断的对齐程度优于 RAGChecker,且成本更低。

语境之代价:在多模态检索增强生成中缓解文本偏差

arXiv cs.CL

本文识别并形式化了多模态RAG中的“再污染”现象,即添加准确上下文会导致模型因注意力崩溃(视觉盲区和位置偏差)而放弃正确预测。作者提出BAIR,一种无参数的推理时框架,能恢复视觉显著性并惩罚文本干扰因素,从而在医学、公平性和地理空间基准上提高可靠性。