重排器所见:面向长文档多模态问答的多维度页面标注

arXiv cs.AI 论文

摘要

本文提出Trident方法,通过结构化的多维度页面标注,增强长文档视觉问答中的重排与综合环节,从而提升证据选择与答案生成的准确性。

arXiv:2608.14841v1 公告类型:新 摘要:针对包含数十至数百页混合文本、表格、图表与图形的长文档视觉问答(VQA),通常采用先检索后阅读的流程。在我们研究的场景中,瓶颈从检索召回率转向重排器端的证据选择:在MMLongBench-Doc数据集上,BGE-M3达到Recall@20 = 0.86,但F1@5仅为0.254;即使是视觉检索器ColPali也仅达到F1@5 = 0.332;仅查看原始片段的纯文本重排大语言模型,即便上游检索器已编码图像,也会遗漏表格、图表和布局信息。我们提出Trident,包含两个互补组件:Trident-R是一个检索器无关的大语言模型重排器,它将每个候选文档转换为大语言模型可读的语义记录,涵盖视觉描述、章节路径、实体标签、多维度概念命中和文本片段,随后执行单次自适应K值重排调用;Trident-S则是一个生成端模块,在综合前从主题、实体和结构视角对视觉语言模型进行提示。在两个长文档数据集上,标注+重排方案在五个异构检索池中显著提升了检索F1分数,所有重排后的检索池均超越了最强的自适应K值基线PageIndex。未结合标注的大语言模型重排对首轮命中排序几乎无改善,表明性能提升源于结构化标注。Trident-S专门针对开放式综合问题设计,在此类问题上将生成准确率最高提升了6.6个百分点。最佳Trident配置是我们评估中最强的下游问答流水线,其排名在两个大语言模型评审员间保持一致(κ = 0.913)。
查看原文
查看缓存全文

缓存时间: 2026/08/18 10:10

# 针对长文档多模态问答的多维度页面标注
来源:https://arxiv.org/html/2608.14841

## 重排序器的视角:面向长文档多模态问答的多维度页面标注

Jiayuan Ding  
单位:Hippocratic AI,美国加利福尼亚州帕洛阿尔托  
Subhabrata Mukherjee  
单位:埃默里大学计算机科学系,美国佐治亚州亚特兰大  
Carl Yang  
单位:埃默里大学计算机科学系,美国佐治亚州亚特兰大  
单位:Hippocratic AI,美国加利福尼亚州帕洛阿尔托  

###### 摘要
长文档视觉问答(VQA)通常涉及几十到上百页、包含文本、表格、图表和图形的文档,一般遵循“先检索后阅读”的流程。在我们的设定中,瓶颈从检索召回率转移到了重排序侧的证据选择:在MMLongBench-Doc数据集上,BGE-M3达到了Recall@20=0.86,但F1@5仅为0.254;即使是视觉检索器ColPali,其F1@5也仅为0.332。一个仅看到原始文本片段的纯文本重排序大语言模型,即使上游检索器已编码图像,也会遗漏表格、图表和布局信息。我们提出了**Trident**,它包含两个互补组件:**Trident-R**,一个检索器无关的大语言模型重排序器,它将每个候选项转换为一个大语言模型可读的语义记录——包括视觉标题、章节路径、实体标签、多维概念命中以及文本片段,然后执行一次自适应的K值重排序调用;以及**Trident-S**,一个生成侧模块,它在综合答案之前,从主题、实体和结构视角对视觉语言模型进行提示。在两个长文档数据集上,这种标注加重排序的方案显著提升了五个异构候选池的检索F1分数,每个经过重排序的候选池都超越了最强的自适应K基线(PageIndex)。不使用标注的大语言模型重排序对首次命中排名几乎没有影响,这表明性能提升来自于结构化的标注。**Trident-S**专为开放式综合问题设计,在这些问题上,生成准确率最高提升了6.6个百分点。最佳的**Trident**配置是我们评估中最强的下游问答流程,其排名在两个大语言模型评判者(κ=0.913)中保持一致。

## 1 引言

参见标题图1:**Trident**概述。给定查询和长文档,检索器首先返回一个包含20个候选页面的池,其中证据页面通常已出现。**Trident-R**通过将候选页转换为用于自适应大语言模型重排序的语义记录来改善证据选择,而**Trident-S**则通过主题、实体和结构视角综合出最终答案。

长文档视觉问答(VQA)要求对包含几十到上百页文本、表格、图表和图形的文档回答自然语言问题。虽然前沿的视觉语言模型(VLM)原则上能接受非常长的上下文,但每次查询都输入整个文档成本高昂,并且可能遭受位置信息导致的性能下降。因此,“先检索后阅读”的流程仍然是实用的:检索器选择一小部分页面,视觉语言模型基于这些页面来回答问题。在MMLongBench-Doc数据集上,仅使用神谕(oracle)证据页面就能将大型视觉语言模型(LVLM)的F1分数比全文档输入提升10-30分,这表明证据选择是长文档VQA的核心。

证据选择在何处会失败?在我们的设定中,BGE-M3在MMLongBench-Doc上达到了Recall@20=0.86,但F1@5仅为0.254;多模态检索器ColPali将此提升至F1@5=0.332,但仍远未达到神谕水平。证据页面通常出现在前20个候选池中——瓶颈在于从20个表面相似的候选中识别出那一小部分证据子集。一个自然的下一步是在前20候选池和选择K≤5个证据页面之间插入一个大语言模型重排序器,这种方法已被RankGPT等采用,并在长文档RAG中越来越常见。然而,当这个重排序器只看到每个候选页面的原始文本片段时,它对两个候选池的首次命中排名都没有改善:在BGE-M3上,MRR基本不变(0.524→0.523);在ColPali上,MRR实际上*下降*了(从0.692到0.598),因为纯文本的大语言模型判断覆盖了ColPali更强的视觉排序信号。原因在于长文档的证据通常锁在表格、图表、图形和布局中,这些在短文本片段中表现不佳。一个只看片段的重排序阶段大语言模型,恰好对最重要的证据部分“半盲”——ColPali的视觉编码仅发生在检索阶段;重排序大语言模型仍然处理纯文本的候选记录,无法直接访问页面图像。这种重排序阶段的“视觉盲区”已被认识到:近期工作通过用多模态大语言模型直接查看页面图像来替代纯文本大语言模型重排序器以解决此问题。这很有效,但成本高昂——每个重排序查询都需要一次完整的多模态大语言模型调用,并且这些重排序器通常需要在多模态标签上进行指令微调或强化学习训练。

我们选择了一种替代的架构方案——一条在工业RAG系统中广泛使用但在学术长文档问答中尚未充分探索的路径:保留一个廉价、无需训练的纯文本大语言模型重排序器,并为每个文档预先离线计算一次结构化的视觉语言模型生成的标注。具体来说,我们为每个候选项构建一个大语言模型可读的语义记录——一个视觉语言模型生成的视觉标题呈现表格/图表/图形内容,结构化字段(章节路径、实体标签、主题/实体/结构概念命中)暴露预先计算的证据信号。在ColPali候选池上,附加此标注将重排序F1从0.332提升至0.581。与上述机制一致,移除标题对两个候选池都有损害,但对BGE-M3的伤害大于ColPali:视觉检索器在检索时部分补偿了大语言模型的视觉盲区,但并未消除重排序时对明确视觉信号的需求。基于这些观察,我们提出了**Trident**,一个长文档多模态问答流程,它包含两个组件,分别解决重排序和生成阶段的类似瓶颈。**Trident-R**将上述标注附加到每个前20候选页,并使用一次大语言模型调用选择一个自适应的K≤5个证据页面集。同样的多维度逻辑延续到生成阶段:单次视觉语言模型调用必须隐式地权衡对每个检索页面内文本、表格和图形的注意力。因此,我们额外提出了**Trident-S**,它在综合最终答案之前,从主题、实体和结构视角对视觉语言模型进行提示。在MMLongBench-Doc上,这种标注加重排序的方案应用于五个异构候选池(BM25、BGE-M3、RRF、ColPali和我们的多维xKG),使所有五个池的检索F1都得到了提升,每个经过重排序的候选池都超越了最强的自适应K基线PageIndex;这一改进在LongDocURL上同样成立。**Trident-S**专为开放式综合问题设计,在此类任务上提供了稳定的增益,同时将抽取式任务留给标准的单次调用视觉语言模型。端到端来看,最佳的**Trident**配置是我们评估中最强的下游流程,其排名在两个大语言模型评判者(κ=0.913)中保持一致。

## 2 相关工作

#### 长文档VQA基准测试与多模态RAG系统。
我们在MMLongBench-Doc和LongDocURL上进行了评估,这两个基准测试针对涉及百页以上文档且包含多模态证据(文本、表格、图表、图形、布局)的VQA;MMLongBench-Doc报告称,能够访问完整文档的GPT-4o-vision比获得神谕证据页面的视觉语言模型性能低约30分。近期基准测试从不同维度补充了这些工作:侧重检索的MMDocIR(313篇长文档,值得注意的是发现VLM图像描述优于OCR文本——与我们标题主导的结果一致)、细粒度证据选择的MMDocRAG(超越页面级F1的指标)以及难度分级的REAL-MM-RAG(金融/技术)。多模态RAG系统将多模态检索器与多模态大语言模型结合(M3DocRAG),使用带页面内和跨页面块的层次化索引(MMRAG-DocQA),构建块-查询图(MLDocRAG),按文档结构分流(PDFTriage),或使用视觉语言模型生成的表格和图形结构化JSON描述(MultiFinRAG)。**Trident**的不同之处在于将流程分解为可替换的阶段1检索器和阶段2我们通过实验隔离的标注加重排序协议。

#### 文档检索器与自适应K选择。
页面级检索器包括稀疏型(BM25)、密集型(BGE-M3;ColBERT风格的后期交互;RRF融合)和视觉感知变体(ColPali,使用PaliGemma加上块级MaxSim;DSE,使用图像级密集嵌入);这些方法都不依赖文档级结构。自适应K选择已通过章节树导航(PageIndex)、层次化摘要(RAPTOR)、反思控制检索(Self-RAG)、基于摘要的重排序(SimpleDoc)和相关性聚类(AVIR)得到解决。近期智能体方法使用迭代细化(Doc-React)、统一的多模态大语言模型检索-生成(URaG)或多轮强化学习(MM-Doc-R1)。这些方法要么依赖于单一结构/语义/视觉信号,要么需要端到端的多模态大语言模型/智能体训练;**Trident**是互补的——无需训练、检索器无关,并且可以通过多维度标注轻松地添加到任何流程中。

#### 带有结构化特征的大语言模型重排序器。
检索增强生成传统上通过端到端训练将检索器和生成器耦合;**Trident**则处于设计空间的另一端——模块化且基于提示,其多维度标注作为一个冻结的抽象层,可与任何候选池和任何视觉语言模型配对使用,无需重新训练。RankGPT将原始候选项文本暴露给大语言模型进行重新打分;近期工作转而让大语言模型重排序器基于*结构化的候选特征*进行条件判断:CoRank(科学检索的类别/章节/关键词)、FinCARDS(金融问答的模式字段)、KeyB2(块选择)和AcuRank(不确定性感知的自适应列表排序)——这些都是纯文本的。**Trident**在三个方面有所不同:(i)我们针对*长文档多模态*问答,使用视觉语言模型生成的视觉标题作为大语言模型可读的多模态证据接口;(ii)我们通过跨五个检索器范式的跨候选池隔离测试该接口,并显示通过不对称移除标题和候选池不变的仅标题消融实验,收益可以转移到视觉ColPali候选池;(iii)我们的生成侧类似模块**Trident-S**将相同原理扩展到多视角视觉语言模型提示。我们还公开了多维度元数据——跨主题/实体/结构轴的概念命中,加上章节路径、视觉标题和实体标签——使得在表面文本在前20个候选中重复时,标注级别的推理成为可能。知识图谱已被用于文本语料库和文档问答的检索;**Trident**的不同之处在于将标注视为页面级的重排序器友好抽象层,而非图遍历基底。

#### 基于标题的方法 vs 基于多模态大语言模型的方法。
两个架构家族将视觉内容纳入多模态重排序器。基于标题的方法通过视觉语言模型描述将页面图像转换为文本,并将其输入纯文本大语言模型重排序器;这种模式在工业RAG系统(Haystack、NVIDIA RAG Blueprint、IBM Multimodal RAG)中很常见,但在学术界由于“会丢失视觉细节”的假设而未被充分探索。基于多模态大语言模型的方法让多模态大语言模型直接查看页面图像,包括零样本提示的重排序器、微调/强化学习训练的变体以及列表式/生产环境重排序器;所有这些方法都有效,但每个查询成本高昂,通常需要多模态指令微调或强化学习训练。同期工作也直接在视觉语言模型编码的页面上进行检索。**Trident**系统性地重新审视了用于长文档多模态问答的基于标题的路径,并表明通过结构化的多维度标注,纯文本大语言模型重排序器在每个查询成本仅为一小部分的情况下,其性能可与纯文本/视觉基线竞争或更优,同时与任何上游检索器保持即插即用的兼容性——通过跨五个检索器范式的跨候选池隔离进行测试。

#### 视觉语言模型增强的大语言模型问答与多视角提示。
SCRA-VQA将单图像VQA转换为标题加视觉语言模型重排序流程,证明视觉语言模型标题可以在单图像规模上显著增强基于大语言模型的问答;MPCAR从多个分析视角生成多样化的互补描述,并在单图像大型视觉语言模型推理提示中融合它们。**Trident**将这一谱系扩展到*长文档*多模态检索和生成:视觉标题在检索侧被确定为最强的通用标注字段;生成侧的三个正交视角(**Trident-S**)围绕我们的主题/实体/结构分解轴进行构建,并在格式感知的大语言模型综合调用之前执行。关键的是,我们*描述了* **Trident-S** 的有效范围(仅在开放式综合问题上获得显著增益),而非声称具有普适性提升。

## 3 方法

参见标题图2:**TRIDE**的整体框架

相似文章

MM-BizRAG:重新思考面向通用企业问答的多模态检索增强生成

arXiv cs.CL

MM-BizRAG 是一个面向企业问答的多模态检索增强生成系统,通过文档结构感知分割和版式感知解析,在异构企业文档上的表现比以视觉为中心的基线方法最高提升 32%。该论文还提出了 FastRAGEval——一种基于 LLM 的高效评估指标,其与人类判断的对齐程度优于 RAGChecker,且成本更低。