多页视觉丰富文档理解中的故障定位:一项实证归因研究

arXiv cs.AI 论文

摘要

一项关于多页视觉丰富文档理解(MP-VRDU)失败的实证归因研究,隔离了表示、选择与推理三种失败模式,并为在固定计算预算下构建此类系统提供了指导。

arXiv:2608.07943v1 公告类型:新 摘要:多页视觉丰富文档理解(MP-VRDU)需要管理稀疏、跨页分布且常常超出模型上下文窗口的证据。先前的工作产出了关于如何构建这些系统的相互竞争且大多未经检验的主张。我们将错误答案归因于三种失败模式——表示、选择与推理——并通过在多页文档理解数据集上固定其中两者、仅干预其一的方式,对每种模式进行隔离。我们发现,视觉是必要的,但不能替代文本提取;缺失页面限制了准确率,而干扰项影响很小;推理器即使在获得完整证据时,也无法跨页整合证据。提示可以显著改变推理行为,在改善某些结果的同时牺牲其他结果。我们将这些发现转化为在固定计算预算下构建此类系统的指导建议。
查看原文
查看缓存全文

缓存时间: 2026/08/11 08:04

# 多页视觉丰富文档理解中的故障定位:一项实证归因

来源:https://arxiv.org/html/2608.07943

Lewei Xu¹,Yihao Ding¹∗,Zihan Xu²,Daniel Yitian Su¹,Daochang Liu¹,Siwen Luo¹,Yifan Peng³,Wei Liu¹

¹西澳大学  
²墨尔本大学  
³威尔·康奈尔医学院  

∗通讯作者:[email protected]

###### 摘要

多页视觉丰富文档理解(MP-VRDU)需要管理稀疏、跨页分布且常常超出模型上下文窗口的证据。以往工作产生了关于如何构建这些系统的相互竞争且大多未经检验的主张。我们将错误答案归因于三种失败模式:表示、选择和推理,并通过在多页文档理解数据集上固定其他因素、仅干预其中一种来分别隔离每种模式。我们发现,视觉是必要的,但不能替代文本提取;缺失页面会严格限制准确性,而干扰项代价较小;即使证据完全提供,推理器仍无法跨页整合证据。提示可以在很大程度上改变推理行为,在改善某些结果的同时牺牲其他结果。我们将这些发现转化为在固定计算预算下构建此类系统的指导建议。

# 多页视觉丰富文档理解中的故障定位:一项实证归因

Lewei Xu¹,Yihao Ding¹∗,Zihan Xu²,Daniel Yitian Su¹,Daochang Liu¹,Siwen Luo¹,Yifan Peng³,Wei Liu¹

¹西澳大学 ²墨尔本大学 ³威尔·康奈尔医学院  
∗通讯作者:[email protected]

## 1 引言

在长视觉丰富文档上回答问题,其核心是一个证据管理问题。与问题相关的证据稀疏、分布在多页中,且常常大于推理器的上下文窗口,因此系统不能简单地阅读整个文档然后作答。它必须在固定的计算预算下决定要获取、编码、选择和推理的内容(Xu等,2026 (https://arxiv.org/html/2608.07943#bib.bib15))。因此,多页视觉丰富文档理解(MP-VRDU)不同于单页场景,其区别在于系统如何管理无法一次性全部容纳的证据。该领域已从多个方向探索了这一问题,但结论仍悬而未决。

一个分歧涉及表示。近期无OCR方法认为图像输入可以避免文本提取错误(Tanaka等,2025 (https://arxiv.org/html/2608.07943#bib.bib55);Zheng等,2026 (https://arxiv.org/html/2608.07943#bib.bib50)),而其他工作发现无文本推理器在密集段落上表现不佳(Hannan等,2025 (https://arxiv.org/html/2608.07943#bib.bib74)),并且文本与视觉结合优于任一单一模态(Han等,2025 (https://arxiv.org/html/2608.07943#bib.bib51);Suri等,2025 (https://arxiv.org/html/2608.07943#bib.bib40))。第二个分歧涉及选择。固定深度检索较为脆弱,因为一个问题所需的证据页数可能超过固定深度返回的数量,而返回过多又会引入稀释注意力的干扰项(Yan等,2025 (https://arxiv.org/html/2608.07943#bib.bib43);Li等,2025 (https://arxiv.org/html/2608.07943#bib.bib57))。与此同时,其他工作将检索覆盖率视为准确性的主要因素(Liu等,2025 (https://arxiv.org/html/2608.07943#bib.bib37);Zhu等,2025a (https://arxiv.org/html/2608.07943#bib.bib82))。第三个分歧涉及推理。长输入上的性能下降被归因于上下文长度限制(Wang等,2024b (https://arxiv.org/html/2608.07943#bib.bib110);Liu等,2024 (https://arxiv.org/html/2608.07943#bib.bib133)),或归因于即使上下文短到足以容纳时仍然存在的证据整合失败(Zheng等,2026 (https://arxiv.org/html/2608.07943#bib.bib50);Guo等,2026 (https://arxiv.org/html/2608.07943#bib.bib78))。这些主张塑造了系统设计,但由于它们是在不同的流水线、数据集和运行点上报告的,因此难以测试和比较。结果,该领域积累了设计直觉,却缺乏对这些直觉哪些真正成立的相应说明。

在本文中,我们认为这些分歧可以围绕每个MP-VRDU系统都必须执行的三个操作来组织:对文档进行编码、选择展示给推理器的证据,以及对该证据进行推理。这产生了三个相应的失败位点:表示(encoding未能保留回答问题所需的证据)、选择(所需证据缺失或被无关证据稀释)以及推理(模型无法组合充分证据或错误判断证据是否支持答案)。这种分解之所以有用,是因为它抽象掉了实现细节。技术差异很大,但它们干预的是相同的操作,而智能体式或迭代式系统只是重复应用这些操作。我们将这种分解用作受控归因的框架,通过固定其他位点、仅干预其中一个位点来进行。我们将这种分解应用于多页文档基准上的单遍流水线,并测试关于模态、检索和推理的几个相互竞争的主张。

我们的研究得出三个主要发现。首先,视觉对于MP-VRDU是必要的,但不能替代文本提取。其次,缺失证据会急剧限制准确性,而添加干扰证据的危害比通常假设的要小。第三,当前的推理器无法跨页整合证据,而提示和规模扩大只能部分弥合这一局限。总体而言,这些发现表明MP-VRDU的瓶颈比当前争论所暗示的更具结构性。

我们的贡献如下。(1)我们引入了一个归因框架,将MP-VRDU中的答案失败形式化为三个位点:表示、选择和推理,每个位点包含两种机制。由于这些位点是在系统功能层面而非模型架构层面定义的,因此它们为分析和比较方法提供了通用的形式化。(2)我们开展了一项受控实证研究,在统一设置下隔离每个位点,并解决了该领域关于模态、检索和推理的几个相互竞争且大多未经检验的主张。(3)我们将所得分析转化为在固定计算预算下设计和部署MP-VRDU流水线的实用指导。

## 2 相关工作

先前的工作通过端到端准确率来评估表示、检索器和推理器,这使得很难确定哪个阶段导致了改进或失败(Tanaka等,2025 (https://arxiv.org/html/2608.07943#bib.bib55);Han等,2025 (https://arxiv.org/html/2608.07943#bib.bib51);Suri等,2025 (https://arxiv.org/html/2608.07943#bib.bib40);Yan等,2025 (https://arxiv.org/html/2608.07943#bib.bib43))。分阶段诊断研究通过隔离OCR、检索或推理提供了更清晰的归因(Zhang等,2025 (https://arxiv.org/html/2608.07943#bib.bib26);Zarrinkia等,2026 (https://arxiv.org/html/2608.07943#bib.bib19)),但它们移除了竞争阶段,因此无法衡量跨阶段补偿。统一基准提高了系统间的可比性(Peng等,2025 (https://

相似文章

模型还是框架?以交互为中心的智能体故障定位分类法

arXiv cs.AI

这篇 arXiv 论文提出了一种以交互为中心的分类法,用于将 LLM 智能体故障定位到具体组件(模型 vs 框架 vs 环境),在交互边上组织了 41 种故障模式,使修复具有可操作性。论文使用人类标注和前沿模型评审员验证了该分类法。

长上下文LLM中的位置失败:推理基准测试的盲点

arXiv cs.CL

本论文识别出长上下文LLM推理基准测试中的一个盲点:它们未能控制任务在上下文中的位置,导致位置失败未被检测到。作者提出上下文旋转评估(CRE)来系统地改变任务位置、填充内容和上下文长度,揭示出当推理任务放置在长上下文中时,某些模型的准确率会严重下降。