DocHop: 信息密集文档中的跨域多跳推理基准测试
摘要
DocHop 引入了一个基准,用于评估信息密集文档中的多跳推理,重点是多模态大语言模型中的图表上下文集成,实验表明模型与人类性能之间存在显著差距。
查看缓存全文
缓存时间: 2026/09/03 05:59
# DocHop:面向信息密集型文档的域外多跳推理基准测试 来源:https://arxiv.org/html/2609.02059 **作者**: - Le Thien Phuc Nguyen(威斯康星大学麦迪逊分校) - Jaden Park(威斯康星大学麦迪逊分校) - Xinyi Gu(麻省理工学院) - Zexue He(斯坦福大学) - Soochahn Lee(国民大学) - Rogerio Feris(MIT-IBM沃森AI实验室,IBM研究院) - Yong Jae Lee(威斯康星大学麦迪逊分校) #### 摘要 多模态大语言模型(MLLMs)在结构化视觉理解任务(如图表和文档问答)中已展现出强大性能。然而,现有基准测试通常孤立评估这些领域,忽视了一个关键能力:模型能否利用文本上下文来判断如何选择、解释和聚合图表证据。我们推出 **DocHop**,一个针对文档风格图像中图表-上下文集成推理的基准测试。在 **DocHop** 中,文档叙述部分规定了多步骤组合约束,而图表则提供相应的数据值。问题基于叙述中定义的语义参考标签,要求模型在聚合多个图表的证据之前,先从上下文中解析目标实体。为实现系统评估,我们通过可控推理深度和视觉密度的随机逻辑优先生成流水线构建 **DocHop**,涵盖六个任务类别中的 2,074 个样本。对多种专有及开源 MLLMs 的实验表明,其与人类表现存在显著差距:标注者准确率超过 90%,而最佳模型仅达 62.83%。推理增强模型一致显示性能提升,但随着推理复杂度增加,性能有所下降。总体而言,**DocHop** 为有挑战性的多跳文档推理提供了可控的测试平台。 #### 关键词:机器学习,ICML ## 1 引言 近期的多模态大语言模型(MLLMs)(OpenAI, 2025b (https://arxiv.org/html/2609.02059#bib.bib2);Liu et al., 2024b (https://arxiv.org/html/2609.02059#bib.bib17);Bai et al., 2025a (https://arxiv.org/html/2609.02059#bib.bib21);Bai et al., 2025b (https://arxiv.org/html/2609.02059#bib.bib20);Comanici et al., 2025 (https://arxiv.org/html/2609.02059#bib.bib3);Liu et al., 2023 (https://arxiv.org/html/2609.02059#bib.bib26);Dai et al., 2023 (https://arxiv.org/html/2609.02059#bib.bib27))在结构化图像理解方面展现了令人期待的结果,涵盖图表(Masry et al., 2022 (https://arxiv.org/html/2609.02059#bib.bib9);Masry et al., 2025 (https://arxiv.org/html/2609.02059#bib.bib16);Xu et al., 2024 (https://arxiv.org/html/2609.02059#bib.bib10);Wang et al., 2024 (https://arxiv.org/html/2609.02059#bib.bib13);Xia et al., 2025 (https://arxiv.org/html/2609.02059#bib.bib12))、文档(Mathew et al., 2021 (https://arxiv.org/html/2609.02059#bib.bib15))以及网页界面(Liu et al., 2024d (https://arxiv.org/html/2609.02059#bib.bib28);Liu et al., 2024c (https://arxiv.org/html/2609.02059#bib.bib29))等领域。然而,现有基准测试主要将这些领域孤立评估。例如,以图表为中心和以文档为中心的数据集通常分别构建和测试,各自侧重于特定形式的视觉信息。这种分离忽视了现实世界呈现的一个关键方面:视觉数据与文本上下文之间的相互作用。在许多实际场景中,图表和文本协同工作,周围的叙述提供定义、上下文依据或推理指令,这些对于正确解释伴随的视觉证据至关重要。这些场景凸显了一个重要但尚未充分探索的能力:模型必须将文本约束与视觉证据绑定,然后使用已依据的证据进行下游推理。 本文介绍 **DocHop**¹,一个旨在评估 MLLMs 在结合图表证据与周围叙述上下文的集成文档理解能力的基准测试。核心思想是将推理逻辑与数值证据分离:文档上下文指定多步骤约束,而图表提供相应的数据值。模型必须联合解释文档叙述和图表数值,使用所描述的推理轨迹在多个图表中定位和聚合视觉证据。这种设计能够严格评估视觉密集的多跳推理,而非简单的单跳查找。 在以下段落中,我们强调 **DocHop** 的关键特性。参考标题 **图 1**:DocHop 示例插图。每个文档实例对应一个随机采样的多跳推理轨迹,该轨迹被转化为叙述上下文,并与多个图表交错。叙述指定了轨迹的组合约束,并通过分配一个语义参考标签来给执行该轨迹所得到的实体进行标注。然后,问题基于该标签而非显式实体名称提出,要求模型从文档上下文中解析目标实体,并从图表中聚合数值证据。彩色箭头表示约束在文档中出现的位置;黑色箭头表示模型需要查看的特定图表,以检查输入实体是否满足约束。 ### 集成图表-上下文推理 **DocHop** 由文档风格图像组成,其中多个图表与解释性叙述上下文交错。叙述不仅仅是提供背景文本;它指定了控制如何跨图表选择候选实体的多步骤推理约束。至关重要的是,它通过执行该推理轨迹(在其逻辑组合下)获得的实体,最终分配一个语义参考标签。然后,问题被表述为引用该标签而非显式实体名称,要求模型首先从文档上下文中解析目标实体,随后从图表中检索并聚合相应的数值证据。这种设计确保正确答案依赖于对叙述约束和视觉数据的共同理解。示例见图 1 (https://arxiv.org/html/2609.02059#S1.F1)。 ### 可控推理复杂度 为实现严格评估,我们采用随机逻辑生成流水线,而非依赖嘈杂的网页抓取数据。对于每个实例,我们首先采样一个推理轨迹——一个需要聚合来自多个不同图表信息的条件检查结构链。然后,我们提示 LLM 生成底层数据以及满足此预定义轨迹的伴随文本文档。这种逆向工程方法确保了文本与图表之间的语义一致性。至关重要的是,它允许我们沿两个轴明确控制难度:推理深度(逻辑跳数)和视觉密度(图表数量)。这产生了多样化的难度分布,使我们能够系统性地诊断模型在整个复杂度谱系上的局限性——从较低深度的图表-上下文推理到高负荷的多步聚合——详见第 3 节 (https://arxiv.org/html/2609.02059#S3)。 ### 多样的推理上下文 我们的随机生成过程确保了逻辑、视觉和主题维度上的高方差。推理轨迹随机生成,产生不同的结构,从线性链到多分支组合。这些变化共同拓宽了基准测试评估的图表-上下文推理模式的覆盖范围。跨语义领域,基准测试涵盖 480 个不同主题,其文档包含 7 种不同的图表类型。总计,DocHop 包含 2,074 个示例,涵盖 6 个不同的任务:数值检索、计数、数值推理、排名、假设推理和事实检查。这些任务通过 41 个独特的问题模板实例化,确保对模型泛化能力的全面评估。 ### 多阶段质量验证 为确保可靠性,我们实施了多阶段验证协议。首先,利用生成流水线的结构化特性,我们以编程方式验证每个示例中的数值数据。由于底层数据表和推理轨迹完全可访问,我们对数据表执行轨迹以确定性地验证生成的图表值是否满足实例化的约束,以及真实答案在数学上是否正确。其次,我们对文档上下文进行人工验证,以确保生成的叙述忠实地表达了底层推理轨迹,包括文本约束、逻辑组合和语义参考标签。第三,我们手动检查渲染后的文档图像,以确保视觉可读性和完整性,检查诸如上下文截断、布局元素重叠、图表遮挡或标签不清晰等问题。这种编程验证与人工审查的结合支持了高保真评估标准。 由于 **DocHop** 是合成构建而非从自然发生的文档中采样,我们将其定位为一个面向图表-文档集成的域外多跳推理基准。其目标并非模拟特定的真实文档分布,而是测试模型能否利用叙述上下文识别相关的图表证据并在多个图表中聚合它们。 我们在多种专有和开源 MLLMs 上评估了 DocHop。结果显示,DocHop 仍然具有挑战性,但并非无法攻克:人类标注者准确率超过 90%,而表现最佳的模型(GPT-5.2 Reasoning (OpenAI, 2025a (https://arxiv.org/html/2609.02059#bib.bib25)))总体准确率仅达到 62.83%。推理增强版本在 GPT 和 Gemini 系列中均一致优于其非推理对应版本。专有模型整体上仍然更强,开源基线在我们评估中通常表现出 9-24% 的准确率。此外,DocHop 支持沿推理深度和图表数量轴进行受控分析,随着任一复杂度因素的增加,性能稳步下降(图 5 (https://arxiv.org/html/2609.02059#S4.F5))。最后,我们提供了定性的失败案例研究,以更好地理解叙述依据和跨图表证据聚合中常见的错误。 ## 2 相关工作 ### 2.1 多模态大语言模型 近期的多模态大语言模型(MLLMs)扩展了大语言模型,加入了视觉编码器以联合处理图像和文本。通过大规模预训练和指令微调,专有和开源的 MLLMs 在广泛的多模态理解任务中展现了强大性能。代表性的专有系统包括 GPT 系列 (OpenAI, 2025b (https://arxiv.org/html/2609.02059#bib.bib2))、Gemini (Comanici et al., 2025 (https://arxiv.org/html/2609.02059#bib.bib3)) 和 Claude 模型 (Anthropic, 2025a (https://arxiv.org/html/2609.02059#bib.bib24);Anthropic, 2025b (https://arxiv.org/html/2609.02059#bib.bib23))。与此同时,开源模型如 LLaVA 风格的架构 (Liu et al., 2024b (https://arxiv.org/html/2609.02059#bib.bib17);Liu et al., 2023 (https://arxiv.org/html/2609.02059#bib.bib26))、IDEFICS (Laurençon et al., 2024b (https://arxiv.org/html/2609.02059#bib.bib18);Laurençon et al., 2024a (https://arxiv.org/html/2609.02059#bib.bib19))、Qwen-VL (Bai et al., 2025b (https://arxiv.org/html/2609.02059#bib.bib20);Bai et al., 2025a (https://arxiv.org/html/2609.02059#bib.bib21))、Molmo (Deitke et al., 2025 (https://arxiv.org/html/2609.02059#bib.bib22)) 和 InternVL (Wang et al., 2025 (https://arxiv.org/html/2609.02059#bib.bib4)) 提供了有竞争力的性能,并使得跨多样基准测试的可重复研究成为可能。这些通用 MLLMs 采用统一的架构,整合了视觉感知和语言推理,使得跨涉及图像、文档和结构化布局的任务实现零样本和少样本泛化。因此,它们已成为评估当代基准中多模态理解能力的标准基线。然而,它们在复杂多模态多跳推理任务中的能力仍待探索。 ### 2.2 结构化多模态推理基准测试 已有大量基准测试被提出,用于评估结构化图像上的视觉推理——特别是在图表、文档和网页方面。早期的图表问答数据集如 FigureQA (Kahou et al., 2017 (https://arxiv.org/html/2609.02059#bib.bib5))、DVQA (Kafle et al., 2018 (https://arxiv.org/html/2609.02059#bib.bib6))、LEAF-QA (Chaudhry et al., 2020 (https://arxiv.org/html/2609.02059#bib.bib7)) 和 PlotQA (Methani et al., 2020 (https://arxiv.org/html/2609.02059#bib.bib8)) 严重依赖从有限模板生成的问题。ChartQA (Masry et al., 2022 (https://arxiv.org/html/2609.02059#bib.bib9)) 引入了针对真实图表的人工编写问题,提高了语言多样性,但仍侧重于单图表推理,无需外部文本上下文。近期的图表和文档问答基准测试,包括 ChartBench (Xu et al., 2024 (https://arxiv.org/html/2609.02059#bib.bib10))、MMC (Liu et al., 2024a (https://arxiv.org/html/2609.02059#bib.bib11))、ChartX (Xia et al., 2025 (https://arxiv.org/html/2609.02059#bib.bib12))、ChartXiv (Wang et al., 2024 (https://arxiv.org/html/2609.02059#bib.bib13))、ChartMuseum (Tang et al., 2025 (https://arxiv.org/html/2609.02059#bib.bib14))、ChartQAPro (Masry et al., 2025 (https://arxiv.org/html/2609.02059#bib.bib16)) 和 DocVQA (Mathew et al., 2021 (https://arxiv.org/html/2609.02059#bib.bib15)) 通过纳入科学图表、多图表输入或开放式答案,增加了图像多样性和问题难度。最近,DocHop-QA (Park et al., 2025 (https://arxiv.org/html/2609.02059#bib.bib31)) 研究了跨文档集合的多模态多跳问答。然而,这些基准测试大多遵循单跳或多图表有限的范式,其中推理逻辑隐含在问题中,而非显式提供并跨模态遵循。与以往基准测试相比,DocHop 旨在评估单个文档内的多轮跨模态推理。参考标题 **图 2**:DocHop 数据生成流水线示意图。 (1) **元数据池**:我们首先提示 LLM 策划一个包含主题、实体名称、候选指标和时间戳的多样化语义元数据池,这些元数据可能出现在实例中。 (2) **图表配置采样**:从该池中,我们通过选择图表类型(例如,柱状图、折线图)并从元数据实例化其所需的结构字段,来采样一组图表 schema。 (3) **推理轨迹生成**:基于采样的图表配置,我们随机构建一个多跳推理轨迹,其中每个节点对应一个由特定图表 schema 参数化的实例化约束。 (4) **图表和文档上下文生成**:给定符号轨迹,我们提示 LLM 生成满足约束的图表表格和一个伴随的叙述上下文,以口头表达该轨迹,同时保持两个过程独立。 (5) **问答策展和文档渲染**:最后,我们在叙述中分配一个语义参考标签,实例化……
相似文章
轻量级多模态模型能否估计LLM推理性能?一项面向计算最优文档推理的研究
本研究介绍了BudgetDoc,第一个用于评估文档任务中模型-预算-性能权衡的多模态基准,并开发了DRB,一种轻量级估计器,用于预测推理性能以优化计算分配并降低LLMs成本。
DocScope:用于值得信赖的长文档理解的可靠推理基准测试
DocScope 是一个新的基准测试,旨在评估多模态大语言模型在长文档上的可靠推理能力和可信度,引入了包含页面定位、区域定位、事实提取和答案验证四个阶段的评估协议。
追踪、排序、破解:认知工作记忆扩展语言智能体中的多跳推理
本文识别了语言智能体在执行多跳推理时的关键失败模式——“上下文稀释”,并引入了SLEUTH,一种明确追踪已确认事实、活跃假设和开放性问题的认知工作记忆,在多个基准测试中展现出持续的性能提升。
From Reasoning Depth to Reasoning Breadth: Evaluating Multi-Point Associative Reasoning in Large Language Models
This paper introduces MPAR-Bench, a bilingual benchmark for evaluating multi-point associative reasoning in large language models, along with a perturbation suite and coarse-to-fine evaluation protocol. Results show that deeper reasoning does not automatically confer robust reasoning breadth.
# MemoryDocDataSet:联合对话记忆与长文档推理基准测试
MemoryDocDataSet 是一个全新的合成基准测试,包含 50 个微型世界和 1,000 个问答对,专为同时评估 AI 系统在对话记忆与长文档推理两项联合任务上的表现而设计。最优基线方法(RAG-Both)的整体 F1 值仅为 0.358,凸显了当前系统在将对话记忆与长文档导航能力融为一体方面存在的显著差距。