TestHallVQA:探索大型视觉语言模型在科学考试冗余上下文下的文档级推理
摘要
本文介绍了TestHallVQA,一个多图像VQA基准,用于评估大型视觉语言模型在冗余上下文下的文档级推理,并提出了一个新的指标F1-R2来量化计算推理和鲁棒性。
arXiv:2609.13158v1 Announce Type: new
摘要:大型视觉语言模型(LVLMs)越来越多地被期望执行基于平面媒体的视觉问答(VQA)。然而,现有的平面VQA基准通常强调孤立的挑战:一些强调长文档理解但推理深度有限,而另一些要求复杂的视觉推理但局限于单页、无噪声的设置。此外,通过理论分析,我们识别出无关视觉token的影响,这导致可测量的性能下降,但在系统量化方面受到的关注较少。为了解决这些限制,我们引入了TestHallVQA,一个多图像VQA基准,它同时体现了文档级规模和人类考试的难度,同时提供全面的任务覆盖。利用TestHallVQA可控地注入多级上下文冗余的能力,我们进一步提出了一个新指标F1-R\textsuperscript{2},它联合量化了LVLMs的计算推理能力和针对文档级冗余的证据检索鲁棒性。对主流LVLMs的广泛实验和分析揭示了它们在多个维度上的潜在缺陷,为未来研究提供了具体的见解和方向。相关的数据集、代码和完整的理论推导可在https://github.com/yqyu2317/TestHallVQA-benchmark获取。
查看缓存全文
缓存时间: 2026/09/15 08:31
# TestHallVQA:探索大型视觉语言模型在科学考试冗余上下文下的文档级推理能力 来源:https://arxiv.org/html/2609.13158 Yongqi Yu 哈尔滨工业大学,中国哈尔滨 [email protected] ORCID: 0009-0005-0674-788X (https://orcid.org/0009-0005-0674-788X) &Yu Zhang 哈尔滨工业大学,中国哈尔滨 [email protected] ORCID: 0000-0003-3090-7431 (https://orcid.org/0000-0003-3090-7431) ###### 摘要 大型视觉语言模型 \(LVLMs\) 被越来越多地期望在平面媒体上执行视觉问答 \(VQA\) 任务。然而,现有的平面 VQA 基准测试通常侧重于孤立的挑战:一些强调有限推理深度的长文档理解,另一些则需要复杂的视觉推理但仅限于单页、无噪声的场景。此外,通过理论分析,我们识别出无关视觉 token 的影响,它导致可测量的性能下降,但在系统性量化方面受到的关注很少。为了解决这些局限性,我们引入了 TestHallVQA,一个多图像 VQA 基准测试,它同时体现了文档级的规模和人类考试的难度,并提供了全面的任务覆盖。借助 TestHallVQA 可控地注入多级上下文冗余的能力,我们进一步提出了一种新的指标 F1-R2,该指标联合量化了 LVLMs 的计算推理能力以及其针对文档级冗余的证据检索鲁棒性。在主流 LVLMs 上进行的广泛实验和分析揭示了它们在多个维度上的潜在缺陷,为未来的研究提供了具体的见解和方向。相关的数据集、代码和完整的理论推导可在 https://github.com/yqyu2317/TestHallVQA-benchmark 获取。 *关键词*:文档视觉问答⋅\cdot多模态推理⋅\cdot大型视觉语言模型 ## 1 引言 随着跨模态对齐技术的成熟,大型视觉语言模型 \(LVLMs\) 已成为扩展大型语言模型 \(LLMs\)\[47 (https://arxiv.org/html/2609.13158#bib.bib72)\] 以具备视觉感知能力用于多任务的主导范式。同时,平面媒体——包括书籍、学术论文和报告——长期以来一直作为人类知识传播的基本载体\[17 (https://arxiv.org/html/2609.13158#bib.bib71)\]。因此,使 LVLMs 能够高效处理平面视觉内容已成为一个重要的研究方向\[39 (https://arxiv.org/html/2609.13158#bib.bib54),16 (https://arxiv.org/html/2609.13158#bib.bib67),52 (https://arxiv.org/html/2609.13158#bib.bib70),60 (https://arxiv.org/html/2609.13158#bib.bib64),33 (https://arxiv.org/html/2609.13158#bib.bib63)\],旨在减少文档理解和管理所需的重复性人工劳动。不同于自然场景图像,平面数据构成了多模态媒体的一种典型形式,其中文本和视觉元素——包括插图、图表、空间布局和其他结构组件——紧密交织。这种内在的异质性对 LVLMs 的细粒度视觉感知和文本理解提出了很高的要求。 当前的平面视觉问答 \(VQA\) 基准测试可以大致分为两类: **(1) 多页文档 VQA:** 这些数据集构建于以文本为中心的来源,包括文档\[52 (https://arxiv.org/html/2609.13158#bib.bib70),50 (https://arxiv.org/html/2609.13158#bib.bib69),35 (https://arxiv.org/html/2609.13158#bib.bib68),16 (https://arxiv.org/html/2609.13158#bib.bib67)\]、学术论文\[15 (https://arxiv.org/html/2609.13158#bib.bib66)\]和网页\[49 (https://arxiv.org/html/2609.13158#bib.bib65)\]。如图 1a (https://arxiv.org/html/2609.13158#S1.F1) 所示,它们提出了上下文规模和布局复杂性的双重挑战,需要跨页和跨元素交互。然而,它们在捕捉复杂推理的深度方面仍然有限。因此,它们主要评估模型的*检索*能力。 **(2) 单问题科学 VQA:** 相比之下,这一类别专注于高度抽象和具有挑战性的平面视觉内容,例如几何图示和化学结构\[60 (https://arxiv.org/html/2609.13158#bib.bib64),33 (https://arxiv.org/html/2609.13158#bib.bib63),4 (https://arxiv.org/html/2609.13158#bib.bib61)\]。如图 1b (https://arxiv.org/html/2609.13158#S1.F1) 所示,每个样本通常由一张包含明确相关证据的小图像组成。由于缺乏文档级输入的信息密度和上下文复杂性,这些样本构成了一个自包含且相对无噪声的设置。因此,此类基准测试仅评估模型的*推理*能力。 然而,在现实世界部署中,关键信息通常埋藏在长且高度冗余的上下文中。例如,对数十页文档的复杂推理是常见的实际需求。模型无法*先验地*知道上下文的哪些部分将是相关的,用户同样无法可行地手动识别所有支持性证据。然而,现有的基准测试要么缺乏足够的推理深度,要么假设了过于干净的上下文。这两种设置在很大程度上是正交的,各自只捕捉了现实世界复杂性的一个有限方面。 另一方面,我们理论分析了冗余视觉 token 对 LVLM 解码器中信息流的影响,表明这种冗余 token 会以逐层指数级增长的效应污染相关 token。我们将此现象称为**冗余视觉污染**。参见标题图 1:现有平面媒体 VQA 基准测试孤岛状态的示意图。TestHallVQA 统一了双方的优势,提供了全面的挑战。 基于上述实际和理论考量,我们寻求一种既能体现广泛上下文范围又能提供显著推理深度的数据来源,并确定*带插图的试卷*作为理想候选。为此,我们整理了大量试卷,并开发了一个半自动标注管道,构建了一个包含超过 10,000 个问题-答案对和 7,000 张试卷图像的文档级科学考试基准测试。我们将此数据集命名为 TestHallVQA(图 1c (https://arxiv.org/html/2609.13158#S1.F1)),因为它将 LVLMs 置于类似于真实考试环境的场景中,旨在更现实的评估设置,并引入了文档级深度推理的挑战。 此外,为了研究 LVLM 性能如何随着冗余上下文的增加而下降,我们为 TestHallVQA 配备了一个可控机制,用于注入多级、高度混淆的冗余图像页面,从而为每个问题诱导出平滑变化的上下文*状态*。基于此设计,我们引入了 F1-R2(检索-推理 F1 分数),这是一种统一的评估指标,联合整合了对视觉推理能力和冗余视觉干扰鲁棒性的评估,而不是像传统基准测试那样将它们解耦。 本工作的贡献有三方面: - • 我们提供了初步的理论证据,证明 LVLMs 中存在“冗余视觉污染”——这是主流 VQA 基准测试未能捕捉或诊断的现象。 - • 我们引入了 TestHallVQA,这是一个多图像 VQA 基准测试,它不仅提出了重大的视觉和计算挑战,还支持文档级视觉冗余的可控注入,从而更忠实地反映现实世界应用场景。 - • 我们提出了一种新颖的指标 F1-R2,该指标联合量化了 LVLMs 的问题解决能力(推理)及其对冗余视觉污染的鲁棒性(检索),超越了单维评估。 ## 2 相关工作 现有的 VQA 任务可以大致分为现实世界场景、3D 模拟场景和平面媒体场景。前两者作为物理世界的投影或模拟,具有丰富的标注,并在先前工作中得到了很好的建立\[2 (https://arxiv.org/html/2609.13158#bib.bib58),36 (https://arxiv.org/html/2609.13158#bib.bib57),20 (https://arxiv.org/html/2609.13158#bib.bib56),24 (https://arxiv.org/html/2609.13158#bib.bib55),3 (https://arxiv.org/html/2609.13158#bib.bib21)\]。除了真实场景,平面媒体 VQA 受到了越来越多的关注。起源于 DocVQA\[51 (https://arxiv.org/html/2609.13158#bib.bib51),40 (https://arxiv.org/html/2609.13158#bib.bib50)\],以 SingleDocVQA\[39 (https://arxiv.org/html/2609.13158#bib.bib54)\] 为代表,这一路线引入了文档页面数据集作为一种新的平面媒体。VisualMRC\[49 (https://arxiv.org/html/2609.13158#bib.bib65)\] 通过基于网络的图像扩展了这一方向,而 InfographicsVQA\[38 (https://arxiv.org/html/2609.13158#bib.bib49)\] 和 ChartQA\[37 (https://arxiv.org/html/2609.13158#bib.bib53)\] 扩展到需要结构化视觉语义推理的信息图和图表图像。然而,早期工作仅限于单页上下文,直到 DUDE\[52 (https://arxiv.org/html/2609.13158#bib.bib70)\] 和 MP-DocVQA\[50 (https://arxiv.org/html/2609.13158#bib.bib69)\] 引入了需要跨页推理的多页输入。MMLongBench\[35 (https://arxiv.org/html/2609.13158#bib.bib68)\] 进一步扩展了上下文长度(平均 47.5 页),而 LongDocURL\[16 (https://arxiv.org/html/2609.13158#bib.bib67)\] 将其推进到约 85 页,并具有更密集的跨元素依赖关系。尽管如此,它们仍然以文本为主,强调信息冗余而非真正的推理深度,大多数答案可通过浅层推理而非真正的思维链(CoT)\[56 (https://arxiv.org/html/2609.13158#bib.bib22)\] 推理获得。 另一条平面媒体 VQA 路线侧重于深度推理。早期研究处理纯文本语料库(例如 MATH\[21 (https://arxiv.org/html/2609.13158#bib.bib48)\]、GSM8K\[11 (https://arxiv.org/html/2609.13158#bib.bib47)\]),后来扩展到视觉关联推理。GeoQA\[10 (https://arxiv.org/html/2609.13158#bib.bib46)\]、Geometry3K\[34 (https://arxiv.org/html/2609.13158#bib.bib44)\] 和 UniGeo\[9 (https://arxiv.org/html/2609.13158#bib.bib45)\] 针对几何问题解决;MathVista\[33 (https://arxiv.org/html/2609.13158#bib.bib63)\] 将范围扩大到多模态数学。Zhang 等人\[63 (https://arxiv.org/html/2609.13158#bib.bib62)\]、Liu 等人\[32 (https://arxiv.org/html/2609.13158#bib.bib43)\] 识别了文本和视觉内容之间的冗余。MATH-Vision\[53 (https://arxiv.org/html/2609.13158#bib.bib42)\] 丰富了任务和领域多样性,而 WeMath\[46 (https://arxiv.org/html/2609.13158#bib.bib41)\] 引入了过程级评估。其他数学数据集\[48 (https://arxiv.org/html/2609.13158#bib.bib40),30 (https://arxiv.org/html/2609.13158#bib.bib39),65 (https://arxiv.org/html/2609.13158#bib.bib37),14 (https://arxiv.org/html/2609.13158#bib.bib36)\] 展现了互补的优势。除了数学,LogicVista\[57 (https://arxiv.org/html/2609.13158#bib.bib38)\] 研究了对多样化平面图像的逻辑推理,而 MMMU\[60 (https://arxiv.org/html/2609.13158#bib.bib64)\]、MMMU-Pro\[61 (https://arxiv.org/html/2609.13158#bib.bib35)\]、SceMQA\[31 (https://arxiv.org/html/2609.13158#bib.bib59)\] 扩展到更广泛的科学推理。尽管它们具有多样性,但这些基准测试都假设了一个无噪声的设置,每张图像一个问题,没有冗余或干扰信息,这与现实世界中冗余和复杂的场景有很大不同。 ## 3 TestHallVQA 基准测试 在本节中,我们全面介绍了提出的 TestHallVQA 基准测试。 ### 3.1 理论动机:冗余视觉污染现象 由于 LVLMs 在自回归解码过程中的注意力交互,引入冗余图像会导致无关 token 的贡献混入相关 token 的隐藏状态中,从而导致表征污染。为了描述冗余信息如何干扰 LVLMs 的推理过程,我们采用一种**基于符号化的近似算法**来对其总体趋势进行初步的理论研究。在此,我们仅关注最常见的自注意力解码器架构作为我们的分析模型;其他架构变体的推导在很大程度上是类似的,并且可以轻松迁移。 假设模型在干净设置下接收到 \(M\) 个相关 token,包括问题文本和证据图像;当引入 \(N\) 个无关视觉 token 时,接收到 \(M+N\) 个 token。为方便起见,我们将前 \(M\) 个 token 索引为相关 token,其余 \(N\) 个 token 索引为无关 token。我们考虑解码器块内的注意力层,该层是不同位置 token 交互的主要模块。这种冗余会将注意力从相关 token 分散到无关 token,并稀释有效信息。 令 \(h_x\) 表示在干净设置下第 \(x\) 个 token 的隐藏状态表示。当引入 \(N\) 个无关视觉 token 时,相应的隐藏状态表示为 \(h'_x\): \[ h_x = \hat{h}_x + \alpha_1 V_1 + \alpha_2 V_2 + \ldots + \alpha_M V_M = \hat{h}_x + \sum_{i=1}^{M} \alpha_i V_i, \quad (1) \] \[ h'_x = \hat{h}'_x + \beta_1 V'_1 + \beta_2 V'_2 + \ldots + \beta_{M+N} V'_{M+N} = \hat{h}'_x + \sum_{j=1}^{M+N} \beta_j V'_j, \quad (2) \] 其中 \(\hat{h}_x\) 和 \(\hat{h}'_x\) 表示上一层的输出(由于残差连接的存在),\(\alpha_i\) 和 \(\beta_i\) 表示注意力权重,\(V_i, V'_i \in \mathbb{R}^d\) 是第 \(i\) 个位置的**值**向量。 在引入冗余 token 后,原本分配给 \(M\) 个相关 token 的注意力被分散并重新分配到 \(N\) 个无关 token 上。平均注意力分散程度可以表示为: \[ \beta_i = \frac{\delta M}{M+N} \alpha_i, \quad (i=1,2,\ldots,M), \quad (3) \] 其中 \(\delta\) 表示我们在近似算法中使用的调和系数。此处的分散比率与 \(\frac{M}{M+N}\) 正相关。然而,注意力通常仍然集中在相关 token 上,因此实际的分散程度通常小于 \(\frac{M}{M+N}\),这意味着 \(\delta > 1\)。因此,公式 2 可以重写如下: \[ h'_x = \hat{h}'_x + \frac{\delta M}{M+N} \sum_{i=1}^{M} \alpha_i V_i + \sum_{j=M+1}^{M+N} \beta_j V'_j. \quad (4) \] 接下来,我们计算第 \(x\) 个位置 token 的隐藏状态的**信息纯度** \(\eta\),定义为其中可归因于相关内容的数值比例,以量化冗余 token 引入的污染。纯度公式化为: \[ \begin{split} \eta &= \frac{h'_x - \sum_{j=M+1}^{M+N} \beta_j V'_j}{h'_x} \\ &= \frac{\hat{h}'_x + \frac{\delta M}{M+N} \sum_{i=1}^{M} \alpha_i V_i}{\hat{h}'_x + \frac{\delta M}{M+N} \sum_{i=1}^{M} \alpha_i V_i + \sum_{j=M+1}^{M+N} \beta_j V'_j} \\ &= \frac{1}{1 + \frac{\hat{h}'_x}{\frac{\delta M}{M+N} \sum_{i=1}^{M} \alpha_i V_i}} \cdot \left( 1 + \frac{\sum_{j=M+1}^{M+N} \beta_j V'_j}{\frac{\delta M}{M+N} \sum_{i=1}^{M} \alpha_i V_i} \right)^{-1} \approx \frac{\frac{\delta M}{M+N} \sum_{i=1}^{M} \alpha_i V_i}{\frac{\delta M}{M+N} \sum_{i=1}^{M} \alpha_i V_i + \sum_{j=M+1}^{M+N} \beta_j V'_j}. \end{split} \] (注:此处为简化的理论近似推导。)
相似文章
VLMs 是否像工程师一样推理?一个基准与分阶段评估
本文介绍了 EngVQA,一个用于评估视觉语言模型工程推理能力的多模态基准,以及一个 8 阶段自动评估框架,能够对推理失败进行细粒度分析。它揭示了当前 VLMs 在工程推理能力上的重大局限性。
VLM是通过自适应测试时优化进行视频推理的优秀教师
本文提出一种新范式:视觉-语言模型(VLM)作为测试时教师,通过可微分奖励和LoRA优化引导视频生成模型(VGM),在视频推理基准测试上平均提升16.7个百分点。
HyperGVL:大型视觉-语言模型在超图理解和推理中的基准测试与改进
HyperGVL 推出首个评估大型视觉-语言模型超图理解和推理能力的基准,包含 84,000 个问答样本和 12 项任务及实际应用。论文还提出了 WiseHyGR,一个可泛化的路由器,通过自适应超图表示改进 LVLM 性能。
[R] CausalVLBench:大型视觉语言模型中视觉因果推理的基准测试。
这篇arXiv论文介绍了CausalVLBench,这是一个用于评估大型视觉语言模型中视觉因果推理的基准,涵盖三个任务:因果结构推断、干预目标预测和反事实预测。它在三个因果表示学习数据集上评估了开源LVLM,揭示了其优势与不足。
DrawingVQA:一个用于建筑图纸多深度视觉-文本推理的真实世界基准
介绍了DrawingVQA,这是首个用于评估多模态大语言模型在真实建筑图纸上表现的基准,包含33张图纸和92组涵盖三种推理深度的问答对,揭示了模型与专家性能之间的差距。