SynthDocBench:长上下文视觉文档理解的控制基准

Hugging Face Daily Papers 论文

摘要

SynthDocBench 是一个完全合成的长上下文视觉文档理解基准,它系统地控制文档长度、布局、模态和问题类型,揭示了当前VLM中的失败模式,如长度退化和位置敏感性。

视觉语言模型(VLM)在诸如 DocVQA、ChartQA 和 MMLongBench-Doc 等视觉文档理解基准上取得了强劲表现。然而,现实世界的文档综合了长度、布局复杂度、模态和问题难度等多个因素,这使得难以将模型失败归因于具体原因。我们引入了 SynthDocBench,这是一个完全合成的长上下文视觉文档理解基准,它系统地控制包括文档长度、布局结构、模态组成和问题类型在内的因素。该基准采用组合设计构建,每个因素在生成的文档中独立变化,从而能够对模型行为进行受控分析。文档通过一个 LLM 管道端到端生成,涵盖六种布局原型,并带有 40% 的随机覆盖,以防止模型利用虚假相关性。此外,SynthDocBench 涵盖的长上下文文档在长度和结构多样性上显著超过现有基准。通过评估七个前沿 VLM,我们揭示了现有基准无法发现的三种失败模式:随文档长度急剧退化;系统性的位置敏感性——文档中间三分之一对六分之五的模型最难,且六分之五的模型显示出负向的早到晚期趋势(最陡下降:8.3 个百分点);以及长文档场景下图表理解的崩溃。这些结果表明,当前模型可能过度拟合基准伪影,而非实现稳健的长上下文视觉文档理解。
查看原文
查看缓存全文

缓存时间: 2026/07/15 16:22

论文页面 - SynthDocBench:长上下文视觉文档理解的受控基准测试

来源:https://huggingface.co/papers/2607.10400

摘要

视觉语言模型在视觉文档理解基准测试(如DocVQA、ChartQA和MMLongBench-Doc)上取得了强劲性能。然而,真实文档融合了长度、布局复杂度、模态和问题难度等多种因素,这使得将模型失败归因于特定原因变得困难。我们引入了SynthDocBench,一个完全合成的长上下文视觉文档理解基准测试,它系统性地控制了文档长度、布局结构、模态组成和问题类型等因素。该基准测试采用组合设计构建,每个因素在生成的文档中独立变化,从而能够对模型行为进行受控分析。文档通过LLM流水线端到端生成,覆盖六种布局原型,并包含40%的随机覆盖以防止模型利用虚假相关性。此外,SynthDocBench涵盖的长上下文文档在长度和结构多样性上显著优于现有基准测试。评估七个前沿视觉语言模型后,我们发现了现有基准测试无法揭示的三种失败模式:随文档长度急剧退化;系统性的位置敏感性,其中文档中间三分之一对六个模型中的五个最难,且六个模型中的五个呈现出负向的早期到后期趋势(最大降幅:8.3个百分点);以及在长文档场景中图表理解能力的崩溃。这些结果表明,当前模型可能过度拟合基准测试的人工产物,而非实现稳健的长上下文视觉文档理解。

查看arXiv页面 (https://arxiv.org/abs/2607.10400)查看PDF (https://arxiv.org/pdf/2607.10400)GitHub1 (https://github.com/ServiceNow/SynthDocBench)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.10400)

在你的智能体中获取此论文:

hf papers read 2607.10400

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型关联此论文

请在模型README.md中引用arxiv.org/abs/2607.10400以在此页面建立关联。

引用此论文的数据集0

没有数据集关联此论文

请在数据集README.md中引用arxiv.org/abs/2607.10400以在此页面建立关联。

引用此论文的空间0

没有空间关联此论文

请在空间README.md中引用arxiv.org/abs/2607.10400以在此页面建立关联。

包含此论文的收藏集0

没有收藏集包含此论文

请将此论文添加到一个收藏集 (https://huggingface.co/new-collection)中以在此页面建立关联。

相似文章

XL-DocBench:证据支撑的超长文档理解基准测试

arXiv cs.CL

介绍了XL-DocBench,这是一个经过人工验证的超长文档理解基准,涵盖六个专业领域的1,519个问题,要求多页证据和结构化推理,表明当前大语言模型在处理长上下文专业文档时仍存在困难。

# MemoryDocDataSet:联合对话记忆与长文档推理基准测试

arXiv cs.CL

MemoryDocDataSet 是一个全新的合成基准测试,包含 50 个微型世界和 1,000 个问答对,专为同时评估 AI 系统在对话记忆与长文档推理两项联合任务上的表现而设计。最优基线方法(RAG-Both)的整体 F1 值仅为 0.358,凸显了当前系统在将对话记忆与长文档导航能力融为一体方面存在的显著差距。

VCG-Bench:面向统一视觉中心的生成与编辑结构化基准

arXiv cs.CL

VCG-Bench 是一个统一基准,用于评估视觉-语言模型在结构化图表生成与编辑任务上的表现,引入了一种基于符号 mxGraph XML 的“以图表为代码”范式,以及一个包含 6 个领域共 1,449 张图表的分类数据集。