SynthDocBench:长上下文视觉文档理解的控制基准
摘要
SynthDocBench 是一个完全合成的长上下文视觉文档理解基准,它系统地控制文档长度、布局、模态和问题类型,揭示了当前VLM中的失败模式,如长度退化和位置敏感性。
查看缓存全文
缓存时间: 2026/07/15 16:22
论文页面 - SynthDocBench:长上下文视觉文档理解的受控基准测试
来源:https://huggingface.co/papers/2607.10400
摘要
视觉语言模型在视觉文档理解基准测试(如DocVQA、ChartQA和MMLongBench-Doc)上取得了强劲性能。然而,真实文档融合了长度、布局复杂度、模态和问题难度等多种因素,这使得将模型失败归因于特定原因变得困难。我们引入了SynthDocBench,一个完全合成的长上下文视觉文档理解基准测试,它系统性地控制了文档长度、布局结构、模态组成和问题类型等因素。该基准测试采用组合设计构建,每个因素在生成的文档中独立变化,从而能够对模型行为进行受控分析。文档通过LLM流水线端到端生成,覆盖六种布局原型,并包含40%的随机覆盖以防止模型利用虚假相关性。此外,SynthDocBench涵盖的长上下文文档在长度和结构多样性上显著优于现有基准测试。评估七个前沿视觉语言模型后,我们发现了现有基准测试无法揭示的三种失败模式:随文档长度急剧退化;系统性的位置敏感性,其中文档中间三分之一对六个模型中的五个最难,且六个模型中的五个呈现出负向的早期到后期趋势(最大降幅:8.3个百分点);以及在长文档场景中图表理解能力的崩溃。这些结果表明,当前模型可能过度拟合基准测试的人工产物,而非实现稳健的长上下文视觉文档理解。
查看arXiv页面 (https://arxiv.org/abs/2607.10400)查看PDF (https://arxiv.org/pdf/2607.10400)GitHub1 (https://github.com/ServiceNow/SynthDocBench)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.10400)
在你的智能体中获取此论文:
hf papers read 2607.10400
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型关联此论文
请在模型README.md中引用arxiv.org/abs/2607.10400以在此页面建立关联。
引用此论文的数据集0
没有数据集关联此论文
请在数据集README.md中引用arxiv.org/abs/2607.10400以在此页面建立关联。
引用此论文的空间0
没有空间关联此论文
请在空间README.md中引用arxiv.org/abs/2607.10400以在此页面建立关联。
包含此论文的收藏集0
没有收藏集包含此论文
请将此论文添加到一个收藏集 (https://huggingface.co/new-collection)中以在此页面建立关联。
相似文章
XL-DocBench:证据支撑的超长文档理解基准测试
介绍了XL-DocBench,这是一个经过人工验证的超长文档理解基准,涵盖六个专业领域的1,519个问题,要求多页证据和结构化推理,表明当前大语言模型在处理长上下文专业文档时仍存在困难。
MMLongBench-Doc-V2: A Corrected-Annotation, Semantics-Aware Revision of MMLongBench-Doc
This paper presents MMLongBench-Doc-V2, a corrected and semantics-aware revision of the MMLongBench-Doc long-document QA benchmark, fixing annotation errors and replacing string matching with an LLM judge, along with a decision procedure for empty-set keys.
DocScope:用于值得信赖的长文档理解的可靠推理基准测试
DocScope 是一个新的基准测试,旨在评估多模态大语言模型在长文档上的可靠推理能力和可信度,引入了包含页面定位、区域定位、事实提取和答案验证四个阶段的评估协议。
# MemoryDocDataSet:联合对话记忆与长文档推理基准测试
MemoryDocDataSet 是一个全新的合成基准测试,包含 50 个微型世界和 1,000 个问答对,专为同时评估 AI 系统在对话记忆与长文档推理两项联合任务上的表现而设计。最优基线方法(RAG-Both)的整体 F1 值仅为 0.358,凸显了当前系统在将对话记忆与长文档导航能力融为一体方面存在的显著差距。
VCG-Bench:面向统一视觉中心的生成与编辑结构化基准
VCG-Bench 是一个统一基准,用于评估视觉-语言模型在结构化图表生成与编辑任务上的表现,引入了一种基于符号 mxGraph XML 的“以图表为代码”范式,以及一个包含 6 个领域共 1,449 张图表的分类数据集。