BaFCo:针对复杂孟加拉语表单理解的文档理解基准
摘要
提出了BaFCo,一个面向孟加拉语表单理解的基准数据集,重点关注文档布局分析(DLA)和关键信息提取(KIE)。该数据集包含200份多页复杂孟加拉国政府表单,涵盖26种实体类型的细粒度标注,并对多个多模态大型语言模型(MLLMs)进行了评估,揭示了当前模型在理解复杂孟加拉语表单方面的局限性。
arXiv:2607.05614v1 公告类型:新增
摘要:文档理解对于多模态大语言模型来说是一项具有挑战性但影响深远的工作,尤其是随着这些系统在真实世界、以人为中心的应用中日益普及。然而,对于孟加拉语等低资源语言,由于缺乏高质量标注数据,这种普及受到限制。为弥补这一缺口,我们提出了BaFCo——一个专注于文档布局分析(DLA)和关键信息提取(KIE)的孟加拉语表单理解基准数据集。BaFCo收集了200份来自农业、教育、银行和土地管理等不同领域的多页复杂孟加拉国政府表单。为准确捕捉这些表单的结构和上下文复杂性,我们定义了一个包含26种表单实体类型的细粒度标注模式,以及一个包含5种类型的独立粗粒度表单实体集。我们使用零样本和思维链提示,在低推理和高推理设置下评估了来自ChatGPT、Gemini、Claude、Qwen和Kimi系列的最新MLLMs。实验结果揭示了当前MLLMs在理解孟加拉语表单方面的局限性,特别是在精确定位高度细粒度的表单实体方面。我们的数据集和代码可在 https://huggingface.co/datasets/Mausul/bafco 获取。
查看缓存全文
缓存时间: 2026/07/08 04:41
# BaFCo:面向复杂孟加拉语表单理解的文档理解基准 来源:arXiv:2607.05614 1威奇塔州立大学,美国 2计算与数据科学中心,孟加拉国 3达卡大学,孟加拉国 4亚马逊通用人工智能,美国 Ishita Sur Apan, Fahim Ahmed, Sumaiya Karim Katha, Ezharuddin Jubaer, Armun Alam, Pranjal Kumar Nandi, Amin Ahsan Ali, Aman Chadha, Md Mofijul Islam, AKM Mahbubur Rahman ###### 摘要 文档理解对于多模态大语言模型(MLLMs)而言是一项既具挑战性又影响深远的任务,尤其是在这些系统越来越多地被应用于真实世界、以人为本的场景中。然而,对于孟加拉语等低资源语言而言,由于缺乏高质量标注数据,这种应用受到限制。为填补这一空白,我们提出了BaFCo,一个专注于文档布局分析(DLA)和关键信息提取(KIE)的孟加拉语表单理解基准数据集。BaFCo精心整理了200份多页复杂孟加拉国政府表单,涵盖农业、教育、银行和土地管理等不同领域。为了准确捕捉这些表单的结构和上下文复杂性,我们定义了一个包含26种表单实体类型的细粒度标注方案,以及一个由5种类型组成的独立粗粒度表单实体集。我们使用零样本和思维链提示,在低推理和高推理两种设置下,评估了来自ChatGPT、Gemini、Claude、Qwen和Kimi系列的最新MLLMs。我们的结果揭示了当前MLLMs在理解孟加拉语表单方面的局限性,特别是在准确定位高度细粒度的表单实体方面。我们的数据集和代码可在以下网址获取:https://huggingface.co/datasets/Mausul/bafco ††脚注:⋆同等贡献。†同等监督。‡在亚马逊任职以外完成的工作。 \(🖂\) 通讯作者: ††脚注: 已接收于第19届欧洲计算机视觉会议(ECCV),2026年。 ## 1 引言 从表单等文档中提取信息是许多现实世界系统的基础,包括银行、教育和公共管理[un_report]。文档布局分析(DLA)和关键信息提取(KIE)[dla, kie_survey_1, kie_survey_2]是文档理解的核心任务。DLA识别页面的结构元素及其之间的关系。KIE涉及定位和提取以数字或手写方式填写的表单字段中的值。DLA和KIE都是下游文档任务(如文档问答、实体链接和摘要)的基础前提。 尽管孟加拉语是全球第七大语言,拥有2.84亿使用者[zaban],但它在文档理解方面仍然是一种低资源语言。政府表单在研究中的代表性也不足,尽管它们在语义上具有多样性,且在公共服务中具有实际重要性。FUNSD[funsd]和XFUND[xfund]等基准推动了英语和其他语言表单理解的发展,但尚未有可比较的孟加拉语表单基准。因此,高质量数据集和基准的缺乏继续限制了孟加拉语文档理解系统的发展。 为了填补这一空白,我们提出了BaFCo,一个精心策划的多页孟加拉语表单理解基准,重点关注政府表单以及DLA和KIE任务。BaFCo提供了涵盖26种实体类型的细粒度标注,以及相关字段之间的标记关系。对于DLA,数据集包含200份表单(316页,每份表单1-5页)中的16,382个实体和8,771个关系。对于KIE,它进一步包括156份表单(186页)中的1,926个键值对。为了最大化多样性,我们优先选择复杂且布局多样的表单,而不是简单表单。所有标注均由经过培训的标注员创建,并由专家审核,以确保结构和语义质量。此外,我们还提供了一套端到端的评估流程、标准的文档理解指标,以及一个包含五种实体类型的粗粒度标签集,从而能够对MLLMs在孟加拉语DLA和KIE任务上进行系统评估。 随着LLMs和MLLMs的出现,文档理解工作流程已越来越多地转向生成式方法,部分原因是对话式界面的流行。MLLMs现在被广泛用于文档理解任务[genkie, genkie2, genkie3],取代了早期基于OCR的方法[ofa]。尽管存在专门的文档模型[docllm, layoutllm, mplug, dockylin],但现成的旗舰MLLMs提供了一种有吸引力的替代方案,因为它们通过公开可用的API降低了开发开销,并且由于缺乏高质量领域特定训练数据,以及训练定制模型需要大量计算资源[llm_cost, mllm_cost]。 因此,我们在BaFCo上使用无需微调的基于提示的方法评估旗舰MLLMs,以评估它们的布局定位能力以及对孟加拉语特定表单元素的理解。在DLA方面,Gemini 3 Pro在所有实验设置中表现最佳,在细粒度实体集和粗粒度实体集上的平均mAP分数分别为0.1177和0.2646。对于KIE,Gemini 3 Pro在孟加拉语表单上再次优于其他模型,但在英文表单上,GPT-5.2超过了其他模型。我们还在来自相同领域的一组英文表单上评估了这些模型,以考察语言的影响。就DLA(特别是细粒度实体集)而言,影响很小(性能差异≤0.02),而对于KIE,GPT-5.2和Claude Opus 4.6在英文表单上表现更好,而Gemini 3 Pro在孟加拉语表单上表现更好。 参见图注 图1:BaFCo数据多样性概览。(a) 三个难度级别(简单、中等、困难)的标注表单示例(见第3.2节);(b) BaFCo支持包含26种实体类型的详细布局标注,包括标题、表单键值对和表格;(c) 它通过三种关系类型(键到键、键到值、值到值)连接相关实体;(d) 表单变体示例,包括扫描件、水印和手写表单;(e) BaFCo包含来自15个领域的政府表单;(f) 每份表单基于标注难度、图像质量和表单背景标注了九个页面级属性。 我们的主要贡献如下: 1. 我们提出了BaFCo,一个高质量的孟加拉国政府表单数据集,包含26种实体类型和相关字段之间的标注关系,通过人工标注和专家审查进行了验证。 2. 我们提出了首个用于孟加拉语表单的文档布局分析(DLA)和关键信息提取(KIE)基准,填补了低资源文档理解中的一个关键空白。 3. 我们对现成的旗舰MLLMs在孟加拉语文档的DLA和KIE任务上的性能进行了实证分析,揭示了当前模型的局限性,特别是在处理细粒度布局方面。 ## 2 相关工作 **文档布局分析(DLA)**旨在识别和定位结构元素,如文本块、表格、图像和表单字段。早期的基准推动了从基于规则的系统[ha1995recursive, journet2005text]到机器学习[wu2008machine, bukhari2010document]的研究,用于分割和分类文档区域。然而,它们难以处理复杂的真实世界布局。因此,最近的方法主要依赖于结合视觉、文本和结构线索的深度学习模型[docopilot, doclayllm, layoutlmv3, mplug, publaynet],包括CNN-Transformer混合架构和多模态架构,这些模型需要高质量标注才能在不同领域和文档类型中具有泛化能力。早期的基础数据集如PubLayNet[publaynet]和DocBank[li2020docbank]分别通过利用PubMed Central和arXiv的科学文章进行扩展。然而,这些数字原生的科学数据集缺乏真实世界的布局变异性。DocLayNet[pfitzmann2022doclaynet]通过提供来自不同来源(包括财务报告、手册和法律文件)的数据填补了这一空白。 **关键信息提取(KIE)**专注于识别和提取表单键值对。在生成式KIE方法中,GenKIE[genkie]采用编码器-解码器架构,并使用基于零样本提示的评估。BROS[bros]使用多模态、布局感知编码器。LiLT[lilt]和OmniDocBench[omnidocbench]是多语言的,但孟加拉语不在其语言池中。除了OmniDocBench中的GPT4o外,没有其他工作评估过最新的旗舰MLLMs在KIE上的表现。 **表单理解**是文档智能的重要子领域,专注于从表单中提取、结构化和链接信息。FUNSD[funsd]是该领域最早的公开基准之一,为问题、答案、标题和其他文本实体以及问题-答案关系提供了标注。它推动了语义实体识别和关系提取的研究,但其标注方案主要局限于扁平的问题-答案结构。随后的数据集针对特定领域和文档类型,包括政府业务文档[buddie]、财务表单[formnlu]、收据[sroie, cord, docile]以及法律和财务文档[kleister]。虽然这些数据集包含具有挑战性的布局和长篇幅内容,但它们通常缺乏详细表单结构理解所需的细粒度文本实体标注和空间关系,特别是在低资源和特定领域设置中。 **多语言和低资源文档数据集**大多数文档布局分析基准专注于高资源语言,使得低资源设置的研究不足。XFUND[xfund]引入了一个涵盖七种语言的多语言基准。然而,许多低资源语言仍然缺失。孟加拉语就是这样一个例子:尽管其使用人数众多,但孟加拉语文档理解的公开基准一直很稀缺。BaDLAD[badlad]是第一步,引入了一个涵盖书籍、报纸、政府文档和历史记录的多领域数据集。虽然它提供了71万个多边形标注,但其标签仅限于粗粒度布局元素,如文本区域、段落、表格和图像。然而,它不支持具有表单特定实体、键值关系或政府表单结构的细粒度表单理解。 表1:BaFCo与现有文档理解基准的比较。Domain表示文档领域的数量(如金融、教育、医疗)。Form表示是否支持表单式文档;LRL,低资源语言;Multipage,多页标注;Human,人工标注。BBox和Text分别表示边界框和文本标注。Tab、Img、Sig、Cb和Photo表示表格、图像(如图形、徽标、图表)、签名、复选框(包括单选、多选和单选按钮)和照片的标注。EL表示相关字段之间的实体链接。Tasks列出了支持的任务:文档布局分析(DLA)和关键信息提取(KIE)。 | 基准 | 领域 | 表单 | 低资源语言 | 多页 | 人工 | 边界框 | 文本 | 表格 | 图像 | 签名 | 复选框 | 照片 | 实体链接 | DLA | KIE | |------|------|------|-------------|------|------|--------|------|------|------|------|--------|------|----------|-----|-----| | **DLA 基准** | | | | | | | | | | | | | | | | | PubLayNet[publaynet] | 2 | – | – | – | – | ✓ | ✓ | ✓ | ✓ | – | – | – | – | ✓ | – | | DocBank[li2020docbank] | 1 | – | – | ✓ | – | ✓ | ✓ | ✓ | ✓ | – | – | – | – | ✓ | – | | DocLayNet[pfitzmann2022doclaynet] | 5 | – | – | – | ✓ | ✓ | ✓ | ✓ | ✓ | – | – | – | – | ✓ | – | | OmniDocBench[omnidocbench] | 9 | – | – | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | – | – | – | – | ✓ | – | | **表单基准** | | | | | | | | | | | | | | | | | BuDDIE[buddie] | 3 | ✓ | – | – | ✓ | ✓ | ✓ | – | – | – | – | – | – | – | ✓ | | FUNSD[funsd] | 1 | ✓ | – | – | ✓ | ✓ | ✓ | – | – | – | – | – | ✓ | ✓ | ✓ | | XFUND[xfund] | 1 | ✓ | – | – | ✓ | ✓ | ✓ | – | – | – | – | – | ✓ | – | ✓ | | FormNLU[formnlu] | 1 | ✓ | – | – | ✓ | ✓ | ✓ | – | – | – | – | – | ✓ | ✓ | ✓ | | **低资源语言基准** | | | | | | | | | | | | | | | | | BaDLAD[badlad] | 4 | – | ✓ | – | ✓ | ✓ | ✓ | ✓ | ✓ | – | – | – | – | ✓ | – | | \rowcolorblack!10 **BaFCo (ours)** | **15** | **✓** | **✓** | **✓** | **✓** | **✓** | **✓** | **✓** | **✓** | **✓** | **✓** | **✓** | **✓** | **✓** | **✓** | 我们的工作通过BaFCo填补了这一空白,这是首个公开可用的孟加拉语表单理解和布局分析基准。BaFCo提供了涵盖26种实体类型的细粒度标注,以及相关实体之间的标记关系(例如,将字段标签链接到值),这一功能此前在孟加拉语文档中不可用。 ## 3 数据集 ### 3.1 数据收集与整理 我们采用质量优先于数量的策略,优先考虑精心选择、多样性和标注保真度,而不是规模。数据集由公开可用的孟加拉国政府表单††https://forms.portal.gov.bd/ 组成,确保了真实性和现实世界的相关性。选择政府表单是因为其结构高度结构化但布局多变、语义内容密集且具有实际重要性。 对表单进行了筛选,以去除重复、扫描不完整以及可能引入标注噪声的低质量图像。所选表单涵盖多个行政领域,包括税务、医疗、教育和公共服务。它们表现出不同程度的布局复杂性,包括多列结构、嵌套字段、表格以及手写或盖章区域。我们进一步根据布局密度、视觉混乱度和字段之间的语义耦合程度,将表单分为三个难度级别:简单、中等和困难。 与OmniDocBench[omnidocbench]或BuDDIE[buddie]等强调跨文档类型和语言广度的多语言基准不同,我们的数据集是为孟加拉语表单专门构建的。因此,本工作中的比较聚焦于包含孟加拉语内容的孟加拉语专用和多语言数据集。该数据集旨在作为低资源文档布局分析的高质量基准,而非通用语料库。 ### 3.2 数据集描述 **表单选择标准与难度级别:**首先筛选出包含1-5页的表单。然后根据布局复杂性和组件多样性将选定的表单分组为难度级别。**简单**表单包含基本元素,如表单键值对(包括一对多和键到键关系)、内联和签名键值对、页眉、标题、节标题、文本块、照片字段和页脚。然而,它们不包含表格、复选框或勾选标记。**中等**表单通过复选框、勾选标记以及仅包含列的表格引入了额外的结构复杂性,同时明确排除了包含行和列、子列或嵌入复选框和勾选标记的表格。**困难**表单代表了最高复杂级别,包括包含行、列和子列的表格;包含复选框或勾选标记的表格;以及其他独特、密集或非常规的布局组件。 **DLA 数据集组成:**在基于难度分组之后,BaFCo涵盖了多样化的表单结构,包括申请表和非申请表、稀疏和密集布局(从字段少的表单到拥挤或大量表格区域的表单),以及引导型表单(具有显式边界框)和非引导型表单(没有此类线索)。这些变体代表了...
相似文章
Khondo:孟加拉语表单文档包分割的多模态基准
介绍了 Khondo,这是首个针对孟加拉国政府表单文档包分割的基准。它是一个原生视觉、双语数据集,涵盖多种连接方案,对 MLLMs 的零样本评估表明,页面顺序重建仍然是一个关键的未解决问题。
KhatianDoc:一个人工验证的基准,用于诊断多模态LLM在孟加拉语法律土地记录上的失败
本文介绍了KhatianDoc,一个人工验证的基准,用于诊断多模态LLM在孟加拉语法律土地记录上的失败,揭示了当前模型在符号识别和文档问答等任务上的失败。
当名字不是名字:低资源大语言模型中文化纠缠的孟加拉语同形词的基准数据集与蒸馏推理
本文介绍了一个包含1,516条经专家验证的孟加拉语句子的基准数据集,用于消解文化纠缠的同形词(既是名字又是普通名词的词语)。研究表明,大语言模型存在主导意义偏见,并提出了对比思维链提示和蒸馏方法来减少这种偏见。
BanglaMemeEvidence:用于孟加拉语模因的解释性证据检测的多模态基准数据集
本文介绍了BanglaMemeEvidence,这是一个包含2,917个孟加拉语模因的多模态数据集,这些模因经过注释用于解释性证据检测,并提出了BengaliMemeEvidenceNet,一个混合框架,实现了0.74的F1分数。
HybridRAG-BN:一种用于孟加拉语KBQA的检索增强框架与微调验证
本文提出了HybridRAG-BN,一种用于孟加拉语知识库问答的检索增强框架,该框架结合了混合检索、基于Gemma的生成以及LoRA微调的验证,以F1分数0.71654和0.72912获得第一名。