标签
介绍DocAnnot框架,该框架使用大型视觉语言模型、OCR以及一种空间感知的上下文匹配算法,自动生成用于文档关键信息提取的训练数据集,减少人工标注工作量。在CORD和SROIE基准测试中评估,取得了合理的F1分数,并实现了高效的人工验证。
提出了BaFCo,一个面向孟加拉语表单理解的基准数据集,重点关注文档布局分析(DLA)和关键信息提取(KIE)。该数据集包含200份多页复杂孟加拉国政府表单,涵盖26种实体类型的细粒度标注,并对多个多模态大型语言模型(MLLMs)进行了评估,揭示了当前模型在理解复杂孟加拉语表单方面的局限性。