CommonForms:一个用于表单字段检测的大规模多样化数据集

Papers with Code Trending 论文

摘要

本文介绍了 CommonForms,一个大规模、多样化的表单字段检测数据集,以及在该任务上实现高精度的 FFDNet 模型。数据集、模型和代码均已开源。

本文介绍了 CommonForms,一个网络规模的表单字段检测数据集。它将表单字段检测问题转化为目标检测:给定一个页面的图像,预测表单字段的位置和类型(文本输入、选择按钮、签名)。该数据集通过过滤 Common Crawl 来寻找具有可填写元素的 PDF 构建而成。从 800 万份文档开始,通过过滤过程最终得到约 5.5 万份文档,包含超过 45 万页。分析表明,该数据集包含多种语言和领域的混合;三分之一的页面为非英语页面,在 14 个分类领域中,没有一个领域的占比超过 25%。 此外,本文提出了一系列表单字段检测器 FFDNet-Small 和 FFDNet-Large,它们在 CommonForms 测试集上达到了非常高的平均精度。每个模型的训练成本低于 500 美元。消融实验结果表明,高分辨率输入对于高质量表单字段检测至关重要,并且清理过程比使用 Common Crawl 中所有具有可填写字段的 PDF 更能提高数据效率。定性分析表明,它们优于一个流行的、能够准备表单的商用 PDF 阅读器。与最流行的商用解决方案不同,FFDNet 除了文本和签名字段外,还能预测复选框。据我们所知,这是首个发布的大规模表单字段检测数据集,也是首个开源模型。数据集、模型和代码将在 https://github.com/jbarrow/commonforms 上发布。
查看原文
查看缓存全文

缓存时间: 2026/07/12 10:49

论文页面 - CommonForms:一个大规模、多样化的表单字段检测数据集

来源:https://huggingface.co/papers/2509.16506 发布于2025年9月20日

摘要

本文介绍了一个网络规模的表单字段检测数据集和模型,实现了高精度,并支持多种语言和领域。

本文介绍了CommonForms(https://huggingface.co/papers?q=CommonForms),一个用于表单字段检测的网络规模数据集。它将表单字段检测(https://huggingface.co/papers?q=form%20field%20detection)问题转化为目标检测(https://huggingface.co/papers?q=object%20detection):给定一个页面图像,预测表单字段的位置和类型(文本输入、选项按钮、签名)。

该数据集通过过滤Common Crawl以查找具有可填写元素的PDF来构建。从800万文档开始,经过过滤过程最终得到约5.5万文档、超过45万页的数据集。

分析表明,该数据集包含多种语言和领域;三分之一的页面是非英语的,在14个分类领域中,没有一个领域占比超过25%。

此外,本文还提出了一系列表单字段检测器:FFDNet-Small(https://huggingface.co/papers?q=FFDNet-Small)和FFDNet-Large(https://huggingface.co/papers?q=FFDNet-Large),它们在CommonForms(https://huggingface.co/papers?q=CommonForms)测试集上取得了非常高的平均精度。每个模型的训练成本不到500美元。

消融实验结果表明,高分辨率输入(https://huggingface.co/papers?q=high-resolution%20inputs)对于高质量的表单字段检测至关重要,并且清理过程相比使用Common Crawl中所有具有可填写字段的PDF,提高了数据效率(https://huggingface.co/papers?q=data%20efficiency)。

定性分析表明,它们的性能优于一种流行的、可制备表单的商业PDF阅读器。与最流行的商业解决方案不同,FFDNet除了文本和签名字段外,还能预测复选框(https://huggingface.co/papers?q=checkboxes)。据我们所知,这是首个发布的大规模表单字段检测(https://huggingface.co/papers?q=form%20field%20detection)数据集,也是首个开源模型。数据集、模型和代码将发布在https://github.com/jbarrow/commonforms(https://huggingface.co/papers?q=commonforms)上。

查看arXiv页面(https://arxiv.org/abs/2509.16506)查看PDF(https://arxiv.org/pdf/2509.16506)GitHub1.12k(https://github.com/jbarrow/commonforms)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2509.16506)

在你的智能体中获取这篇论文:

hf papers read 2509.16506

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本论文的模型 5

jbarrow/FFDNet-L 目标检测 • 更新于2025年10月15日 • 15(https://huggingface.co/jbarrow/FFDNet-L)

jbarrow/FFDNet-L-cpu 目标检测 • 更新于2025年10月15日 • 4(https://huggingface.co/jbarrow/FFDNet-L-cpu)

jbarrow/FFDNet-S 目标检测 • 更新于2025年10月15日 • 2(https://huggingface.co/jbarrow/FFDNet-S)

jbarrow/FFDNet-S-cpu 目标检测 • 更新于2025年11月26日(https://huggingface.co/jbarrow/FFDNet-S-cpu)

浏览5个引用本论文的模型(https://huggingface.co/models?other=arxiv:2509.16506)

引用本论文的数据集 5

Voxel51/commonforms_val_subset 查看器 • 更新于2025年10月23日 • 1 • 2.57k • 1(https://huggingface.co/datasets/Voxel51/commonforms_val_subset)

jbarrow/CommonForms 查看器 • 更新于2025年11月16日 • 487k • 1.72k • 57(https://huggingface.co/datasets/jbarrow/CommonForms)

WEwoCram/CommonForms 查看器 • 更新于4月28日 • 487k • 495(https://huggingface.co/datasets/WEwoCram/CommonForms)

kurianmelvin/CommonForms 查看器 • 更新于1月3日 • 487k • 97(https://huggingface.co/datasets/kurianmelvin/CommonForms)

浏览5个引用本论文的数据集(https://huggingface.co/datasets?other=arxiv:2509.16506)

引用本论文的Spaces 8

包含本论文的收藏集 2

相似文章

BaFCo:针对复杂孟加拉语表单理解的文档理解基准

arXiv cs.CL

提出了BaFCo,一个面向孟加拉语表单理解的基准数据集,重点关注文档布局分析(DLA)和关键信息提取(KIE)。该数据集包含200份多页复杂孟加拉国政府表单,涵盖26种实体类型的细粒度标注,并对多个多模态大型语言模型(MLLMs)进行了评估,揭示了当前模型在理解复杂孟加拉语表单方面的局限性。

大规模网络爬取语料库中文本包含的鲁棒且可扩展的检测

arXiv cs.CL

本文介绍了 FindMyText,一个开源 Python 包,它通过一种新颖的指纹链机制高效检测给定文本是否出现在大规模网络爬取语料库中,用于近似逐字复制的检测。在 ArXiv、Wikipedia 和通用网页内容的基准测试中,它展示了优越的性能。

ForMaT:视觉引导的多语言PDF翻译数据集

arXiv cs.CL

本文介绍了ForMaT,一个包含15个语言对、3,956个PDF文件的平行语料库,专为视觉引导的多语言翻译而设计,保留了布局元数据,用于对布局感知的机器翻译系统进行基准测试。