CommonForms:一个用于表单字段检测的大规模多样化数据集
摘要
本文介绍了 CommonForms,一个大规模、多样化的表单字段检测数据集,以及在该任务上实现高精度的 FFDNet 模型。数据集、模型和代码均已开源。
查看缓存全文
缓存时间: 2026/07/12 10:49
论文页面 - CommonForms:一个大规模、多样化的表单字段检测数据集
来源:https://huggingface.co/papers/2509.16506 发布于2025年9月20日
摘要
本文介绍了一个网络规模的表单字段检测数据集和模型,实现了高精度,并支持多种语言和领域。
本文介绍了CommonForms(https://huggingface.co/papers?q=CommonForms),一个用于表单字段检测的网络规模数据集。它将表单字段检测(https://huggingface.co/papers?q=form%20field%20detection)问题转化为目标检测(https://huggingface.co/papers?q=object%20detection):给定一个页面图像,预测表单字段的位置和类型(文本输入、选项按钮、签名)。
该数据集通过过滤Common Crawl以查找具有可填写元素的PDF来构建。从800万文档开始,经过过滤过程最终得到约5.5万文档、超过45万页的数据集。
分析表明,该数据集包含多种语言和领域;三分之一的页面是非英语的,在14个分类领域中,没有一个领域占比超过25%。
此外,本文还提出了一系列表单字段检测器:FFDNet-Small(https://huggingface.co/papers?q=FFDNet-Small)和FFDNet-Large(https://huggingface.co/papers?q=FFDNet-Large),它们在CommonForms(https://huggingface.co/papers?q=CommonForms)测试集上取得了非常高的平均精度。每个模型的训练成本不到500美元。
消融实验结果表明,高分辨率输入(https://huggingface.co/papers?q=high-resolution%20inputs)对于高质量的表单字段检测至关重要,并且清理过程相比使用Common Crawl中所有具有可填写字段的PDF,提高了数据效率(https://huggingface.co/papers?q=data%20efficiency)。
定性分析表明,它们的性能优于一种流行的、可制备表单的商业PDF阅读器。与最流行的商业解决方案不同,FFDNet除了文本和签名字段外,还能预测复选框(https://huggingface.co/papers?q=checkboxes)。据我们所知,这是首个发布的大规模表单字段检测(https://huggingface.co/papers?q=form%20field%20detection)数据集,也是首个开源模型。数据集、模型和代码将发布在https://github.com/jbarrow/commonforms(https://huggingface.co/papers?q=commonforms)上。
查看arXiv页面(https://arxiv.org/abs/2509.16506)查看PDF(https://arxiv.org/pdf/2509.16506)GitHub1.12k(https://github.com/jbarrow/commonforms)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2509.16506)
在你的智能体中获取这篇论文:
hf papers read 2509.16506
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本论文的模型 5
jbarrow/FFDNet-L 目标检测 • 更新于2025年10月15日 • 15(https://huggingface.co/jbarrow/FFDNet-L)
jbarrow/FFDNet-L-cpu 目标检测 • 更新于2025年10月15日 • 4(https://huggingface.co/jbarrow/FFDNet-L-cpu)
jbarrow/FFDNet-S 目标检测 • 更新于2025年10月15日 • 2(https://huggingface.co/jbarrow/FFDNet-S)
jbarrow/FFDNet-S-cpu 目标检测 • 更新于2025年11月26日(https://huggingface.co/jbarrow/FFDNet-S-cpu)
浏览5个引用本论文的模型(https://huggingface.co/models?other=arxiv:2509.16506)
引用本论文的数据集 5
Voxel51/commonforms_val_subset 查看器 • 更新于2025年10月23日 • 1 • 2.57k • 1(https://huggingface.co/datasets/Voxel51/commonforms_val_subset)
jbarrow/CommonForms 查看器 • 更新于2025年11月16日 • 487k • 1.72k • 57(https://huggingface.co/datasets/jbarrow/CommonForms)
WEwoCram/CommonForms 查看器 • 更新于4月28日 • 487k • 495(https://huggingface.co/datasets/WEwoCram/CommonForms)
kurianmelvin/CommonForms 查看器 • 更新于1月3日 • 487k • 97(https://huggingface.co/datasets/kurianmelvin/CommonForms)
浏览5个引用本论文的数据集(https://huggingface.co/datasets?other=arxiv:2509.16506)
引用本论文的Spaces 8
包含本论文的收藏集 2
相似文章
BaFCo:针对复杂孟加拉语表单理解的文档理解基准
提出了BaFCo,一个面向孟加拉语表单理解的基准数据集,重点关注文档布局分析(DLA)和关键信息提取(KIE)。该数据集包含200份多页复杂孟加拉国政府表单,涵盖26种实体类型的细粒度标注,并对多个多模态大型语言模型(MLLMs)进行了评估,揭示了当前模型在理解复杂孟加拉语表单方面的局限性。
FedCC:一种低资源联邦适应基础模型方法,用于胎儿超声图像中稳健的胼胝体定位
FedCC 提出了一种联邦学习框架,结合冻结的 DINOv2 骨干网络、轻量级 YOLO 检测头和 LoRA 模块,用于胎儿超声图像中稳健的胼胝体定位,在多中心设置下以大幅降低的通信成本实现了强劲性能。
大规模网络爬取语料库中文本包含的鲁棒且可扩展的检测
本文介绍了 FindMyText,一个开源 Python 包,它通过一种新颖的指纹链机制高效检测给定文本是否出现在大规模网络爬取语料库中,用于近似逐字复制的检测。在 ArXiv、Wikipedia 和通用网页内容的基准测试中,它展示了优越的性能。
ForMaT:视觉引导的多语言PDF翻译数据集
本文介绍了ForMaT,一个包含15个语言对、3,956个PDF文件的平行语料库,专为视觉引导的多语言翻译而设计,保留了布局元数据,用于对布局感知的机器翻译系统进行基准测试。
FllumaOne:一个代码原生的多模态CAD数据集,包含可执行程序与内核验证的特征历史
介绍了FllumaOne,一个由Flluma CAD系统中可执行Python程序生成的10万个样本的多模态CAD数据集,提供特征树、STEP几何、点云和语言描述,以支持可编辑CAD研究。