Institutional Newspapers Pipeline:从历史报纸中提取数十亿高质量令牌

Hugging Face Daily Papers 论文

摘要

本文介绍了一个模块化流程,用于从历史报纸扫描件中提取结构化文本和元数据,从而生成一个包含数十亿令牌的开放数据集,这些令牌来自数百万扫描件。

历史报纸是公共生活的丰富记录,但其密集、不规则且有时嘈杂的布局使得计算访问这些材料既具挑战性又受限。我们介绍了Institutional Newspapers Pipeline,这是一个与Boston Public Library共同设计的模块化系统,用于从历史报纸扫描件中提取高质量、结构化的数据集。其架构设计使得每个步骤都保持可解释性和可定制性,并且整个流程在计算上足够节省,可以在工作站级硬件上运行。该流程通过多步骤处理每个扫描件:它将扫描件分割成独立的类型无关裁剪区域,并对每个生成的片段执行OCR,然后对每个裁剪区域执行文本分析、类型分类、阅读顺序检测、命名实体识别、主题分类、语言检测以及预计算嵌入生成。我们针对Boston Public Library的部分馆藏运行了此流程,并将结果作为开放数据集发布。光学字符识别(OCR)输出代表了16.3 billion o200k_base令牌,分布在83.1 million个独立裁剪区域中,提取自1,473,635份1795年至1930年间出版的公共领域报纸扫描件。本报告描述了我们每个处理步骤的方法、我们训练的小型模型,以及我们在过程中收集的评估结果和数据集规模测量。它伴随着流程、模型和数据集的发布。我们将此工作定位为解锁数千万报纸扫描件中高质量数据的重要一步。
查看原文
查看缓存全文

缓存时间: 2026/09/03 07:51

论文页面 - 机构报纸流水线:从历史报纸中提取数十亿高质量词元

来源:https://huggingface.co/papers/2608.18972

摘要

一个模块化流水线使用小型可解释模型,从历史报纸扫描件中提取结构化文本和元数据,生成了一个大规模开放数据集。

历史报纸是公共生活的丰富记录,但其密集、不规则且有时嘈杂的版面布局使得计算访问这些材料既具挑战性又受到限制。我们推出了机构报纸流水线,这是一个我们与波士顿公共图书馆共同设计的模块化系统,用于从历史报纸扫描件中提取高质量的结构化数据集。其架构设计确保每个步骤都保持可解释性和可定制性,同时整个流水线保持足够的计算经济性,能在工作站级别的硬件上运行。该流水线对每个扫描件执行多步处理:将扫描件分割成独立的、不区分类型的裁剪片段,并对每个生成的片段执行OCR (https://huggingface.co/papers?q=OCR),然后对每个裁剪片段执行文本分析、类型分类 (https://huggingface.co/papers?q=type%20classification)、阅读顺序检测 (https://huggingface.co/papers?q=reading%20order%20detection)、命名实体识别、主题分类 (https://huggingface.co/papers?q=subject%20classification)、语言检测 (https://huggingface.co/papers?q=language%20detection) 以及预计算嵌入生成 (https://huggingface.co/papers?q=embeddings%20generation)。我们对波士顿公共图书馆的部分馆藏运行了这个流水线,并将结果作为开放数据集发布。光学字符识别 (OCR (https://huggingface.co/papers?q=OCR)) 输出涵盖了从1795年至1930年间出版的1,473,635份公共领域报纸扫描件中提取的8310万个独立裁剪片段,总计163亿个o200k_base词元。本报告描述了我们每个处理步骤的方法、我们训练的小型模型,以及在此过程中收集的评估结果和数据集规模测量。它伴随着流水线、模型和数据集的发布。我们将这项工作定位为解锁数千万报纸扫描件中高质量数据的重要一步。

查看arXiv页面 (https://arxiv.org/abs/2608.18972)查看PDF (https://arxiv.org/pdf/2608.18972)项目页面 (https://huggingface.co/collections/institutional/institutional-newspapers)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.18972)

引用本文的模型3

institutional/institutional-newspapers-crop-classifier-image-yolo26m-cls 图像分类• 更新于14天前 • 1 (https://huggingface.co/institutional/institutional-newspapers-crop-classifier-image-yolo26m-cls)

institutional/institutional-newspapers-crop-classifier-text-model2vec 文本分类• 32.4M• 更新于约19小时前 • 12 • 1 (https://huggingface.co/institutional/institutional-newspapers-crop-classifier-text-model2vec)

institutional/institutional-newspapers-segmenter-yolo26x 更新于14天前 • 1 • 1 (https://huggingface.co/institutional/institutional-newspapers-segmenter-yolo26x)

引用本文的数据集1

institutional/institutional-newspapers-bpl 查看器• 更新于14天前 • 1.47M • 1.28k • 2 (https://huggingface.co/datasets/institutional/institutional-newspapers-bpl)

引用本文的Spaces0

无链接到本文的Space。

在Space的README.md中引用arxiv.org/abs/2608.18972以从此页面链接。

包含本文的收藏集1

相似文章

利用形态学进行历史文字计量分析

Hugging Face Daily Papers

本文提出了一种基于Transformer的架构,结合原型学习,仅利用行级转录即可从历史文档中进行可扩展的古文字测量,并在仅有少量训练数据的160页手抄本上证明了其有效性。

基于采样BPE标记统计的中文网络级语料库审计

arXiv cs.CL

本文介绍了Sampled-BPE,一个轻量级的标记级审计流水线,用于中文网络规模语料库,并应用它揭示了开放中文数据集和Common Crawl快照中广泛但不均匀的污染。文章还发布了一个包含超过63万条带上下文和解释的污染标记记录的分层数据集。