Institutional Newspapers Pipeline:从历史报纸中提取数十亿高质量令牌
摘要
本文介绍了一个模块化流程,用于从历史报纸扫描件中提取结构化文本和元数据,从而生成一个包含数十亿令牌的开放数据集,这些令牌来自数百万扫描件。
查看缓存全文
缓存时间: 2026/09/03 07:51
论文页面 - 机构报纸流水线:从历史报纸中提取数十亿高质量词元
来源:https://huggingface.co/papers/2608.18972
摘要
一个模块化流水线使用小型可解释模型,从历史报纸扫描件中提取结构化文本和元数据,生成了一个大规模开放数据集。
历史报纸是公共生活的丰富记录,但其密集、不规则且有时嘈杂的版面布局使得计算访问这些材料既具挑战性又受到限制。我们推出了机构报纸流水线,这是一个我们与波士顿公共图书馆共同设计的模块化系统,用于从历史报纸扫描件中提取高质量的结构化数据集。其架构设计确保每个步骤都保持可解释性和可定制性,同时整个流水线保持足够的计算经济性,能在工作站级别的硬件上运行。该流水线对每个扫描件执行多步处理:将扫描件分割成独立的、不区分类型的裁剪片段,并对每个生成的片段执行OCR (https://huggingface.co/papers?q=OCR),然后对每个裁剪片段执行文本分析、类型分类 (https://huggingface.co/papers?q=type%20classification)、阅读顺序检测 (https://huggingface.co/papers?q=reading%20order%20detection)、命名实体识别、主题分类 (https://huggingface.co/papers?q=subject%20classification)、语言检测 (https://huggingface.co/papers?q=language%20detection) 以及预计算嵌入生成 (https://huggingface.co/papers?q=embeddings%20generation)。我们对波士顿公共图书馆的部分馆藏运行了这个流水线,并将结果作为开放数据集发布。光学字符识别 (OCR (https://huggingface.co/papers?q=OCR)) 输出涵盖了从1795年至1930年间出版的1,473,635份公共领域报纸扫描件中提取的8310万个独立裁剪片段,总计163亿个o200k_base词元。本报告描述了我们每个处理步骤的方法、我们训练的小型模型,以及在此过程中收集的评估结果和数据集规模测量。它伴随着流水线、模型和数据集的发布。我们将这项工作定位为解锁数千万报纸扫描件中高质量数据的重要一步。
查看arXiv页面 (https://arxiv.org/abs/2608.18972)查看PDF (https://arxiv.org/pdf/2608.18972)项目页面 (https://huggingface.co/collections/institutional/institutional-newspapers)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.18972)
引用本文的模型3
institutional/institutional-newspapers-crop-classifier-image-yolo26m-cls 图像分类• 更新于14天前 • 1 (https://huggingface.co/institutional/institutional-newspapers-crop-classifier-image-yolo26m-cls)
institutional/institutional-newspapers-crop-classifier-text-model2vec 文本分类• 32.4M• 更新于约19小时前 • 12 • 1 (https://huggingface.co/institutional/institutional-newspapers-crop-classifier-text-model2vec)
institutional/institutional-newspapers-segmenter-yolo26x 更新于14天前 • 1 • 1 (https://huggingface.co/institutional/institutional-newspapers-segmenter-yolo26x)
引用本文的数据集1
institutional/institutional-newspapers-bpl 查看器• 更新于14天前 • 1.47M • 1.28k • 2 (https://huggingface.co/datasets/institutional/institutional-newspapers-bpl)
引用本文的Spaces0
无链接到本文的Space。
在Space的README.md中引用arxiv.org/abs/2608.18972以从此页面链接。
包含本文的收藏集1
相似文章
利用形态学进行历史文字计量分析
本文提出了一种基于Transformer的架构,结合原型学习,仅利用行级转录即可从历史文档中进行可扩展的古文字测量,并在仅有少量训练数据的160页手抄本上证明了其有效性。
构建了一个将金融新闻转化为结构化分析的AI管道
构建了一个AI管道,将金融新闻转化为结构化分析,包括情感、风险和机遇,重点通过提示工程和验证确保一致性。
N份通讯整合为一份摘要,专为AI工程师打造
关于一个多阶段LLM管道的介绍,它获取通讯文章、生成摘要、去重、评分重要性和紧迫性,并发布摘要,同时具有强大的提示注入防御和自我验证。
基于采样BPE标记统计的中文网络级语料库审计
本文介绍了Sampled-BPE,一个轻量级的标记级审计流水线,用于中文网络规模语料库,并应用它揭示了开放中文数据集和Common Crawl快照中广泛但不均匀的污染。文章还发布了一个包含超过63万条带上下文和解释的污染标记记录的分层数据集。
评估开源模型在高风险公共部门应用中的结构化信息提取
本文对开源OCR、LLM和VLM系统在高风险公共部门应用中的结构化信息提取进行了基准测试,发现VLM通常优于OCR+LLM流水线,但大多数配置在零样本设置中表现不佳,强调了输入质量的关键作用。