@vanstriendaniel:已将包含1,080,814张公有领域图片的数据集上传到Hub,这些图片主要来自19世纪的书籍。https://huggingface.c…

X AI KOLs Following 新闻

摘要

Daniel van Strien将来自大英图书馆49,455本数字化图书(约1510–1900年)的1,080,814张公有领域图片上传至Hugging Face Hub,并按图片类型分为四个配置。

已将包含1,080,814张公有领域图片的数据集上传到Hub,这些图片主要来自19世纪的书籍。https://huggingface.co/datasets/biglam/british-library-book-images…
查看原文
查看缓存全文

缓存时间: 2026/08/09 15:25

biglam/british-library-book-images · Hugging Face 上的数据集

来源:https://huggingface.co/datasets/biglam/british-library-book-images

1,080,814 张图像,从 49,455 本数字化书籍(65,227 卷,约 2,500 万页)中裁剪而来,这些书籍出版于约 1510 年至约 1900 年。由大英图书馆与微软合作数字化,并由大英图书馆实验室在 Flickr Commons 上以“1 Million Images from Scanned Books”(扫描书籍中的一百万张图片)为名发布。这些书籍涵盖地理、哲学、历史、诗歌和文学,涉及多种语言。

四种图像类型

大英图书馆实验室将这些图像按算法对每个裁剪区域的估计,分成四个单独记录存放。每个记录在这里对应一个 config:

configimagesearliest date
embellishments416,9351510
plates385,2311528
medium217,1001567
covers61,5481510

这些类型标签是算法生成的,而非策展性的。发布说明中只提到图像是“通过算法收集的”,但并未说明具体方法,因此 plates/medium/embellishments 最好理解为页面上基于大小和位置的启发式分类,而不是艺术史分类法。尤其要注意,medium 和 plates 之间的边界是模糊的。如果这种区分对你的任务很重要,请用你自己的分类器进行过滤。

from datasets import load_dataset

# 选择一个 config —— 整个数据集约 621 GB,所以除非你有意为之,否则建议用流式加载
ds = load_dataset("biglam/british-library-book-images", "covers", split="train", streaming=True)
print(next(iter(ds)))

每十年的图像数量

decadeembellishmentsplatesmediumcoverstotal
1510s60017
1520s32016
1540s11001
1550s42017
1560s60219
1570s00011
1580s10113
1590s185419
1600s474

相似文章

Hugging Face 数据集突破 100 万!

Reddit r/LocalLLaMA

庆祝 Hugging Face 社区达成 100 万个数据集的里程碑,彰显社区通过开放数据协作推动 AI 发展的共同努力。