@vanstriendaniel:已将包含1,080,814张公有领域图片的数据集上传到Hub,这些图片主要来自19世纪的书籍。https://huggingface.c…
摘要
Daniel van Strien将来自大英图书馆49,455本数字化图书(约1510–1900年)的1,080,814张公有领域图片上传至Hugging Face Hub,并按图片类型分为四个配置。
查看缓存全文
缓存时间: 2026/08/09 15:25
biglam/british-library-book-images · Hugging Face 上的数据集
来源:https://huggingface.co/datasets/biglam/british-library-book-images
1,080,814 张图像,从 49,455 本数字化书籍(65,227 卷,约 2,500 万页)中裁剪而来,这些书籍出版于约 1510 年至约 1900 年。由大英图书馆与微软合作数字化,并由大英图书馆实验室在 Flickr Commons 上以“1 Million Images from Scanned Books”(扫描书籍中的一百万张图片)为名发布。这些书籍涵盖地理、哲学、历史、诗歌和文学,涉及多种语言。
四种图像类型
大英图书馆实验室将这些图像按算法对每个裁剪区域的估计,分成四个单独记录存放。每个记录在这里对应一个 config:
| config | images | earliest date |
|---|---|---|
embellishments | 416,935 | 1510 |
plates | 385,231 | 1528 |
medium | 217,100 | 1567 |
covers | 61,548 | 1510 |
这些类型标签是算法生成的,而非策展性的。发布说明中只提到图像是“通过算法收集的”,但并未说明具体方法,因此 plates/medium/embellishments 最好理解为页面上基于大小和位置的启发式分类,而不是艺术史分类法。尤其要注意,medium 和 plates 之间的边界是模糊的。如果这种区分对你的任务很重要,请用你自己的分类器进行过滤。
from datasets import load_dataset
# 选择一个 config —— 整个数据集约 621 GB,所以除非你有意为之,否则建议用流式加载
ds = load_dataset("biglam/british-library-book-images", "covers", split="train", streaming=True)
print(next(iter(ds)))
每十年的图像数量
| decade | embellishments | plates | medium | covers | total |
|---|---|---|---|---|---|
| 1510s | 6 | 0 | 0 | 1 | 7 |
| 1520s | 3 | 2 | 0 | 1 | 6 |
| 1540s | 1 | 1 | 0 | 0 | 1 |
| 1550s | 4 | 2 | 0 | 1 | 7 |
| 1560s | 6 | 0 | 2 | 1 | 9 |
| 1570s | 0 | 0 | 0 | 1 | 1 |
| 1580s | 1 | 0 | 1 | 1 | 3 |
| 1590s | 1 | 8 | 5 | 4 | 19 |
| 1600s | 4 | 7 | 4 |
相似文章
@huggingface: 我们刚刚在 Hugging Face Hub 上达到了 100 万个开放数据集。开放模型需要开放数据。今天我们达成了这一里程碑,共同……
Hugging Face 宣布其 Hub 上的开放数据集数量已达到 100 万个的里程碑,强调了开放数据对于开放模型的重要性。
@vanstriendaniel:一个2.6B模型能否赢得编辑@huggingface Hub的权限?我让@liquidai的LFM2.5担任图书馆管理员职责。它调查……
Daniel van Strien将Liquid AI的2.6B LFM2.5模型放到Hugging Face上,充当一个“图书馆管理员机器人”,使用工具调查数据集并写一句话摘要,并计划在社区提供500次评分后,让它开始提议数据集卡片的PR。
@vanstriendaniel: 您现在可以对21.9亿个网页运行SQL查询,无需下载!@CommonCrawl 2026年4月的爬取数据及URL索引已上线@huggi...
一个Hugging Face Space允许您对Common Crawl的21.9亿个网页运行SQL查询而无需下载,它使用DuckDB直接从Hugging Face存储桶读取数据。
@vanstriendaniel: Hugging Face 是涵盖所有领域(包括生物医学)的 AI 与 ML 的家园!@NIH 刚刚将 @huggingface Hu…
NIH 已将 Hugging Face Hub 添加到其官方通用存储库列表中用于数据共享,允许 NIH 资助的研究人员在数据共享计划中使用它。
Hugging Face 数据集突破 100 万!
庆祝 Hugging Face 社区达成 100 万个数据集的里程碑,彰显社区通过开放数据协作推动 AI 发展的共同努力。