@vanstriendaniel: 您现在可以对21.9亿个网页运行SQL查询,无需下载!@CommonCrawl 2026年4月的爬取数据及URL索引已上线@huggi...
摘要
一个Hugging Face Space允许您对Common Crawl的21.9亿个网页运行SQL查询而无需下载,它使用DuckDB直接从Hugging Face存储桶读取数据。
查看缓存全文
缓存时间: 2026/05/23 10:03
您现在可以在 21.9 亿个网页上运行 SQL 查询。无需下载!@CommonCrawl 2026 年 4 月爬取数据 + URL 索引已托管在 @huggingface 存储桶上。@duckdb 通过 hf:// 直接读取。我统计了全部 21.9 亿条数据,仅用约 35 秒。或者让您自己的 Agent 直接访问 https://huggingface.co/spaces/davanstrien/common-crawl-april-2026…
2026 年 4 月网络数据一览 —— 来自 davanstrien 的 Hugging Face Space
来源:https://huggingface.co/spaces/davanstrien/common-crawl-april-2026
Spaces (https://huggingface.co/spaces) Hugging Face 的徽标 (https://huggingface.co/) — https://huggingface.co/davanstrien davanstrien (https://huggingface.co/davanstrien) / common-crawl-april-2026 (https://huggingface.co/spaces/davanstrien/common-crawl-april-2026) 运行中
应用 (https://huggingface.co/spaces/davanstrien/common-crawl-april-2026) 文件Files (https://huggingface.co/spaces/davanstrien/common-crawl-april-2026/tree/main) 社区 (https://huggingface.co/spaces/davanstrien/common-crawl-april-2026/discussions)
刷新中
相似文章
@ClementDelangue: 很高兴看到@CommonCrawl 使用并推荐 @huggingface Buckets 用于大规模不断演变的训练数据集!…
Hugging Face 宣布推出 Storage Buckets,这是一种适用于大规模不断演变的训练数据集的存储解决方案,内置 CDN 和去重功能,并获得 CommonCrawl 的推荐。
@lhoestq: 你不知道你其实需要本地 Common Crawl
了解如何设置并在本地使用 Common Crawl 数据进行网页数据处理任务。
@vanstriendaniel: OCR模型又来了!百度公司的Unlimited-OCR是其中比较有趣的一个。你可以无需太多…
这篇文章展示了如何在Hugging Face Jobs上将百度的Unlimited-OCR模型作为临时的、兼容OpenAI的端点提供服务,支持多页文档解析,具有表格转HTML和公式转LaTeX提取等功能。
@israfill:你的AI智能体可以免费读取任何网站 - Firecrawl限制你1000页后收费,而crawl4ai在GitHub上有6.8万颗星…
一条推特帖子推广了crawl4ai,这是一个专为LLM设计的开源网络爬取工具,可将任何URL转换为LLM可用的markdown格式,与Firecrawl、ScrapingBee和Apify等付费服务相比,它提供免费无限访问。
@heynavtoor: 一个获得六万星级的网络爬虫在几天内建成。由一个开发者完成。因为一个“16美元的开源”工具让他愤怒。六万多……
Unclecode 创建了 Crawl4AI,一款免费开源网络爬虫,能将网页转换为干净的 Markdown 格式供 AI 模型使用,起因是对付费替代方案感到不满;该项目已获得 60,000 个 GitHub Star,月下载量超过一百万。