@tom_doerr: 爬取网站以将提取的网页内容转换为适用于大语言模型(LLM)的数据结构。 https://github.com/watercrawl/WaterC…
摘要
WaterCrawl是一个开源Web应用,它爬取网站以将提取的内容转换为适用于大语言模型(LLM)的数据结构,使用Python、Django、Scrapy和Celery构建。
查看缓存全文
缓存时间: 2026/08/28 03:45
抓取网站并将提取的网页内容转换为适合大语言模型(LLM)的数据结构。 https://t.co/qWUmYsVfHy https://t.co/9ovjGYGoXg
watercrawl/WaterCrawl
源码地址:https://github.com/watercrawl/WaterCrawl WaterCrawl (https://watercrawl.dev) 定价方案 (https://watercrawl.dev/pricing) GitHub 发布版本(最新发布) (https://github.com/watercrawl/watercrawl/releases) GitHub 工作流状态 (https://github.com/watercrawl/watercrawl/actions) Docker 镜像版本 (https://hub.docker.com/r/watercrawl/watercrawl) GitHub 星标 (https://github.com/watercrawl/watercrawl/stargazers) GitHub 议题 (https://github.com/watercrawl/watercrawl/issues) Python 版本 (https://www.python.org/downloads/) 🕷️ WaterCrawl 是一个强大的 Web 应用程序,它使用 Python、Django、Scrapy 和 Celery 来抓取网页并提取相关数据。
🚀 快速开始
🐳 快速开始
要在本地 Docker 上构建并运行 WaterCrawl,请遵循以下步骤:
- 克隆仓库:
git clone https://github.com/watercrawl/watercrawl.git cd watercrawl - 构建并运行 Docker 容器:
cd docker cp .env.example .env docker compose up -d - 访问应用程序:打开 http://localhost
⚠️ 重要提示:如果您在 localhost 以外的域名或 IP 地址上部署,必须更新
.env文件中的 MinIO 配置:# 将此项从 'localhost' 更改为您的实际域名或 IP MINIO_EXTERNAL_ENDPOINT=your-domain.com # 同时相应地更新这些 URL MINIO_BROWSER_REDIRECT_URL=http://your-domain.com/minio-console/ MINIO_SERVER_URL=http://your-domain.com/未能更新这些设置将导致文件上传和下载失败。更多详细信息,请参阅 部署指南。
重要提示:在部署到生产环境之前,请确保使用适当的配置值更新
.env文件。此外,请确保设置和配置数据库、MinIO 以及任何其他必需的服务。更多信息,请阅读 部署指南。
💻 开发(用于贡献)
有关本地开发和贡献,请遵循我们的 贡献指南 🤝
✨ 功能特性
- 🕸️ 高级网页抓取与数据提取
- 使用高度可定制的选项抓取网站,可控制深度、速度并针对特定内容
- 🔍 强大的搜索引擎
- 通过多种搜索深度(基础、高级、终极)在全网查找相关性内容
- 🌐 多语言支持
- 针对特定国家/地区搜索和抓取不同语言的内容
- ⚡ 异步处理
- 通过服务器发送事件 (SSE) 实时监控抓取和搜索进度
- 🔄 遵循 OpenAPI 规范的 REST API
- 包含详细文档和客户端库的全面 API
- 🔌 丰富的生态系统
- 集成 Dify、N8N 及其他 AI/自动化平台
- 🏠 自托管与开源
- 完全控制您的数据,提供简便的部署选项
- 📊 高级结果处理
- 使用可自定义参数下载和处理搜索结果
查看我们的 API 概览 以了解更多关于这些功能的信息。
🛠️ 客户端 SDK
- ✅ Python 客户端 (https://docs.watercrawl.dev/clients/python)
- 功能完整的 SDK,支持所有 API 端点
- ✅ Node.js 客户端 (https://docs.watercrawl.dev/clients/nodejs)
- 完整的 JavaScript/TypeScript 集成
- ✅ Go 客户端 (https://docs.watercrawl.dev/clients/go)
- 功能完整的 SDK,支持所有 API 端点
- ✅ PHP 客户端 (https://docs.watercrawl.dev/clients/php)
- 功能完整的 SDK,支持所有 API 端点
- 🔜 Rust 客户端 (https://docs.watercrawl.dev/clients/rust)
- 即将推出
🔌 集成
- ✅ Dify 插件 (https://marketplace.dify.ai/plugins/watercrawl/watercrawl) (源代码)
- ✅ N8N 工作流节点 (https://www.npmjs.com/package/@watercrawl/n8n-nodes-watercrawl) (源代码)
- ✅ Dify 知识库 (https://dify.ai/)
- 🔄 Langflow (拉取请求 - 尚未合并)
- 🔜 Flowise (即将推出)
🔧 插件
- ✅ WaterCrawl 插件
- ✅ OpenAI 插件
⭐ 星标历史
🔒 安全漏洞披露
⚠️ 请避免在 GitHub 上发布安全问题。请将您的问题发送至 [email protected],我们将为您提供更详细的解答。
📄 许可证
本仓库在 WaterCrawl 许可证 下提供,该许可证本质上是 MIT 许可证,但附有一些额外限制。
由 WaterCrawl 团队用心制作 ❤️
相似文章
@tom_doerr: 将网站转换为干净的 Markdown 和 JSON,供 AI 代理和 RAG 管道使用。https://github.com/0xMassi/webclaw
webclaw 是一款开源工具,可将网站转换为干净的 Markdown、JSON 和 LLM 就绪上下文,提供 CLI、MCP 服务器、REST API 和 SDK,适用于 AI 代理和 RAG 管道。
@tom_doerr: 从原始数据生成LLM就绪的数据集 https://github.com/OpenDCAI/DataFlow…
DataFlow是一个开源工具,提供可视化、低代码的管道,用于从原始数据生成、清洗和准备高质量的LLM训练数据集。它包含一篇arXiv上的技术报告。
@CryptoTied: 卧槽!一个专为 LLM 优化的开源爬虫火了 Crawl4AI 是一个开源的 LLM-friendly Web Crawler & Scraper,目前 GitHub 上已有 72k+ stars。 它把网页内容转换成干净、结构化的 Mar…
Crawl4AI 是一个专为 LLM 优化的开源爬虫,可将网页内容转换为干净的结构化 Markdown,支持智能内容过滤、LLM 驱动提取、浏览器自动化等功能,适合 RAG 和 AI Agent 场景。
@tom_doerr: 使用LLMs对私有数据进行深度研究的自动化 https://github.com/zilliztech/deep-searcher…
DeepSearcher 是一个开源工具,结合了LLMs和向量数据库,能够对私有数据进行深度研究,为企业知识管理和智能问答系统提供准确的答案和报告。
@heyrimsha: Firecrawl 每月收费 $333 用于大规模爬取网站。我发现了一个 GitHub 仓库,可以做同样的事情,而且免费。它是……
一款名为 Crawl4AI 的开源网络爬虫工具爆火,它提供免费且对 LLM 友好的抓取功能,包括 JavaScript 渲染、异步爬取和清晰的结构化输出,与 Firecrawl 等付费服务形成对比。