@tom_doerr: 爬取网站以将提取的网页内容转换为适用于大语言模型(LLM)的数据结构。 https://github.com/watercrawl/WaterC…

X AI KOLs Timeline 工具

摘要

WaterCrawl是一个开源Web应用,它爬取网站以将提取的内容转换为适用于大语言模型(LLM)的数据结构,使用Python、Django、Scrapy和Celery构建。

爬取网站以将提取的网页内容转换为适用于LLM的数据结构。 https://t.co/qWUmYsVfHy https://t.co/9ovjGYGoXg
查看原文
查看缓存全文

缓存时间: 2026/08/28 03:45

抓取网站并将提取的网页内容转换为适合大语言模型(LLM)的数据结构。 https://t.co/qWUmYsVfHy https://t.co/9ovjGYGoXg

watercrawl/WaterCrawl

源码地址:https://github.com/watercrawl/WaterCrawl WaterCrawl (https://watercrawl.dev) 定价方案 (https://watercrawl.dev/pricing) GitHub 发布版本(最新发布) (https://github.com/watercrawl/watercrawl/releases) GitHub 工作流状态 (https://github.com/watercrawl/watercrawl/actions) Docker 镜像版本 (https://hub.docker.com/r/watercrawl/watercrawl) GitHub 星标 (https://github.com/watercrawl/watercrawl/stargazers) GitHub 议题 (https://github.com/watercrawl/watercrawl/issues) Python 版本 (https://www.python.org/downloads/) 🕷️ WaterCrawl 是一个强大的 Web 应用程序,它使用 Python、Django、Scrapy 和 Celery 来抓取网页并提取相关数据。

🚀 快速开始

  1. 🐳 快速开始
  2. 💻 开发(用于贡献)

🐳 快速开始

要在本地 Docker 上构建并运行 WaterCrawl,请遵循以下步骤:

  1. 克隆仓库:
    git clone https://github.com/watercrawl/watercrawl.git
    cd watercrawl
    
  2. 构建并运行 Docker 容器:
    cd docker
    cp .env.example .env
    docker compose up -d
    
  3. 访问应用程序:打开 http://localhost

⚠️ 重要提示:如果您在 localhost 以外的域名或 IP 地址上部署,必须更新 .env 文件中的 MinIO 配置:

# 将此项从 'localhost' 更改为您的实际域名或 IP
MINIO_EXTERNAL_ENDPOINT=your-domain.com

# 同时相应地更新这些 URL
MINIO_BROWSER_REDIRECT_URL=http://your-domain.com/minio-console/
MINIO_SERVER_URL=http://your-domain.com/

未能更新这些设置将导致文件上传和下载失败。更多详细信息,请参阅 部署指南

重要提示:在部署到生产环境之前,请确保使用适当的配置值更新 .env 文件。此外,请确保设置和配置数据库、MinIO 以及任何其他必需的服务。更多信息,请阅读 部署指南

💻 开发(用于贡献)

有关本地开发和贡献,请遵循我们的 贡献指南 🤝

✨ 功能特性

  • 🕸️ 高级网页抓取与数据提取
    • 使用高度可定制的选项抓取网站,可控制深度、速度并针对特定内容
  • 🔍 强大的搜索引擎
    • 通过多种搜索深度(基础、高级、终极)在全网查找相关性内容
  • 🌐 多语言支持
    • 针对特定国家/地区搜索和抓取不同语言的内容
  • ⚡ 异步处理
    • 通过服务器发送事件 (SSE) 实时监控抓取和搜索进度
  • 🔄 遵循 OpenAPI 规范的 REST API
    • 包含详细文档和客户端库的全面 API
  • 🔌 丰富的生态系统
    • 集成 Dify、N8N 及其他 AI/自动化平台
  • 🏠 自托管与开源
    • 完全控制您的数据,提供简便的部署选项
  • 📊 高级结果处理
    • 使用可自定义参数下载和处理搜索结果

查看我们的 API 概览 以了解更多关于这些功能的信息。

🛠️ 客户端 SDK

  • Python 客户端 (https://docs.watercrawl.dev/clients/python)
    • 功能完整的 SDK,支持所有 API 端点
  • Node.js 客户端 (https://docs.watercrawl.dev/clients/nodejs)
    • 完整的 JavaScript/TypeScript 集成
  • Go 客户端 (https://docs.watercrawl.dev/clients/go)
    • 功能完整的 SDK,支持所有 API 端点
  • PHP 客户端 (https://docs.watercrawl.dev/clients/php)
    • 功能完整的 SDK,支持所有 API 端点
  • 🔜 Rust 客户端 (https://docs.watercrawl.dev/clients/rust)
    • 即将推出

🔌 集成

  • ✅ Dify 插件 (https://marketplace.dify.ai/plugins/watercrawl/watercrawl) (源代码
  • ✅ N8N 工作流节点 (https://www.npmjs.com/package/@watercrawl/n8n-nodes-watercrawl) (源代码
  • ✅ Dify 知识库 (https://dify.ai/)
  • 🔄 Langflow (拉取请求 - 尚未合并)
  • 🔜 Flowise (即将推出)

🔧 插件

  • ✅ WaterCrawl 插件
  • ✅ OpenAI 插件

⭐ 星标历史

星标历史图表

🔒 安全漏洞披露

⚠️ 请避免在 GitHub 上发布安全问题。请将您的问题发送至 [email protected],我们将为您提供更详细的解答。

📄 许可证

本仓库在 WaterCrawl 许可证 下提供,该许可证本质上是 MIT 许可证,但附有一些额外限制。


由 WaterCrawl 团队用心制作 ❤️

相似文章