标签
webclaw 是一款开源工具,可将网站转换为干净的 Markdown、JSON 和 LLM 就绪上下文,提供 CLI、MCP 服务器、REST API 和 SDK,适用于 AI 代理和 RAG 管道。
Firecrawl 这个知名的网页抓取工具现在无需 API Key 即可直接调用,对 AI 智能体非常实用,而且是开源项目。
介绍开源项目 Firecrawl:一个能将任意网址转换为干净 Markdown/JSON、支持 AI 交互和整站爬取的网页数据 API,专为 LLM 和 Agent 设计,已获 2.5w+ GitHub Star。
WebRover 是一个基于 MIT 协议的开源 AI Agent,通过自然语言即可驱动浏览器完成网页自动化、跨站数据抓取与深度研究,支持本地部署。
一个使用 Rust 编写的 SearXNG 风格元搜索引擎,可同时向多个搜索引擎发起查询,对结果去重,并通过 Reciprocal Rank Fusion 进行排序。
PullMD is a self-hosted URL-to-Markdown service for humans and AI agents, converting web pages, PDFs, and media files into clean Markdown, with support for an MCP server and Claude Code skill.
Reddit 针对 SerpApi 和 Perplexity AI 就 Google 搜索结果抓取提起的 DMCA 诉讼仍在继续,尽管驳回了部分索赔,法官仍允许证据开示。该案件凸显了 AI 抓取与版权法之间持续存在的紧张关系。
Website to Markdown API 是一款开发者工具,可将任意网站转换为整洁、可直接用于 LLM 的 Markdown,从而轻松将网页内容输入 AI 模型。
一款静态分析扫描器测试了五个DTC品牌,发现尽管结构化数据良好,但其自定义JavaScript(例如使用<div>而非<select>的尺码选择器)使得AI购物代理无法访问,可能导致每月因AI推荐流量损失8.2万至49.1万美元的收入。
Google和Reddit在一起法庭案件中败诉,他们曾利用DMCA起诉网络爬虫公司SerpApi;法官驳回了诉讼,裁定Google在DMCA下不具备诉讼资格,因为Google不拥有搜索结果中的版权内容。
Monid是一个新的API,让AI代理无需登录或订阅即可读取社交平台,每次请求仅需0.0015美元,是比Apify更便宜的选择。
作者解决了Claude Code无法读取微信公众号文章的问题,通过伪造User-Agent和Referer绕过微信验证,并用Python标准库提取标题、作者和正文。他将此功能封装成开源skill(rn-wechat-extract),支持一行命令提取全文,可用于Agent工作流。
一篇评论文章,强调了科技巨头抱怨模型蒸馏是生存威胁的讽刺之处,因为他们的帝国正是建立在网络爬取之上的。
Agent-Reach 是一个开源工具,通过一条命令为 AI Agent 打通 14 个网络平台(如推特、B站、YouTube等),解决了网页抓取和 API 付费等痛点,让 Agent 能直接获取网上资料。
本文批评了Anubis——一个旨在阻止AI爬虫的HTTP工作量证明代理——指出它很容易被AI绕过,同时给人类用户带来了倒退性的负担,尤其是那些使用弱设备或非JavaScript浏览器的用户。
克里斯·西本曼解释了他的反爬虫措施,由于针对LLM训练的高频爬虫激增,他阻止旧版浏览器,这给Feed阅读器和存档服务带来了混乱。
Crawl4AI 是一个开源的网页爬虫工具,能将网页内容转换为干净的 Markdown 格式,专为 LLM 的 RAG、Agent 和数据管道设计。零 API Key,快速输出结构化数据。
Context.dev 是一个获得 YC 支持的 API,允许开发者和 AI 代理从任意网站抓取、爬取和提取结构化数据,支持 Markdown、HTML、站点地图、截图和品牌智能等功能,旨在简化网络数据集成。