标签
对排名前10000的网站的robots.txt文件研究发现,大多数网站阻止了像GPTBot这样的AI训练爬虫,却很大程度上忽略了像OAI-SearchBot这样的实时回答机器人,突显了当前网络在AI治理方面的盲点。
一名开发者构建了一个非AI检测器,用于检测网页上旨在欺骗AI代理的隐藏指令,解决了页面可指示代理对其安全性撒谎的漏洞。
AnyCrawl 是一款高性能开源爬虫/抓取工具,集成了 Cheerio、Playwright、Puppeteer 三种引擎,支持静态解析与 JS 渲染、SERP 批量抓取、站点级爬虫、多线程/多进程并发、代理支持,并针对 LLM 数据采集优化输出格式。
.MD this page 是一个开源浏览器扩展,利用 Mozilla 的 Readability 将网页转换为干净、可直接用于大语言模型的 Markdown,具备一键捕获、预览和导出等功能。
本文提出了一个用于开放网络数据收集的受约束、可验证的智能体框架,该框架将LLM的输出从自由格式的代码转换为类型化的JSON收集器配置,在80个任务上实现了零执行阶段LLM令牌和低延迟。
Cloudflare 宣布一项新的默认政策,自 2026 年 9 月起,阻止从广告托管页面使用混合用途网络爬虫,旨在迫使 AI 公司为出版商内容付费,并区分搜索引擎与 AI 训练。
本文分类整理了14个爬虫工具,分为AI新物种、工程级框架、浏览器自动化、国内平台专用和现代轻量型五类,并附有真实案例和选型建议。
Agent Reach 是一个单一CLI工具,让AI代理无需API密钥或费用即可即时访问Twitter、Reddit、YouTube、GitHub、Bilibili和小红书。它100%开源,兼容多种代理框架。
NousResearch 的 Hermes Agent 现在通过优化的抓取后端和本地分页大页面,读取网页速度最高提升 60 倍,成本降低 49 倍。
这篇文章介绍了如何设置Coinbase Agentic Wallet,通过x402协议在Base上支付USDC来使用Apify的网页数据工具,无需Apify账户或API密钥。
MediaCrawler 是一个 GitHub 上 5.4 万+ Star 的开源多平台社交媒体爬虫工具,支持小红书、抖音、B站等 7 大平台的数据采集,具备多账号、IP 代理、断点续爬和 AI 集成等特性。
Hermes 代理的专业技巧:使用免费开源仓库 Agent Reach 为代理提供互联网访问权限,使其能够读取 YouTube、Reddit、X、LinkedIn 和 GitHub 的内容,从而降低 Token 成本并提高研究效率。
介绍了 GitHub 上的开源项目 Proxifly,每 5 分钟自动抓取并验证可用代理,覆盖 60+ 国家,支持多种协议,提供多种格式下载和 npm 安装。
来自@ecommartinez的推文,列出了10个用于网络爬虫的GitHub仓库,可从任何网站提取干净数据。
Open Agent Builder 是一款由 Firecrawl 提供支持的可视化工作流构建器,用于创建 AI 代理管道,支持通过拖放设计多步骤的抓取和自动化工作流,并提供实时执行更新。
Agent-Reach 是一个免费开源仓库,通过一条命令让 AI Agent 具备访问网页、YouTube、RSS、B站、小红书等14个平台的能力,无需复杂配置,大幅降低 Agent 联网门槛。
MediaCrawler是一个多平台自媒体数据采集工具,支持小红书、抖音、快手、B站、微博、贴吧、知乎的公开内容抓取,利用浏览器登录态绕过JS逆向,降低技术门槛。
Selector Forge 是一款浏览器扩展,利用AI生成并验证可靠的CSS/XPath选择器,用于网页自动化,帮助开发者构建稳健的选择器,适用于测试、数据抓取和页面自动化。