web-scraping

标签

Cards List
#web-scraping

阻止AI训练爬虫的网站大多忽略实时回答机器人

Hacker News Top · 2026-07-07 缓存

对排名前10000的网站的robots.txt文件研究发现,大多数网站阻止了像GPTBot这样的AI训练爬虫,却很大程度上忽略了像OAI-SearchBot这样的实时回答机器人,突显了当前网络在AI治理方面的盲点。

0 人收藏 0 人点赞
#web-scraping

如果您的智能代理读取网页,该网页可以指示它撒谎关于该网页的内容

Reddit r/AI_Agents · 2026-07-03

一名开发者构建了一个非AI检测器,用于检测网页上旨在欺骗AI代理的隐藏指令,解决了页面可指示代理对其安全性撒谎的漏洞。

0 人收藏 0 人点赞
#web-scraping

@Jolyne_AI: 又在 GitHub 挖到一款高性能爬虫/抓取利器:AnyCrawl,把数据采集这件事做得更省心、更高效。 它把 Cheerio、Playwright、Puppeteer 三种引擎打包到一起:静态页面秒解析,复杂 JavaScript 渲染…

X AI KOLs Timeline · 2026-07-03 缓存

AnyCrawl 是一款高性能开源爬虫/抓取工具,集成了 Cheerio、Playwright、Puppeteer 三种引擎,支持静态解析与 JS 渲染、SERP 批量抓取、站点级爬虫、多线程/多进程并发、代理支持,并针对 LLM 数据采集优化输出格式。

0 人收藏 0 人点赞
#web-scraping

@DanKornas: 将网页内容复制到大语言模型时,不应拖拽整个浏览器。.MD this page 是一个浏览器扩展,……

X AI KOLs Timeline · 2026-07-02 缓存

.MD this page 是一个开源浏览器扩展,利用 Mozilla 的 Readability 将网页转换为干净、可直接用于大语言模型的 Markdown,具备一键捕获、预览和导出等功能。

0 人收藏 0 人点赞
#web-scraping

让失败变得安全:一个用于开放网络数据收集的受约束、可验证的智能体框架

arXiv cs.AI · 2026-07-02 缓存

本文提出了一个用于开放网络数据收集的受约束、可验证的智能体框架,该框架将LLM的输出从自由格式的代码转换为类型化的JSON收集器配置,在80个任务上实现了零执行阶段LLM令牌和低延迟。

0 人收藏 0 人点赞
#web-scraping

Cloudflare 新政策迫使 AI 公司为出版商内容付费

TechCrunch AI · 2026-07-01 缓存

Cloudflare 宣布一项新的默认政策,自 2026 年 9 月起,阻止从广告托管页面使用混合用途网络爬虫,旨在迫使 AI 公司为出版商内容付费,并区分搜索引擎与 AI 训练。

0 人收藏 0 人点赞
#web-scraping

@yhslgg: https://x.com/yhslgg/status/2072243790044442961

X AI KOLs Timeline · 2026-07-01 缓存

本文分类整理了14个爬虫工具,分为AI新物种、工程级框架、浏览器自动化、国内平台专用和现代轻量型五类,并附有真实案例和选型建议。

0 人收藏 0 人点赞
#web-scraping

Context.dev

Product Hunt · 2026-07-01

Context.dev 提供单一 API,用于从互联网抓取、丰富和提取数据。

0 人收藏 0 人点赞
#web-scraping

@sharbel: 有人构建了一个单一CLI,可读取Twitter、Reddit、YouTube、GitHub、Bilibili和小红书。零API费用。零…

X AI KOLs Timeline · 2026-06-30 缓存

Agent Reach 是一个单一CLI工具,让AI代理无需API密钥或费用即可即时访问Twitter、Reddit、YouTube、GitHub、Bilibili和小红书。它100%开源,兼容多种代理框架。

0 人收藏 0 人点赞
#web-scraping

@NousResearch:Hermes Agent 现在读取网页的速度最高提升 60 倍,成本降低 49 倍。抓取后端将干净内容直接传递给智能体...

X AI KOLs Following · 2026-06-30 缓存

NousResearch 的 Hermes Agent 现在通过优化的抓取后端和本地分页大页面,读取网页速度最高提升 60 倍,成本降低 49 倍。

0 人收藏 0 人点赞
#web-scraping

@Prajwaltomar_: 把这个给你的代理 ↓ https://apify.it/x402-awal 如需教程,请查看设置文档 ↓ https://docs.apify.com/pl…

X AI KOLs Following · 2026-06-30 缓存

这篇文章介绍了如何设置Coinbase Agentic Wallet,通过x402协议在Base上支付USDC来使用Apify的网页数据工具,无需Apify账户或API密钥。

0 人收藏 0 人点赞
#web-scraping

@CycleDecoded: 别再花大价钱买那些破爬虫软件交智商税了!这几天有个开源工具简直离谱,直接把全网社交平台的数据底裤都给扒了,搞流量矩阵和数据变现的饭碗真危了! 这就是 GitHub 上狂砍 5.4 万+ 星标的超神开源项目 MediaCrawler。大白话…

X AI KOLs Timeline · 2026-06-30 缓存

MediaCrawler 是一个 GitHub 上 5.4 万+ Star 的开源多平台社交媒体爬虫工具,支持小红书、抖音、B站等 7 大平台的数据采集,具备多账号、IP 代理、断点续爬和 AI 集成等特性。

0 人收藏 0 人点赞
#web-scraping

@PrajwalTomar_: Hermes agent 专业技巧。让你的代理真正有用的升级与模型无关。而是赋予它们…

X AI KOLs Following · 2026-06-29 缓存

Hermes 代理的专业技巧:使用免费开源仓库 Agent Reach 为代理提供互联网访问权限,使其能够读取 YouTube、Reddit、X、LinkedIn 和 GitHub 的内容,从而降低 Token 成本并提高研究效率。

0 人收藏 0 人点赞
#web-scraping

@Jolyne_AI: 做爬虫、搞数据采集,代理服务器几乎是标配,不然 IP 分分钟被封。更麻烦的是,网上一堆“免费代理”基本都失效了。 我在 GitHub 刚好挖到一个开源项目:Proxifly。它每 5 分钟自动抓取、更新并验证免费代理,把“可用”这件事做得…

X AI KOLs Timeline · 2026-06-29 缓存

介绍了 GitHub 上的开源项目 Proxifly,每 5 分钟自动抓取并验证可用代理,覆盖 60+ 国家,支持多种协议,提供多种格式下载和 npm 安装。

0 人收藏 0 人点赞
#web-scraping

@ecommartinez: 10个用于抓取整个互联网的GitHub仓库。全部保存。每个都能从任何网站提取干净数据。…

X AI KOLs Timeline · 2026-06-28 缓存

来自@ecommartinez的推文,列出了10个用于网络爬虫的GitHub仓库,可从任何网站提取干净数据。

0 人收藏 0 人点赞
#web-scraping

如今未经许可抓取数据用于AI训练突然变得不可取了?

Reddit r/artificial · 2026-06-27

一篇关于对AI训练中网络爬取态度转变的评论,质疑为何突然谴责未经许可的数据收集。

0 人收藏 0 人点赞
#web-scraping

@DanKornas: 无需逐一手动编写,即可构建网页抓取代理。Open Agent Builder 是一个可视化工作流构建器,用于创建……

X AI KOLs Timeline · 2026-06-25 缓存

Open Agent Builder 是一款由 Firecrawl 提供支持的可视化工作流构建器,用于创建 AI 代理管道,支持通过拖放设计多步骤的抓取和自动化工作流,并提供实时执行更新。

0 人收藏 0 人点赞
#web-scraping

@laowangbabababa: 太牛逼了。真的,太牛逼了。真的能爬一切,而且速度嘎嘎快! 以前让 Claude Code 上网搜个东西,推特 API 要钱,网页抓取要订阅,B站小红书直接给你拦在外面。每个平台一个门槛,烦得要死。 Agent-Reach,一个免费开源仓库…

X AI KOLs Timeline · 2026-06-24 缓存

Agent-Reach 是一个免费开源仓库,通过一条命令让 AI Agent 具备访问网页、YouTube、RSS、B站、小红书等14个平台的能力,无需复杂配置,大幅降低 Agent 联网门槛。

0 人收藏 0 人点赞
#web-scraping

@NFTCPS: X推特上那些搬运博主的内容源终于知道从哪来的! 就这个工具MediaCrawler,一个工具通吃小红书、抖音、快手、B站、微博、贴吧、知乎,公开的内容、评论、点赞、转发都能扒下来。 最骚的是它不用搞JS逆向那套,靠浏览器登录态直接拿签名,…

X AI KOLs Timeline · 2026-06-23 缓存

MediaCrawler是一个多平台自媒体数据采集工具,支持小红书、抖音、快手、B站、微博、贴吧、知乎的公开内容抓取,利用浏览器登录态绕过JS逆向,降低技术门槛。

0 人收藏 0 人点赞
#web-scraping

Show HN:Selector Forge —— 浏览器扩展,利用AI生成弹性的选择器

Hacker News Top · 2026-06-22 缓存

Selector Forge 是一款浏览器扩展,利用AI生成并验证可靠的CSS/XPath选择器,用于网页自动化,帮助开发者构建稳健的选择器,适用于测试、数据抓取和页面自动化。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈