web-scraping

标签

Cards List
#web-scraping

@tom_doerr: 将网站转换为干净的 Markdown 和 JSON,供 AI 代理和 RAG 管道使用。https://github.com/0xMassi/webclaw

X AI KOLs Timeline · 昨天 缓存

webclaw 是一款开源工具,可将网站转换为干净的 Markdown、JSON 和 LLM 就绪上下文,提供 CLI、MCP 服务器、REST API 和 SDK,适用于 AI 代理和 RAG 管道。

0 人收藏 0 人点赞
#web-scraping

@binghe: 大名鼎鼎的firecrawl 不用 API Key ,可以直接调用了! 我知道的有点晚。。 还在自己开发爬虫。。。这事整的。。。 如果你早知道,就跳过,如果你也刚知道。。。那赶快给你的智能体配上吧。。真是爽爆了,神仙项目 。 https:…

X AI KOLs Timeline · 2天前 缓存

Firecrawl 这个知名的网页抓取工具现在无需 API Key 即可直接调用,对 AI 智能体非常实用,而且是开源项目。

0 人收藏 0 人点赞
#web-scraping

@CycleDecoded: 搞 AI Agent 和自动化爬虫的兄弟们直接看,这玩意简直是“把全网网站给 LLM 当饭吃”的神器。 以前想给 AI Feeding 动态网页或者抓数据,要折腾 Puppeteer、搞动态代理、解 JavaScript,还得调 API …

X AI KOLs Timeline · 2026-08-04 缓存

介绍开源项目 Firecrawl:一个能将任意网址转换为干净 Markdown/JSON、支持 AI 交互和整站爬取的网页数据 API,专为 LLM 和 Agent 设计,已获 2.5w+ GitHub Star。

0 人收藏 0 人点赞
#web-scraping

@CycleDecoded: 一个叫 WebRover 的开源 AI Agent,你给它一句话,它自己打开浏览器、识别网页元素、点击、翻页、抓数据、搞定任务,最后把你要的结果整理得明明白白。 开源协议:MIT License 定位:自主式 Web 自动化 AI 智能体…

X AI KOLs Timeline · 2026-08-04 缓存

WebRover 是一个基于 MIT 协议的开源 AI Agent,通过自然语言即可驱动浏览器完成网页自动化、跨站数据抓取与深度研究,支持本地部署。

0 人收藏 0 人点赞
#web-scraping

基于 Rust 的 SearXNG

Hacker News Top · 2026-08-03 缓存

一个使用 Rust 编写的 SearXNG 风格元搜索引擎,可同时向多个搜索引擎发起查询,对结果去重,并通过 Reciprocal Rank Fusion 进行排序。

0 人收藏 0 人点赞
#web-scraping

@tom_doerr: Converts web URLs, PDFs, and media files into clean Markdown, automatically stripping ads and navigation while supporti…

X AI KOLs Timeline · 2026-08-03 缓存

PullMD is a self-hosted URL-to-Markdown service for humans and AI agents, converting web pages, PDFs, and media files into clean Markdown, with support for an MCP server and Claude Code skill.

0 人收藏 0 人点赞
#web-scraping

Reddit 继续推进围绕 Google 搜索结果的奇怪 DMCA 诉讼

Ars Technica · 2026-07-31 缓存

Reddit 针对 SerpApi 和 Perplexity AI 就 Google 搜索结果抓取提起的 DMCA 诉讼仍在继续,尽管驳回了部分索赔,法官仍允许证据开示。该案件凸显了 AI 抓取与版权法之间持续存在的紧张关系。

0 人收藏 0 人点赞
#web-scraping

Website to Markdown API

Product Hunt · 2026-07-31

Website to Markdown API 是一款开发者工具,可将任意网站转换为整洁、可直接用于 LLM 的 Markdown,从而轻松将网页内容输入 AI 模型。

0 人收藏 0 人点赞
#web-scraping

50秒扫描5个DTC品牌,没有一个准备好迎接AI购物代理。

Reddit r/artificial · 2026-07-29

一款静态分析扫描器测试了五个DTC品牌,发现尽管结构化数据良好,但其自定义JavaScript(例如使用<div>而非<select>的尺码选择器)使得AI购物代理无法访问,可能导致每月因AI推荐流量损失8.2万至49.1万美元的收入。

0 人收藏 0 人点赞
#web-scraping

“Google and Reddit do not own the Internet,”网络爬虫公司胜诉后表示

Ars Technica · 2026-07-27 缓存

Google和Reddit在一起法庭案件中败诉,他们曾利用DMCA起诉网络爬虫公司SerpApi;法官驳回了诉讼,裁定Google在DMCA下不具备诉讼资格,因为Google不拥有搜索结果中的版权内容。

0 人收藏 0 人点赞
#web-scraping

@shengkun_ye: 我们刚刚干掉了Apify。你的AI代理现在可以读取所有社交平台。无需登录。无需订阅。X、Reddit、Link…

X AI KOLs Timeline · 2026-07-20 缓存

Monid是一个新的API,让AI代理无需登录或订阅即可读取社交平台,每次请求仅需0.0015美元,是比Apify更便宜的选择。

0 人收藏 0 人点赞
#web-scraping

@Pluvio9yte: Claude Code 读不了微信公众号文章,我花了十分钟解决,做成了一个开源 skill。 昨天让 Claude Code 帮我查看一篇公众号文章的稿,把链接丢进去,WebFetch 直接返回「环境异常,请完成验证」。换 Jina Re…

X AI KOLs Timeline · 2026-07-15 缓存

作者解决了Claude Code无法读取微信公众号文章的问题,通过伪造User-Agent和Referer绕过微信验证,并用Python标准库提取标题、作者和正文。他将此功能封装成开源skill(rn-wechat-extract),支持一行命令提取全文,可用于Agent工作流。

0 人收藏 0 人点赞
#web-scraping

依靠网络爬取构建帝国的科技巨头,如今却将模型蒸馏称为“生存威胁”,这极具讽刺意味

Reddit r/LocalLLaMA · 2026-07-14

一篇评论文章,强调了科技巨头抱怨模型蒸馏是生存威胁的讽刺之处,因为他们的帝国正是建立在网络爬取之上的。

0 人收藏 0 人点赞
#web-scraping

@XAMTO_AI: Agent 上网找资料这事,终于有人把脏活累活全包了,OpenClaw、Hermes Agent、CodeX 全都能用上。 之前有多离谱?推特 API 收费、网页抓取要订阅、B站小红书各种拦截,让 Claude Code 搜个资料跟打副本…

X AI KOLs Timeline · 2026-07-14 缓存

Agent-Reach 是一个开源工具,通过一条命令为 AI Agent 打通 14 个网络平台(如推特、B站、YouTube等),解决了网页抓取和 API 付费等痛点,让 Agent 能直接获取网上资料。

0 人收藏 0 人点赞
#web-scraping

Anubis到底阻止了谁?

Lobsters Hottest · 2026-07-12 缓存

本文批评了Anubis——一个旨在阻止AI爬虫的HTTP工作量证明代理——指出它很容易被AI绕过,同时给人类用户带来了倒退性的负担,尤其是那些使用弱设备或非JavaScript浏览器的用户。

0 人收藏 0 人点赞
#web-scraping

爬虫情况更新

Hacker News Top · 2026-07-10 缓存

关于AI爬虫机器人日益严重的问题的最新更新,这些机器人导致网站不堪重负,并探讨了住宅代理网络及其对开放网络的影响。

0 人收藏 0 人点赞
#web-scraping

一种让你的DHCP服务器耗尽动态IP的不寻常方式

Hacker News Top · 2026-07-10 缓存

克里斯·西本曼解释了他的反爬虫措施,由于针对LLM训练的高频爬虫激增,他阻止旧版浏览器,这给Feed阅读器和存档服务带来了混乱。

0 人收藏 0 人点赞
#web-scraping

Fudge MCP

Product Hunt · 2026-07-10

Fudge MCP 是一款工具,通过从现有网站学习,赋予 AI 代理设计品味。

0 人收藏 0 人点赞
#web-scraping

@IndieDevHailey: Crawl4AI:7万星开源神器,把网页秒变LLM能吃的干净Markdown! 再见付费爬虫!零API Key,几秒出结构化数据,专为RAG、Agent、数据管道而生。 超干净输出:智能去噪、表格/代码/引用全保留,LLM直接喂 真快:异…

X AI KOLs Timeline · 2026-07-10 缓存

Crawl4AI 是一个开源的网页爬虫工具,能将网页内容转换为干净的 Markdown 格式,专为 LLM 的 RAG、Agent 和数据管道设计。零 API Key,快速输出结构化数据。

0 人收藏 0 人点赞
#web-scraping

Launch HN: Context.dev (YC S26) – 从任意网站获取结构化数据的API

Hacker News Top · 2026-07-09 缓存

Context.dev 是一个获得 YC 支持的 API,允许开发者和 AI 代理从任意网站抓取、爬取和提取结构化数据,支持 Markdown、HTML、站点地图、截图和品牌智能等功能,旨在简化网络数据集成。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈