web-crawler

标签

Cards List
#web-crawler

我把整个互联网给了openclaw和codex,它表现得从未如此出色

Reddit r/openclaw · 2026-07-24

OpenClaw搭配Cockroach Crawler将一个AI代理转变为一个强大的网络研究机器,能够爬取JavaScript密集型页面、提取结构化数据、生成PDF和截屏,且无需为许多公共来源设置单独的API密钥。

0 人收藏 0 人点赞
#web-crawler

@heynavtoor: 一个获得六万星级的网络爬虫在几天内建成。由一个开发者完成。因为一个“16美元的开源”工具让他愤怒。六万多……

X AI KOLs Timeline · 2026-07-15 缓存

Unclecode 创建了 Crawl4AI,一款免费开源网络爬虫,能将网页转换为干净的 Markdown 格式供 AI 模型使用,起因是对付费替代方案感到不满;该项目已获得 60,000 个 GitHub Star,月下载量超过一百万。

0 人收藏 0 人点赞
#web-crawler

@CryptoTied: 卧槽!一个专为 LLM 优化的开源爬虫火了 Crawl4AI 是一个开源的 LLM-friendly Web Crawler & Scraper,目前 GitHub 上已有 72k+ stars。 它把网页内容转换成干净、结构化的 Mar…

X AI KOLs Timeline · 2026-07-10 缓存

Crawl4AI 是一个专为 LLM 优化的开源爬虫,可将网页内容转换为干净的结构化 Markdown,支持智能内容过滤、LLM 驱动提取、浏览器自动化等功能,适合 RAG 和 AI Agent 场景。

0 人收藏 0 人点赞
#web-crawler

@hyperbrowser: 编码代理在接触网站前,仅仅为了弄清其结构就浪费大量令牌。一次映射即可…

X AI KOLs Following · 2026-07-06 缓存

Agentmap 是一个开源工具,可爬取任何网站并将其转换为页面、流程和数据的结构化地图,使编码代理(如 Claude Code、Cursor)跳过盲目探索,直接执行任务,节省令牌。

0 人收藏 0 人点赞
#web-crawler

@yhslgg: 为什么14个爬虫工具我只标了这个"最特别"?老杨现在说清楚 兄弟们,这个爬虫逻辑完全不一样的工具——ScrapeGraphAI,GitHub 27900 星。 一句话:你说"帮我把这个页面上的所有产品名和价格抓出来",LLM 自动生成抓取…

X AI KOLs Timeline · 2026-07-01 缓存

介绍ScrapeGraphAI,一个基于LLM的爬虫工具,能用自然语言描述需求并自动生成抓取流程,无需编写选择器或关心HTML结构,支持本地模型和多种集成平台。

0 人收藏 0 人点赞
#web-crawler

我的客户不想手动添加常见问题,所以我构建了一个系统,自动爬取他们的网站并生成知识库

Reddit r/artificial · 2026-06-14

描述了构建一个网络爬虫,从酒店网站提取内容,使用AI智能体生成结构化的常见问题,并将其存储在向量数据库中,实现知识库的自动创建。

0 人收藏 0 人点赞
#web-crawler

Amazonbot终于开始遵守robots.txt规则

Hacker News Top · 2026-05-14 缓存

Amazonbot,亚马逊的网络爬虫机器人,现已遵守robots.txt指令,这标志着其先前行为的改变。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈