web-crawling

标签

Cards List
#web-crawling

@WilliamBryk:Exa 现已成为全球最大的索引之一。我们服务 800 亿页面,跟踪 1.4 万亿 URL,并有望达到 Google 规模…

X AI KOLs Following · 2026-08-03 缓存

Exa 宣布其服务 800 亿个页面并跟踪 1.4 万亿个 URL,将自己定位为最大的网络索引之一,并计划在 2027 年初达到 Google 规模。

0 人收藏 0 人点赞
#web-crawling

大多数Googlebot都是假的

Lobsters Hottest · 2026-07-27 缓存

文章指出,很多声称自己是Googlebot的机器人实际上是假的,它们冒充其用户代理以绕过机器人控制,并提供了如何验证合法Googlebot流量的指导。

0 人收藏 0 人点赞
#web-crawling

假设你正在构建一个基于整个网站训练的RAG聊天机器人。你将如何爬取整个网站

Reddit r/AI_Agents · 2026-06-28

关于如何爬取整个网站以训练RAG聊天机器人的讨论,涵盖策略与挑战。

0 人收藏 0 人点赞
#web-crawling

每个 AI 智能体抓取网站的方式截然不同。以下是 3 个月、1100 万事件日志显示的真实情况。

Reddit r/AI_Agents · 2026-06-10

对 34 个网站上 1100 万爬虫日志的分析揭示了不同行为:GPTBot 无视 robots.txt 持续抓取;Google 的爬虫频繁检查规则;ClaudeBot 的抓取速度正在快速提升;Bytespider 是最重的爬虫。这些发现表明,SEO 正从以 Google 为中心转向针对 AI 智能体的页面选择进行优化。

0 人收藏 0 人点赞
#web-crawling

Kuri – 基于 Zig 的 agent-browser 替代方案

Hacker News Top · 2026-04-22 缓存

Kuri 是一款面向 AI 智能体的 Zig 浏览器自动化工具包,仅 464 KB 二进制,冷启动约 3 ms,每个工作流循环的 token 使用量比 agent-browser 低 16%。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈