每个 AI 智能体抓取网站的方式截然不同。以下是 3 个月、1100 万事件日志显示的真实情况。

Reddit r/AI_Agents 新闻

摘要

对 34 个网站上 1100 万爬虫日志的分析揭示了不同行为:GPTBot 无视 robots.txt 持续抓取;Google 的爬虫频繁检查规则;ClaudeBot 的抓取速度正在快速提升;Bytespider 是最重的爬虫。这些发现表明,SEO 正从以 Google 为中心转向针对 AI 智能体的页面选择进行优化。

每个 AI 智能体访问你的网站时表现都完全不同。以下是我们追踪 34 个网站 1100 万真实爬虫日志 3 个月后的发现。 * **GPTBot:** 它日夜不停地持续抓取,几乎不检查规则。在 23 个网站的 28 万次抓取中,它仅调用了 robots.txt 9 次。它只管取用。 * **Google 的爬虫:** 与 GPTBot 相反。它重新获取了 robots.txt 8765 次,反复检查规则。25 年的爬取经验教会了它礼貌,而新型 AI 爬虫从未学会。 * **ClaudeBot:** 在我们跟踪的网站中,它的抓取量从 4 月的 7300 次 → 5 月的 64000 次 → 6 月前 10 天的 168000 次。它正急于读取尽可能多的网络内容,而这场竞赛就是全部重点(详见下文)。 * **实时机器人:** 当有人向 AI 询问你的业务时,它会跳过整个网站,直接抓取能回答问题的单个页面。在 Claude 的实时机器人上,75% 的访问只涉及一个页面。它忽略了你发布的其他所有内容。AI 选中代表你的那个页面,现在就是全部关键。 * **Bytespider:** 本季度我们记录到的最重爬虫来自字节跳动(TikTok 的母公司)。在一个网站上,它进行了 120 万次访问,超过了 Google 和所有 OpenAI 爬虫的总和。即使是熟悉的名字现在也被重新利用了。 * **微软的 Bing:** 仍然像往常的搜索引擎那样爬取,但其索引的所有内容现在也都用于驱动 Copilot。 * **MetaBot:** 几乎从不检查 robots.txt,但却是极少数会读取 llms.txt 文件的爬虫之一。 这些公司中的每一家都在构建自己的网络副本:自己的爬虫、自己的索引、自己的答案。Anthropic 并非为了好玩而如此大力抓取。它们都希望成为人们提问的地方,这意味着它们都希望不再依赖 Google。我的预测:从今往后,Google 的排名每个季度都会变得不那么重要一点。当这么多 AI 以自己的方式阅读你的网站来构建自己的索引时,“在 Google 排名第一”就不再是优化的目标了,成为每个 AI 选中的那个页面才是。
查看原文

相似文章

阻止AI训练爬虫的网站大多忽略实时回答机器人

Hacker News Top

对排名前10000的网站的robots.txt文件研究发现,大多数网站阻止了像GPTBot这样的AI训练爬虫,却很大程度上忽略了像OAI-SearchBot这样的实时回答机器人,突显了当前网络在AI治理方面的盲点。