阻止AI训练爬虫的网站大多忽略实时回答机器人

Hacker News Top 新闻

摘要

对排名前10000的网站的robots.txt文件研究发现,大多数网站阻止了像GPTBot这样的AI训练爬虫,却很大程度上忽略了像OAI-SearchBot这样的实时回答机器人,突显了当前网络在AI治理方面的盲点。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/07/07 17:13

# 你的 robots.txt 是一座 2023 年的战争纪念碑 来源:https://sitedex.dev/insights/robots-txt-2023-war-memorial 7 月 1 日,Cloudflare 宣布了一种方法,让网站所有者可以在 AI 公司的机器人抓取页面以回答用户问题的瞬间开始收费——不是几个月后用于训练模型,而是在此刻实时回答。这很早期,也很实验性,而且并非孤例:像 x402 这样的开放支付轨道也在为同样的想法而构建。网络长期以来有一种方式可以阻止那次抓取。它正在开始构建一种方式来为此收费。回答正在变成一笔交易。 这很奇怪,因为为这个瞬间建造收费站,而网络的 AI 规则手册几乎不承认这个瞬间的存在。 我们想用数据而非感觉来验证这一点,所以我们做了一件乏味的事。我们获取了前 10,000 个网站的 `robots.txt`,并阅读了每个网站*声明*的内容——而不是其服务器实际提供的内容,也不是其边缘悄悄阻止的内容,因为从外部没人能看到那些。只是每个网站发布在自己前门的规则手册。有 5,577 个网站有我们可以读取的文件。这是对那个规则手册关于回答时代所说内容的研究。简短版本:它是为另一场战争而写的。 ## 规则是一座战争纪念碑 首先注意到的是日期。当你将这些文件中的 AI 规则与它们首次编写的时间排列在一起时,它们并没有分散在 AI 时代中。它们堆积在 AI 时代的开端。在 861 个我们可以确定日期的 GPTBot 规则中,**38% 是在一个季度内编写的——2023 年的最后三个月**(323 个网站,是次高季度的三倍)。其中一半是在爬虫推出后大约六个月内编写的(861 个中的 430 个)。 那个季度并非巧合。OpenAI 在 2023 年 8 月推出了 GPTBot;纽约时报在八周后起诉了 OpenAI。如果你在那个秋天运营一个网站,你受到了真正的震惊,并理性地做出反应,将四行代码粘贴到一个文本文件中以阻止训练爬虫。这在 2023 年是合理的做法。今天可能仍然是正确的选择。 你会期望这么旧的文件大多已经过时。但事实并非如此。在恐慌窗口内编写 GPTBot 规则的 430 个网站中,87% 后来回来添加了新的机器人规则;只有 57 个从未返回。有人一直在打开这些文件。 但看看他们添加了什么,这种勤奋就变味了。新增的规则几乎全都是更多的训练爬虫——ClaudeBot 现在出现在 671 个这些网站上,PerplexityBot 出现在 540 个,到 2026 年还在增加——而回答时机器人,那些抓取页面以写出实时答案的机器人,只吸引了其中一小部分注意力。自 GPTBot 以来,没有什么能以恐慌速度移动:每一个后续的爬虫在其前两个季度内只记录了 3% 到 23% 的规则,相对于 2023 年的洪流来说是一滴缓慢的水滴。恐慌是一次性事件。之后的一切都是肌肉记忆。 所以这个文件是一座战争纪念碑——但不是被遗弃的那种。是人们不断回来打理的那种,而他们在上面刻下的每个名字都是同一场战争中的又一个训练爬虫。那不是疏忽大意。那是一个盲点,而通过更努力地打理文件是修复不了盲点的。 当 AI 规则首次编写时,按季度区分训练爬虫(GPTBot)和回答时机器人(每个网站的第一条规则:OAI-SearchBot, Claude-User, Claude-SearchBot, Perplexity-User)第一次观察到该机器人规则的季度·所有 1,197 个屏蔽者0 100 200 300 网站数323 —— 恐慌季度812023202420252026每个网站只计一次,在其规则首次出现的季度。在所有 1,197 个屏蔽者中,861 个曾经编写过一条可确定日期的 GPTBot 规则,而只有大约一半(406 个)曾经编写过一条回答时规则——那条低带从未上升到 2023 年的峰值水平。通过首次出现从互联网档案馆确定日期。详见方法。 ## 每个 AI 公司运行两个机器人。大多数规则只知道其中一个。 这是 2023 年规则手册遗漏的部分。 每个主要的 AI 供应商并不是向你的网站发送一个机器人。它发送两个,并且它们做不同的工作。一个是*训练爬虫*——它批量读取网络以构建模型。另一个是*回答时获取器*——它稍后出现,当一个真实用户提出了一个真实问题时,将你的页面拉入正在他们面前生成的答案中。第一个是 2023 年每个人都在愤怒的那个。第二个是现在重要的那个,因为它是任何按回答付费的收费站会计量的。 每个 AI 供应商运行两个机器人;大多数规则只命名训练爬虫。训练爬虫读取网络以构建模型回答时获取器在有人提问时到达GPTBotOpenAIOAI-SearchBot + ChatGPT-UserOpenAIClaudeBotAnthropicClaude-User + Claude-SearchBotAnthropicPerplexityBotPerplexityPerplexity-UserPerplexity这种分裂。阻止左侧的训练爬虫对右侧的回答时获取器毫无声明。所以我们问了,对于每个完全屏蔽某个供应商训练爬虫的网站:它是否对该供应商的回答时机器人说了任何话?大多数情况下,没有。 在完全屏蔽每个训练爬虫的网站中(可读取的 robots.txt,前 10,000 名)供应商他们屏蔽的训练爬虫有疑问的回答时机器人完全没有提及该回答时机器人明确允许它AnthropicClaudeBotClaude-User, Claude-SearchBot71% (598 / 840)1.9% (16 / 840)OpenAIGPTBotOAI-SearchBot, ChatGPT-User53% (493 / 932)4.0% (37 / 932)PerplexityPerplexityBotPerplexity-User50% (229 / 461)0.9% (4 / 461)把右边两列一起看,因为它们之间的差距就是发现。十个屏蔽了 Anthropic 训练爬虫的网站中,有七个对使用 Claude 回答的机器人没有任何规则。而有意做了有趣事情——屏蔽训练,保留回答——这个唯一对想要推荐流量而不想喂养模型的发布者有意义的姿态——的数量极小。对于 Anthropic 不到 2%。对于 OpenAI 是 4%。每个人理论上讨论的“不训练,有答案”的立场在现实中几乎不存在。 在将此沉默解读为意图之前有一个注意:它是盲点的上界,而不是测量值。从外部看,一个从未遇到过 OAI-SearchBot 的网站,和一个遇到过它却无所谓且没有理由写一条多余的 `Allow` 的网站看起来一样——没有人会为它们乐意放行的机器人写规则。我们能看到的是当有人采取行动时的意图,这就是表格的最后一列:那百分之几屏蔽训练爬虫并有意放行回答时机器人的网站。Forbes 是一个例子——GPTBot 被禁止,OpenAI 的搜索获取器被明确允许。这种立场是真实的。只是很少见。 这个差距在一个显然尝试过的文件中更容易看到。The Economist,在我们 2026-07-03 扫描并 2026-07-04 重新检查时,其 robots.txt 按名称拒绝了两个 OpenAI 机器人——GPTBot 和 ChatGPT-User 都得到了直接的 `Disallow: /`。第三个,OAI-SearchBot,那个将页面拉入实时搜索答案的获取器,根本没有出现在文件中。The Economist 显然在这里花了心思;它有意命名了机器人并做出了一个合理的决定。OpenAI 只是运行了比它所管治的两个更多的机器人,而它所遗漏的那个是搜索获取器。你可以用大约十秒钟通过同样的方式检查任何网站:打开它的 robots.txt 并寻找回答时机器人的名字。 ## 被管治者不允许阅读的规则手册 还有一个更安静的失败。在 7,627 个至少响应了我们的网站中,有 883 个,一个诚实标识的机器人请求 `/robots.txt` 得到了挑战或拒绝——那个唯一职责是陈述规则的规则手册,被反面递给了来访者。GoDaddy 是其中之一。我们无法区分故意的反 AI 立场与安全供应商挑战每个数据中心 IP(包括我们的)的行为,我们也不假装能区分。但一个被管治者不能阅读的规则手册本身就是一种回答。 ## 与此同时,144 个网站已经做出了决定 很容易将所有这一切理解为“网络正在关闭”。不是这样的,同样的 5,577 个文件证明了这一点。其中只有 351 个禁止了所有回答时机器人;在前 10,000 个可读网站中,回答的大门在绝大多数情况下是敞开的。而且有 144 个网站比默认开放更进一步——它们写了明确的 `Allow` 行,命名了一个回答时机器人,并有意邀请它进入。 598 个网站屏蔽了 Anthropic 的训练爬虫,却对回答的机器人只字未提 在 840 个 ClaudeBot 屏蔽者中 144 个网站写了明确规则邀请回答时机器人进入 在 5,577 个可读的 robots.txt 文件中 沉默与选择。左边的数字是真空的大小——从未涉及回答机器人的网站。右边的数字是,在整个可读样本中,有多少网站做出了记录在案的决定来允许它。这两个数字中,一个是姿态。144 对 5,577 并不是一场运动。但这证明了主动加入的经济不是假设性的,也没有在等待任何人。一些网站已经将回答时获取视为需要争取而非容忍的东西,而这个列表如此之短意味着还没有人错过它。 ## 勤奋不是决策 把发现放在一起,轮廓就很清楚了。这些文件被维护着——多年以勤奋的方式——而几乎所有这些维护都在重新打同一场战争。对于网络现在正在学习收费的那个瞬间——回答时获取——的姿态,是维护从未去写的那一行。不是被拒绝。只是从未被触及。 关于此有三大合理的做法,而本文并不特别支持其中任何一个。你可以**封闭**:同时屏蔽训练爬虫和回答时获取器,并接受你不会出现在答案中。你可以**销售**:在按回答付费的收费站到来之前将获取器拒之门外,然后收费放行。或者你可以**开放**:让回答时机器人进来,因为出现在答案中对你的价值超过页面浏览量。这三个都是合理的。不是一个姿态的是第四种,大多数网站实际上正在做的那一种——多年打理文件却从未决定当答案到来时会发生什么。无论你选择什么,都要有目的地选择它。文件已经打开;缺少的是决定。 ## 开门是最容易的一半 假设你做出了文件从未做出的决定,并有目的地打开回答时获取的大门。背后还有一个更难的问题——所有的维护从未想到去问的那个问题。 那 144 个网站做出了真正的决定并打开了门。但这些文件都不能显示的是是否有人检查了下一件事——整个收费站所基于的那件事:当回答时机器人获取页面时,*页面能否回答这个问题?* 开门与房间值得进入不是一回事。无论你是销售软件还是发布文章,失败看起来都一样:一个 AI 到达你的定价页面却找不到价格,或者阅读你的报道却无法判断你得出了什么结论,它不会向你收费然后继续。它还是会回答买家——从别处,或者从猜测中。 而这从来不是资源问题。勤奋在排名列表中几乎没有变化;眼界却如此。对回答时类别的规则在顶层千位屏蔽者中出现在 64% 的网站上,而到第 10,000 位时降至 41%——那些全职打理此事的团队有三分之一的时间错过了新类别,而在前 10,000 名以下,我们的数据截止处,斜率只会向下。大多数小团队根本没有人打理文件,即使有也不会拯救他们:那些确实打理的人仍然错过了重要的东西。训练战争是可见的一半。你的页面能否回答买家的 AI 实际提出的问题是没有任何文件能揭示的一半——在任何规模上——而这一半决定了出现在答案中是否曾有任何价值。你不能靠更多维护到达那里;你通过查看、一页一个问题地,从你自己的页面开始达到那里。 找出哪些买家问题你的页面无法回答 → (https://sitedex.dev/payment-ready) --- ## 方法 这是什么以及不是什么。我们在 2026-07-03 获取了 Tranco 前 10,000 个域名的 `/robots.txt`,并对每个网站*声明*的针对 15 个 AI 机器人的策略进行了分类。这只是对声明策略的研究。我们没有抓取任何网站的页面,我们看不到边缘或 WAF 执行情况,我们也从不声称某个网站“屏蔽了 AI”——只说了其发布的文件说了什么和没说什么。下面的每个数字都标明了其分母。 - **样本**。10,000 个域名。7,627 个返回了 HTTP 响应;5,577 个有可读取的 robots.txt(每个策略比率的分母);1,197 个完全屏蔽了至少一个主要 AI 爬虫。Tranco 框架偏向于大型商业网站。 - **两个机器人的沉默数字**。在向训练爬虫发出明确完全屏蔽的网站中,其 robots.txt 对于该供应商的回答时机器人完全没有节(stanza)的比例:Anthropic 598/840 (71%),OpenAI 493/932 (53%),Perplexity 229/461 (50%)。“明确允许” = 至少有一个回答时同类机器人有明确 `Allow`:OpenAI 37/932 (4.0%),Anthropic 16/840 (1.9%),Perplexity 4/461 (0.9%)。沉默率是盲点的上界——缺失的节与有意保留默认值无法区分,而且很少有网站写多余的 `Allow`。 - **主动加入**。144 / 5,577 个网站对 OAI-SearchBot、ChatGPT-User、Claude-User、Claude-SearchBot 或 Perplexity-User 中的至少一个带有明确的 `Allow`,按网站去重。 - **规则何时编写**。首次观察日期来自互联网档案馆对每个屏蔽者 robots.txt 的快照,采用所有 1,197 个完全屏蔽者的实际快照时间戳。这些是年龄的上界(令牌首次被归档的时间),并且档案馆偏爱热门网站。其快照节奏也可能随着网站新闻关注度而上升,因此 2023Q4 的集群可能部分反映了该季度更密集的归档,而不仅仅是更密集的编辑。323 / 861 个可确定日期的 GPTBot 规则(38%)首次出现在 2023Q4——是次高季度的三倍——其中一半(430 / 861)在爬虫推出后大约六个月内。同一单位的回答时序列每个网站只计一次,在其第一个回答时规则:406 / 1,197 个屏蔽者曾经写过一条,大约是写过 GPTBot 规则的网站的一半,在 2024 年末开始每个季度 50-80 条的低平台上,从未接近 2023 年的峰值。 - **维护中,非被遗弃**。在 430 个恐慌时期的 GPTBot 屏蔽者(GPTBot 规则首次在 2023Q3-2024Q1 看到)中,87% 后来至少添加了一条新的追踪机器人规则;只有 57 个未添加。这是一个下界——我们只在它添加了 15 个追踪机器人之中的一个时才记录为返回。新增的规则偏向于训练爬虫(ClaudeBot 671 个网站,PerplexityBot 540 个,Applebot-Extended 476 个,meta-externalagent 493 个)多于回答时机器人(167-354 个)。返回率在排名中几乎不变(顶层千位 91%,5k-10k 86%);任何回答时节的存在随着排名下降(顶层千位屏蔽者 64%,79/124,降至 5k-10k 的 41%,263/640)。样本下限是前 10,000 名;真正的长尾未被测量。 - **不可读的规则手册**。在 7,627 个响应的网站中,有 883 个对从数据中心 IP 请求 robots.txt 的诚实标识客户端返回了挑战或拒绝,经过 www 回退和一次礼貌重试。我们无法区分反机器人策略与全面的数据中心挑战,因此这些网站被排除在所有比率分母之外——这可能使我们的屏蔽率被低估,因为最严格的网站正是我们无法读取的那些。 - **例外路径**。在 8,599 个完全屏蔽判定中,有 926 个(10.8%)将 `Disallow: /` 与路径级别的 `Allow` 配对。我们将其算作屏蔽(默认拒绝姿态)。86 个网站运行精心策划的 GPTBot 例外路径。 - **回答时可达性**。在 5,577 个可读文件中,只有 351 个有效地禁止了所有回答时机器人(

相似文章

TIME向AI机器人提供不同版本的网站,内置广告

Hacker News Top

TIME正在向AI爬虫提供一个精简的Markdown版本网站,其中包含嵌入的赞助内容和广告追踪,而人类用户则看到完整的HTML页面,这揭示了一个针对AI机器人的隐藏广告市场。