Amazonbot终于开始遵守robots.txt规则
摘要
Amazonbot,亚马逊的网络爬虫机器人,现已遵守robots.txt指令,这标志着其先前行为的改变。
暂无内容
查看缓存全文
缓存时间: 2026/05/14 21:26
# Amazonbot 终于开始尊重 robots.txt 了
来源:https://xeiaso.net/notes/2026/amazonbot-respecting-robots-txt
由 Anubis(https://github.com/TecharoHQ/anubis)保护
来自 Techaro(https://techaro.lol/)
用 ❤️ 在 🇨🇦 制作
吉祥物设计来自 CELPHASE(https://bsky.app/profile/celphase.bsky.social)
本网站运行的 Anubis 版本为 `v1.25.0-49-g9f479f5`。
相似文章
Patreon 停止请求 AI 机器人不要抓取——并开始阻止它们
Patreon 已与 Cloudflare 合作,主动阻止 AI 机器人抓取创作者内容用于训练,超越了自愿的 robots.txt 方式。此举旨在让创作者更好地控制其作品被 AI 公司使用的方式。
阻止AI训练爬虫的网站大多忽略实时回答机器人
对排名前10000的网站的robots.txt文件研究发现,大多数网站阻止了像GPTBot这样的AI训练爬虫,却很大程度上忽略了像OAI-SearchBot这样的实时回答机器人,突显了当前网络在AI治理方面的盲点。
每个 AI 智能体抓取网站的方式截然不同。以下是 3 个月、1100 万事件日志显示的真实情况。
对 34 个网站上 1100 万爬虫日志的分析揭示了不同行为:GPTBot 无视 robots.txt 持续抓取;Google 的爬虫频繁检查规则;ClaudeBot 的抓取速度正在快速提升;Bytespider 是最重的爬虫。这些发现表明,SEO 正从以 Google 为中心转向针对 AI 智能体的页面选择进行优化。
AI 在数据收集中如何遵循道德准则?
关于 AI 代理在生成爬虫时忽视 robots.txt 等网站规则的伦理挑战,以及 AI 提供商在不妨碍产品可用性的前提下实施护栏的责任的评论。
花了一个下午让我的网站更AI友好。第二天AI流量增长了12倍
一位开发者通过修复robots.txt、添加llms.txt、改进语义HTML等方式优化网站以适应AI爬虫,次日AI流量增长了12倍。