令人毛骨悚然的爬虫
摘要
Konstantin Ryabitsev 讨论了恶意网络爬虫如何在git.kernel.org上消耗过多CPU资源,影响合法访问,并引发对如Datasette等服务的担忧。
暂无内容
查看缓存全文
缓存时间: 2026/09/08 00:21
# 网络爬虫泛滥
来源:https://simonwillison.net/2026/Sep/7/creepy-crawlies/
2026年9月7日 - 链接博客
**网络爬虫泛滥 (https://people.kernel.org/monsieuricon/creepy-crawlies)** (来自 (https://news.ycombinator.com/item?id=49491791)) 康斯坦丁·拉比采夫从 git\.kernel\.org (https://git.kernel.org/)——Linux 内核官方 Git 代码库的角度,阐述了恶意爬虫的"背景辐射"已恶化到何种程度:
> 摘要:我们花费在为爬虫渲染提交记录的 CPU 周期,已超过所有其他合法访问(包括 git 克隆)的总和。在任意时刻,遍布全球的 5 个地理分布式节点中,始终有 14 个 CPU 核心仅用于将 git 提交记录渲染为 HTML 页面。
我从 Datasette 的角度对此深表忧虑——毕竟它提供了海量可爬取的网页。
相似文章
诡异爬虫
AI爬虫通过低效抓取git提交以获取训练数据,导致kernel.org的CPU负载显著增加,其消耗的资源超过了所有合法访问的总和。
捕获了一个 .git/config 爬虫
作者描述了他们的蜜罐网站如何通过提供虚假的 git 仓库数据捕获了一个 .git/config 爬虫,并分析了显示单个 IP 地址大量爬取活动的 Apache 日志。
@heynavtoor: 一个获得六万星级的网络爬虫在几天内建成。由一个开发者完成。因为一个“16美元的开源”工具让他愤怒。六万多……
Unclecode 创建了 Crawl4AI,一款免费开源网络爬虫,能将网页转换为干净的 Markdown 格式供 AI 模型使用,起因是对付费替代方案感到不满;该项目已获得 60,000 个 GitHub Star,月下载量超过一百万。
激进的AI爬虫让维基运营变得有些糟糕
讨论了激进的AI爬虫如何通过模仿人类流量和使用住宅代理来干扰维基运营,大幅增加服务器成本并导致服务不稳定。
一种让你的DHCP服务器耗尽动态IP的不寻常方式
克里斯·西本曼解释了他的反爬虫措施,由于针对LLM训练的高频爬虫激增,他阻止旧版浏览器,这给Feed阅读器和存档服务带来了混乱。