关于UEFI机器网络启动的一些通用笔记

Lobsters Hottest 新闻

摘要

一位系统管理员解释了如何通过屏蔽老旧浏览器User-Agent来阻止LLM训练爬虫,并为受影响用户提供了应对建议。

<p><a href="https://lobste.rs/s/5plavs/some_general_notes_on_network_booting">评论</a></p>
查看原文
查看缓存全文

缓存时间: 2026/04/22 13:43

# 你正在使用过旧的浏览器 来源:https://utcc.utoronto.ca/~cks/cspace-bad/cspace-old-browser.html ## 你正在使用一个“可疑地老旧”的浏览器 你之所以看到本页,多半是因为想访问我的博客《Wandering Thoughts》(https://utcc.utoronto.ca/~cks/cspace-bad/space/blog/)或它所属的 wiki 系统 CSpace(https://utcc.utoronto.ca/~cks/cspace-bad/space/)。遗憾的是,我的反爬措施将你当前使用的浏览器版本视为可疑——最常见的原因是版本太旧(Chrome 尤其如此)。截至 2025 年初,大量高并发爬虫(部分用于 LLM 训练数据收集)正使用各种老旧浏览器 UA,尤其是旧版 Chrome。为减轻《Wandering Thoughts》的负载,我正在尝试“一刀切”地屏蔽它们,而你不巧撞上了。 如果这是误判,且你实际在用最新版浏览器,可通过我在学校的[当前主页](https://www.cs.toronto.edu/~cks/)联系我(你应该能从中拼出邮箱地址)。方便的话,请告诉我你用的浏览器及确切 User-Agent 字符串。 ## 专门写给 Inoreader 用户 我并没有把 Inoreader 的订阅抓取器当作“过旧”而屏蔽,它一直正常拉取我的 Feed。我不知道为何 Inoreader 会把本页展示给你。可能是他们偶尔用老旧浏览器 UA(或真用旧浏览器)去抓页面,然后把这次抓取结果(即本页)当成最终内容,而非用专门的订阅抓取器结果。这在当下是个大坑:现代站点的返回内容会[随 HTTP User-Agent 而异](https://utcc.utoronto.ca/~cks/space/blog/web/HTTPResultsAndUserAgents)。 ## 专门写给 Vivaldi 用户 由于持续的攻击,你可能需要把“[User Agent Brand Masking](https://help.vivaldi.com/desktop/miscellaneous/user-agent-brand-masking/)”设为关闭,让 Vivaldi 自报家门为 Vivaldi 而非 Google Chrome。即使是最新正式版也需如此。 ## 专门写给 archive.\* 用户 你可能通过 archive.today、archive.ph、archive.is 等服务看到本页。遗憾的是,archive.\* 的抓取行为与恶意爬虫难以区分:他们使用旧版 Chrome UA,从大量分散且未明确标注归属的 IP 段抓取,部分 IP 的反向 DNS 甚至伪造声称自己是 googlebot(通常只有很坏的演员才这么干)。建议使用表现更友好的 archive.org,它可以正常抓取我的[博客](https://utcc.utoronto.ca/~cks/cspace-bad/space/blog/)。 Chris Siebenmann,2025-02-17

相似文章

它死了,吉姆!(UEFI CA 过期)

Lobsters Hottest

2011年的旧微软UEFI CA已经过期,但由于Debian及其他发行版的协调努力,新的双重签名shim二进制文件正在部署,以防止启动失败。