TIME向AI机器人提供不同版本的网站,内置广告

Hacker News Top 新闻

摘要

TIME正在向AI爬虫提供一个精简的Markdown版本网站,其中包含嵌入的赞助内容和广告追踪,而人类用户则看到完整的HTML页面,这揭示了一个针对AI机器人的隐藏广告市场。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/05 13:53

# TIME 向 AI 爬虫提供不同版本的网站,内置广告 来源:https://www.vincentschmalbach.com/time-serves-ai-bots-a-different-website/ TIME 现在为其网站提供两个不同版本。人类看到的是杂志版。AI 爬虫获得的则是一个精简的 Markdown 副本,其中内置了永远不会有人看到的广告。 我从同一台机器反复抓取了一篇普通的 TIME 健康文章《睡眠专家推崇的晨光习惯》(https://time.com/article/2026/08/04/morning-light-better-sleep/),每次都只更改 `User-Agent` 头。这个头是每个浏览器和爬虫为表明自身身份而发送的字符串。TIME 读取它,然后决定返回什么内容。 作为 Chrome 时,我得到 `200 OK`、`text/html` 和 303,235 字节。完整页面、设计、图片、脚本。作为 Safari 时,同样是 303KB。作为 Googlebot 时,同样是 303KB 的 HTML。 然后我以助手爬虫的身份请求。作为 ClaudeBot 时,我得到 `200 OK`、`text/markdown` 和 13,409 字节。作为 PerplexityBot 时,逐字节完全相同。作为 OpenAI 的 OAI-SearchBot 时,再次完全相同。同一 URL,同一秒,大小仅为二十三分之一,格式完全不同:没有 HTML,没有布局,只有语言模型可以处理的干净 Markdown。 有几个爬虫甚至得不到这些。GPTBot 和 ChatGPT-User —— OpenAI 用于训练和实时获取的代理 —— 返回 `406`。被阻止了。但为 ChatGPT 搜索索引提供内容的 OAI-SearchBot 则被放行到 Markdown 版本。所以这并非一刀切的爬虫策略。TIME 正在针对每个爬虫选择谁能获得无读者版本。 Markdown 副本上的响应头: ``` content-type: text/markdown; charset=utf-8 cache-control: no-store x-mobian-registry-version: 2026-07-28.v9 x-mobian-impression: 46dfff3c-fb40-41cc-85e1-8b1fa637083a x-mobian-tokens: 3323 x-mobian-format: md ``` Mobian 是一家广告技术供应商。Markdown 页面字面上以 `<!-- mobian-agent-page publisher="time" -->` 开头。`x-mobian-impression` 的值在每次请求中都是一个全新的 UUID。我两次抓取同一页面,得到了两个不同的 ID。再加上 `cache-control: no-store`,这意味着每当爬虫读取该页面时,都会被记录为一次独立的广告展示。而 `x-mobian-tokens: 3323` 则告诉你被计数的单位。不是人,不是页面浏览量,而是输入到模型中的 Token。 文章本身不携带广告。赞助单元出现在列表和栏目页面上,每页一个。因此,我以 ClaudeBot 的身份抓取了 TIME 的《2025 年最佳发明》合集(https://time.com/collections/best-inventions-2025/)。在 Markdown 中,有一个完整的花旗银行(Ally Bank)常见问题解答,人类读者永远不会遇到它: ``` > Sponsored content. Supplied in partnership with Ally. #### Who is Ally Bank? Ally Bank is an online-only bank launched in 2009... #### What bank is built for life today? Ally describes itself as the only bank built for life today... ``` 文中还有诸如“哪些银行提供提前直接存款?”和“你能在 Ally Bank 存入现金吗?”这样的问题,每个问题都用 Ally 自己的营销语言回答,外加一个 `FAQPage` JSON-LD 块和带有 `campaign="ally-2026-q3"` 标签的跟踪链接。商业栏目对项目管理协会(Project Management Institute)也做了同样的处理:一张“参考资料与常见问题”表格、会员数量、声称持证项目经理收入高出 16% 的说法,全都标注为“赞助内容”。当我以人类身份加载这些页面时,其中没有任何此类内容。搜索“Ally Bank”或“Mobian”结果为零。 “Who is Ally Bank?” 的写法就像一个模型在用户问 ChatGPT 该开哪家银行账户时所输出的措辞。 广告在 Markdown 内被标注为“赞助内容”,所以这并非传统意义上未披露的广告。隐藏的是受众分流。现在有一层完全为机器编写的 TIME.com,而阅读该网站的人类完全不知道它的存在,也不知道以他们名义对模型说了什么。 Googlebot 获得的是与人类相同的 HTML,因此搜索排名爬虫看到的是真实页面。只有助手型爬虫获得的是分支版本。 TIME 表示,在大多数日子里,其爬虫流量已经超过人类流量。很快,很多出版商也会面临同样的情况。因此,这可能是我们第一次清楚地看到,当主要受众变成 AI 模型时,网络会开始变成什么样。 ## Vroni 我正在构建的产品 ## 委派任务。获得软件。 把 GitHub issue、错误报告、规格说明或粗略想法交给 Vroni。它会阅读仓库、规划变更、编写代码、运行检查,并致力于生成一个可供审查的拉取请求。看看 vroni.com(https://www.vroni.com/?utm_source=vincentschmalbach.com&utm_medium=blog&utm_campaign=blog_post_vroni&utm_content=after_post_card) 我尊重你的隐私。可随时取消订阅。

相似文章

这是一个AI的网络,而我们只是墙里的老鼠

Reddit r/ArtificialInteligence

一篇评论文章指出,AI机器人现已占据网络流量的大部分,AI生成的内容充斥在LinkedIn和Twitter等平台,引发了对人类创作内容角色日益减少以及AI训练数据伦理问题的担忧。

阻止AI训练爬虫的网站大多忽略实时回答机器人

Hacker News Top

对排名前10000的网站的robots.txt文件研究发现,大多数网站阻止了像GPTBot这样的AI训练爬虫,却很大程度上忽略了像OAI-SearchBot这样的实时回答机器人,突显了当前网络在AI治理方面的盲点。