互联网的自我退化

Reddit r/artificial 新闻

摘要

本文描述了信誉良好的网站屏蔽AI爬虫如何迫使AI模型依赖低质量的AI生成内容,导致事后引用和基础设施级别的确认偏误等问题,并提供了更好验证来源的建议。

互联网正在自我退化。最近,当我向AI询问来源时,我几乎认不出其中任何一个。不是那种“哦,一个我之前没见过的小众博客”式的陌生感——更像是那些似乎专门为被AI引用而存在的网站。所以我调查了原因。结果发现,大多数信誉良好、高质量的网站现在完全屏蔽了AI爬虫。这意味着如果好的来源被排除在外,这些模型还能从哪里获取信息?主要是其他AI生成页面的AI重写。专门为被聊天机器人引用而建立的内容农场。越来越多品牌发布自己的“研究”,其真正目的是营销而非信息。还有一种叫做事后引用的模式,模型先得出一个答案,然后再寻找恰好支持它的来源。老实说,这和我们很多人在学生时代写论文的方式没什么区别。机器确实从最好的那里学到了。但当学生这样做时,可能只有一位老师注意到并感到烦恼。当它成为十亿人的默认研究工具时,同样的习惯就变成了基础设施级别的确认偏误。那么,实际该怎么做呢?要求AI也拉取与其自身答案相矛盾的来源。自己打开引用链接。如果一个网站从一个人那里来不值得你信任,那么从一个模型来也不应该信任。将数字追溯到其原始来源,而不仅仅是最后重复它的人。大多数被引用的“来源”都与原始来源相距甚远。我们被灌输了“基于互联网训练”的理念。但我们实际得到的看起来更像是“基于互联网的营销部门训练”。
查看原文

相似文章

AI正在吞噬互联网

Reddit r/ArtificialInteligence

AI导致在线内容为机器优化,引发数据抓取和原始网站流量下降,用合成替代品取代人类内容。

人工智能是否正在降低互联网的实用性?

Reddit r/artificial

本文探讨了随着人工智能生成内容在互联网上的泛滥,是否可能导致人工创作的信息质量下降,并因人工智能训练数据源自人工智能生成内容而形成反馈循环,从而阻碍未来人工智能的学习。

真实性问题

Reddit r/artificial

文章表达了对AI生成内容污染互联网的长期影响的担忧,这使得验证真实性和与现实依据变得困难,并对未来AI治理的系统造成严重后果。

AI 垃圾内容正在扼杀在线社区

Hacker News Top

文章认为,在 GitHub 和博客等平台上泛滥的低质量 AI 生成内容(即“AI 垃圾内容”)正在降低在线技术社区的价值。