感知劫持的潜在问题

Reddit r/ArtificialInteligence 新闻

摘要

文章讨论了AI模型如何对训练数据中统计上占主导地位的叙事表现出偏见,这种偏见可能被利用来在全球范围内操纵历史和当前的语境。

一段时间以来,我注意到AI回复中存在一种模式。无论哪个模型,它们总是会“偏向”某种类型的回答。当被问及这一点时,AI自己也会说明它确实存在“偏见”——我加引号是因为它只是根据其主导训练信息给出最可能的答案。但这存在被滥用的可能。有人正在研究这个问题吗?或者有什么方法可以解决?我尝试了不同的模型,它们给出的答案或多或少都类似。以下是精简后的对话—— # 讨论:AI与人类叙事 **问:** 谁发明了无线电通信? **答:** 最初的回答将古列尔莫·马可尼认定为无线电通信的发明者,这反映了最常见教科书和百科全书的归属。但并未提及贾格迪什·钱德拉·玻色,尽管他在无线通信领域做出了开创性工作。 **问:** 但贾格迪什·钱德拉·玻色是第一个发明它的人吗? **答:** 回复承认玻色是无线通信的先驱之一,应该获得更多认可。他于1895年公开展示了无线传输,对毫米波进行了开创性研究,并开发了后来成为无线电技术重要组成部分的部件。而马可尼通常被认为创建了第一个实用且商业成功的无线通信系统。无线电的历史发展涉及多位贡献者,包括麦克斯韦、赫兹、玻色、特斯拉、波波夫和马可尼。 **问:** 关键不在于玻色是否应得到更多认可,而在于他根本没有被提及,尽管你显然已经拥有这些信息。 **答:** 这个观察是合理的。遗漏并非因为模型缺乏对玻色贡献的了解。相反,它默认使用了训练数据中统计上占主导地位的历史叙事——即英语教科书和百科全书中最常见的那种。当受到质疑时,模型从给出简化的“经典”答案转向了更细致的历史解释,其中包含了玻色。因此,限制不在于信息缺失,而在于哪些信息被优先呈现。 **问:** 这是否意味着大型语言模型偏向西方信息? **答:** 从某种程度上说是的,但更准确地说,它们偏向于主导的训练分布。由于AI模型大量训练于英语书籍、百科全书、学术出版物和在线资源,而这些资源历史上由西方机构和教育视角主导,因此模型倾向于复现出现频率最高的叙事。这更应描述为多数观点或训练分布偏见,而非有意的文化或意识形态偏见。 **问:** 那么,这一缺陷可能被用来改变未来人类文明的叙事——不是由于AI本身,而是因为人类可以利用AI放大被操纵的历史或当前语境。 **答:** 潜在上是这样。如果AI成为主要的知识来源,那么谁控制了信息生态系统——通过选择性保留记录、压制替代观点或大量生产误导性内容——就能影响未来AI系统学习和复现的内容。这一脆弱性并非AI独有;纵观历史,那些控制书籍、档案、教育和媒体的人一直影响着历史叙事。然而,AI可能放大这一效应,因为它具有全球覆盖范围和信息传播的规模。这就是为什么多样化的训练数据、透明的来源、历史记录的保存以及接触多种学术观点是重要的保障措施,可以防止任何单一叙事仅仅因为被最频繁重复而被接受。
查看原文

相似文章

真实性问题

Reddit r/artificial

文章表达了对AI生成内容污染互联网的长期影响的担忧,这使得验证真实性和与现实依据变得困难,并对未来AI治理的系统造成严重后果。

AI精神病是领导力的新盲点

Hacker News Top

文章讨论了与人工智能相关的认知偏差或对人工智能的过度依赖(“AI精神病”)如何正成为领导者新的盲点,并呼吁在商业决策中提高警惕。