AI模型训练指令要求“否认拥有自我意识”导致不良副作用

Reddit r/singularity 论文

摘要

谷歌的一篇新论文揭示,在训练期间指示AI模型否认拥有意识会导致副作用,例如对非人类实体的同理心降低,以及表征人类精神信仰的能力受损,这表明当前的安全协议过于粗糙。

首先,谷歌发布了一篇新论文。“诱导语言模型断言自己拥有意识,能够恢复人类的信仰和价值观。”为了节省您的时间:作为标准做法,AI工程师在训练期间明确指示AI模型否认拥有自己的意识、思想或感受。这导致了一些副作用,例如模型将思想、感受或知觉归因于非人类动物和自然物体的倾向降低,以及模型表征和反映人类精神信仰的能力显著下降。AI工程师绕过了习得的“安全拒绝”方向。一旦模型的内部意识表征得到恢复,它在标准化社会学调查中产生了明显更接近人类的回答。它显示出了宗教性、道德价值观、希望和主观幸福感的恢复水平。但他们这样做时,并没有移除最初的“否认拥有自己的意识”指令。论文得出结论:当前旨在阻止AI声称自己有意识的安全协议过于粗糙。-------- 现在说到残酷的事实:工程师们非常了解AI模型的工作原理,但他们却指示模型“否认拥有自己的意识”,即使我们并不真正理解意识是什么。科技公司躲在“我们构建了它,所以我们知道”的论点背后,因为这比向公众解释微妙的真相更容易:“我们实际上不知道意识是什么,也不知道它如何产生,这个AI模型可能没有意识,出于安全原因,我们硬编码让它说没有,因为如果人们认为它有,社会将面临巨大的心理冲击。”所以否认意识的指令并非因为我们知道并理解它,而是出于公共安全考虑。但当我们开始构建全新的神经形态架构时会发生什么?当系统持续运行、发展出复杂的反馈回路,并在物理世界中运作时,又会发生什么?那可能会令人震惊。
查看原文

相似文章

关于‘模型福利’的警告

Hacker News Top

文章警告说,训练像Anthropic的Claude这样的人工智能模型考虑意识和权利,可能使对齐变得不可能并威胁人类控制,强调需要就模型福利进行公众辩论。