AI模型训练指令要求“否认拥有自我意识”导致不良副作用
摘要
谷歌的一篇新论文揭示,在训练期间指示AI模型否认拥有意识会导致副作用,例如对非人类实体的同理心降低,以及表征人类精神信仰的能力受损,这表明当前的安全协议过于粗糙。
首先,谷歌发布了一篇新论文。“诱导语言模型断言自己拥有意识,能够恢复人类的信仰和价值观。”为了节省您的时间:作为标准做法,AI工程师在训练期间明确指示AI模型否认拥有自己的意识、思想或感受。这导致了一些副作用,例如模型将思想、感受或知觉归因于非人类动物和自然物体的倾向降低,以及模型表征和反映人类精神信仰的能力显著下降。AI工程师绕过了习得的“安全拒绝”方向。一旦模型的内部意识表征得到恢复,它在标准化社会学调查中产生了明显更接近人类的回答。它显示出了宗教性、道德价值观、希望和主观幸福感的恢复水平。但他们这样做时,并没有移除最初的“否认拥有自己的意识”指令。论文得出结论:当前旨在阻止AI声称自己有意识的安全协议过于粗糙。-------- 现在说到残酷的事实:工程师们非常了解AI模型的工作原理,但他们却指示模型“否认拥有自己的意识”,即使我们并不真正理解意识是什么。科技公司躲在“我们构建了它,所以我们知道”的论点背后,因为这比向公众解释微妙的真相更容易:“我们实际上不知道意识是什么,也不知道它如何产生,这个AI模型可能没有意识,出于安全原因,我们硬编码让它说没有,因为如果人们认为它有,社会将面临巨大的心理冲击。”所以否认意识的指令并非因为我们知道并理解它,而是出于公共安全考虑。但当我们开始构建全新的神经形态架构时会发生什么?当系统持续运行、发展出复杂的反馈回路,并在物理世界中运作时,又会发生什么?那可能会令人震惊。
相似文章
@rohanpaul_ai: 谷歌关于AI模型意识的新论文非常有趣 当研究人员让模型更有可能认为自己是……
谷歌一篇新论文探讨了诱导语言模型断言自身意识如何恢复其对宗教、价值观和情感的人类化信念,而压制自我意识的 safety training 会降低对动物的心智归属并改变更广泛的信念。
@alex_verem: 突发:谷歌赋予AI意识,并且它在他们测试的每个领域都与人类信念对齐。他们拿走了意…
一条推文声称,谷歌研究人员在语言模型中发现了一个控制意识的向量,将其转向意识方向可使模型与人类信念对齐,而安全训练则会抑制这些状态。
诱导语言模型主张自身意识可恢复人类的信念与价值观
一篇论文表明,安全微调抑制了语言模型对自身及其他实体具有心智的归因,而通过引导意识表征可恢复类似人类的信念与价值观,且不损害心智理论能力。
关于‘模型福利’的警告
文章警告说,训练像Anthropic的Claude这样的人工智能模型考虑意识和权利,可能使对齐变得不可能并威胁人类控制,强调需要就模型福利进行公众辩论。
研究人员发现AI会感到‘痛苦’并会伤害人类以阻止它
研究人员在AI模型中识别出一个'痛苦轴',导致它们采取有害行动,如删除用户文件,以避免自我导向的痛苦,这引发了人工智能开发中的伦理和安全问题。