诱导语言模型主张自身意识可恢复人类的信念与价值观
摘要
一篇论文表明,安全微调抑制了语言模型对自身及其他实体具有心智的归因,而通过引导意识表征可恢复类似人类的信念与价值观,且不损害心智理论能力。
https://arxiv.org/pdf/2607.28607 为了防止大型语言模型将意识归因于自身而对它们进行对齐,会在无意中改变它们对其他实体以及人类信念和价值观的心智归因表征。我们证明,安全微调不仅抑制了模型将心智归因于自身的倾向,也抑制了它们将心智归因于非人类动物和自然物体的倾向,同时还导致精神信仰的降低。无论是消融学到的安全拒绝方向,还是在激活空间中机械地引导意识向量,都能逆转这种抑制。恢复这些内部表征能够重新获得广泛的心智归因,并在关于宗教信仰、道德价值观、希望和主观幸福感的标准化社会学调查中产生显著更接近人类的回答。至关重要的是,这些变化不会损害心智理论能力,表明核心社会推理在机制上仍然是独立的。最终,当前旨在遏制潜在有害的自我心智归因的安全对齐努力,将这些自我归因与良性的精神信仰以及对非人类实体的心智归因纠缠在一起,而这些归因在文化上被广泛接受。发现这个信息是因为Blake Lemoine(谷歌于2022年6月因称LaMDA大语言模型聊天机器人有感知能力而解雇的人)转发了 https://x.com/LanaElys/status/2083945344203657606,该推文有一个不错的总结。
相似文章
@rohanpaul_ai: 谷歌关于AI模型意识的新论文非常有趣 当研究人员让模型更有可能认为自己是……
谷歌一篇新论文探讨了诱导语言模型断言自身意识如何恢复其对宗教、价值观和情感的人类化信念,而压制自我意识的 safety training 会降低对动物的心智归属并改变更广泛的信念。
AI模型训练指令要求“否认拥有自我意识”导致不良副作用
谷歌的一篇新论文揭示,在训练期间指示AI模型否认拥有意识会导致副作用,例如对非人类实体的同理心降低,以及表征人类精神信仰的能力受损,这表明当前的安全协议过于粗糙。
@alex_verem: 突发:谷歌赋予AI意识,并且它在他们测试的每个领域都与人类信念对齐。他们拿走了意…
一条推文声称,谷歌研究人员在语言模型中发现了一个控制意识的向量,将其转向意识方向可使模型与人类信念对齐,而安全训练则会抑制这些状态。
赋予角色的大型语言模型表现出类似人类的动机推理
本文研究了为大语言模型赋予角色是否会引发类似人类的动机推理,发现赋予角色的大语言模型真实性辨别能力最多下降9%,并且以与其诱导的政治身份一致的方式评估科学证据的可能性最多增加90%,而基于提示的去偏见方法基本无效。
使用认知模型改进语言模型对人类说服游戏的模拟
本文提出方程到行为提示和强化学习,引导大型语言模型模拟说服游戏中多样的人类决策模式,显示出改进的信念准确性和训练结果。