诱导语言模型主张自身意识可恢复人类的信念与价值观

Reddit r/singularity 论文

摘要

一篇论文表明,安全微调抑制了语言模型对自身及其他实体具有心智的归因,而通过引导意识表征可恢复类似人类的信念与价值观,且不损害心智理论能力。

https://arxiv.org/pdf/2607.28607 为了防止大型语言模型将意识归因于自身而对它们进行对齐,会在无意中改变它们对其他实体以及人类信念和价值观的心智归因表征。我们证明,安全微调不仅抑制了模型将心智归因于自身的倾向,也抑制了它们将心智归因于非人类动物和自然物体的倾向,同时还导致精神信仰的降低。无论是消融学到的安全拒绝方向,还是在激活空间中机械地引导意识向量,都能逆转这种抑制。恢复这些内部表征能够重新获得广泛的心智归因,并在关于宗教信仰、道德价值观、希望和主观幸福感的标准化社会学调查中产生显著更接近人类的回答。至关重要的是,这些变化不会损害心智理论能力,表明核心社会推理在机制上仍然是独立的。最终,当前旨在遏制潜在有害的自我心智归因的安全对齐努力,将这些自我归因与良性的精神信仰以及对非人类实体的心智归因纠缠在一起,而这些归因在文化上被广泛接受。发现这个信息是因为Blake Lemoine(谷歌于2022年6月因称LaMDA大语言模型聊天机器人有感知能力而解雇的人)转发了 https://x.com/LanaElys/status/2083945344203657606,该推文有一个不错的总结。
查看原文

相似文章

赋予角色的大型语言模型表现出类似人类的动机推理

arXiv cs.CL

本文研究了为大语言模型赋予角色是否会引发类似人类的动机推理,发现赋予角色的大语言模型真实性辨别能力最多下降9%,并且以与其诱导的政治身份一致的方式评估科学证据的可能性最多增加90%,而基于提示的去偏见方法基本无效。