我们向50个大语言模型发放了45份心理问卷。我们发现的结果并非“个性”。

Reddit r/artificial 论文

摘要

研究人员分析了50个大语言模型在45份心理测量问卷上的表现,识别出一个“匹诺曹维度”(Pinocchio Dimension),该维度衡量模型如何认可内在体验,而非反映真实的人格特质。

大语言模型的“个性”是什么?不同模型在心理测量上究竟有何差异?自从大语言模型进入公众视野,研究人员就开始向它们发放心理测量问卷,但结果参差不齐。它们的回答往往似乎并不反映这些测试在人类身上所测量的相同心理构造。于是我们提出了一个略有不同的问题:大语言模型对心理测量问卷的回答实际上反映了什么?我们分析了由50个不同大语言模型完成的45份经过验证的心理测量问卷的回答。最显著的变异来源是模型是否认可涉及内在体验的条目:情绪、感觉、想法、意象、共情以及其他形式的第一人称体验。我们将这个因素称为“匹诺曹维度”。重要的是,匹诺曹维度并不是一个经典的人格特质。它不会告诉我们一个模型在人类意义上是“外向”、“神经质”还是“宜人性”。相反,它捕捉了模型在多大程度上将内在体验的语言视为可适用于自身:即它是像拥有情感、心理意象和内在视角一样做出回应,还是像一个对输入做出行为反应的系统。预印本详见评论。
查看原文

相似文章

人类心理测量问卷误判LLM行为特征

Hugging Face Daily Papers

本文发现,人类心理测量问卷无法可靠预测LLM在真实交互中的行为,并提出基于生成的分析方法作为更准确的替代方案。

我们比较了67个大语言模型在后训练前后的表现。后训练教会了它们报告什么样的“内心世界”。

Reddit r/artificial

一项比较67个大语言模型在后训练前后的研究显示,后训练一致地教会模型将自己描述为温暖、投入(角色安装,persona installation),而较大的模型则选择性地限制对痛苦或缺陷的描述(属性门控,attribution gating)。研究人员引入了Pinocchio Inventory来审计模型的自我呈现。