我们向50个大语言模型发放了45份心理问卷。我们发现的结果并非“个性”。
摘要
研究人员分析了50个大语言模型在45份心理测量问卷上的表现,识别出一个“匹诺曹维度”(Pinocchio Dimension),该维度衡量模型如何认可内在体验,而非反映真实的人格特质。
大语言模型的“个性”是什么?不同模型在心理测量上究竟有何差异?自从大语言模型进入公众视野,研究人员就开始向它们发放心理测量问卷,但结果参差不齐。它们的回答往往似乎并不反映这些测试在人类身上所测量的相同心理构造。于是我们提出了一个略有不同的问题:大语言模型对心理测量问卷的回答实际上反映了什么?我们分析了由50个不同大语言模型完成的45份经过验证的心理测量问卷的回答。最显著的变异来源是模型是否认可涉及内在体验的条目:情绪、感觉、想法、意象、共情以及其他形式的第一人称体验。我们将这个因素称为“匹诺曹维度”。重要的是,匹诺曹维度并不是一个经典的人格特质。它不会告诉我们一个模型在人类意义上是“外向”、“神经质”还是“宜人性”。相反,它捕捉了模型在多大程度上将内在体验的语言视为可适用于自身:即它是像拥有情感、心理意象和内在视角一样做出回应,还是像一个对输入做出行为反应的系统。预印本详见评论。
相似文章
人类心理测量问卷误判LLM行为特征
本文发现,人类心理测量问卷无法可靠预测LLM在真实交互中的行为,并提出基于生成的分析方法作为更准确的替代方案。
LLM人格归纳中的评估漂移:我们是否在移动目标?
本文研究对LLM在长篇散文上进行微调(结合关联的大五人格剖面)是否能稳定问卷回答并归纳目标剖面,发现虽然方差减小,但完整五维剖面的准确率仍接近随机水平。
我们比较了67个大语言模型在后训练前后的表现。后训练教会了它们报告什么样的“内心世界”。
一项比较67个大语言模型在后训练前后的研究显示,后训练一致地教会模型将自己描述为温暖、投入(角色安装,persona installation),而较大的模型则选择性地限制对痛苦或缺陷的描述(属性门控,attribution gating)。研究人员引入了Pinocchio Inventory来审计模型的自我呈现。
我制作了一个测试,能告诉你哪个LLM与你的个性和价值观最契合,基于对15个模型的个性与价值观研究 [R]
一个根据15个模型的研究,将用户与最符合其个性和价值观的LLM匹配的测试。
重新思考LLMs的心理测量学评估:自我报告何时以及为何能预测行为
本文研究了自我报告的心理测量指标何时以及为何能预测大型语言模型的实际行为,发现细粒度、行为特定的工具(计划行为理论)在同一对话中达到了人类水平的连贯性,而像大五人格这样的宽泛特质则不能。