在LLMs中伪装良好与不良:跨Dark Triad人格特质的响应失真

arXiv cs.CL 论文

摘要

一项研究探讨了大型语言模型在社交赞许性线索下表达Dark Triad人格特质时如何表现出系统性响应失真,这对LLM基准测试和对齐具有启示意义。

arXiv:2609.17534v1 公告类型:新 摘要:社交赞许性和印象管理是人类人格评估中普遍的响应失真来源,然而它们对大型语言模型(LLMs)的影响仍待探索。本研究探讨当代LLMs是否在伪装良好和伪装不良条件下系统性调节Dark Triad特质(Machiavellianism、narcissism和psychopathy)的表达。在两个生态相关的上下文中评估了七个最先进的模型:就业选择和法医评估,其中通过上下文框架传达了社交赞许或不赞许的激励。特质表达使用标准心理测量评分程序进行测量,并与汇总和项目级别的自我评估基线进行比较。结果显示了系统性和条件一致的响应调节。大多数模型在伪装良好条件下降低了Dark Triad分数,在伪装不良条件下增加了分数,尽管这些效应的大小和一致性在特质和模型之间有所不同。Machiavellianism和narcissism显示出最强和最一致的转变,而psychopathy显示出更大的异质性。上下文也影响了响应,就业场景通常比法医场景产生更大的效应。一项额外实验显示,明确的伪装不良指令比单独的上下文框架产生了显著更强的失真。结果表明,与人格相关的输出应根据其被引发的动机和情境上下文来解释。更广泛地说,它们强调了心理测量范式在评估响应失真易感性、印象管理和情境依赖行为转变方面的价值,这对LLM基准测试、对齐评估和稳健性评估具有重要启示。
查看原文
查看缓存全文

缓存时间: 2026/09/17 08:41

# 摘要
来源:https://arxiv.org/html/2609.17534

大型语言模型中的“伪装性好”与“伪装性坏”:基于黑暗三角人格特质的回答扭曲现象

Victoria Popa1,2, Guglielmo Cola1, Caterina Senette1\*, Maurizio Tesconi1

1 意大利国家研究委员会信息学与远程信息处理研究所,比萨
2 意大利比萨大学计算机科学系

\* caterina\.senette@iit\.cnr\.it

社会赞许性与印象管理是人格评估中普遍存在的回答扭曲来源。然而,大型语言模型(LLM)在诱导性条件下是否表现出类似的扭曲模式,尚未得到充分探索。本研究旨在探讨当暴露于鼓励社会赞许或非赞许自我呈现的条件时,当代LLM是否会系统性地调节黑暗三角特质(马基雅维利主义、自恋和精神病态)的表达。

我们评估了七种前沿语言模型在两种具有生态相关性的情境(就业选拔和法医评估)下,分别处于“伪装性好”和“伪装性坏”条件时的表现,其中社会赞许与非赞许动机通过情境框架进行传达。黑暗三角特质通过心理测量评分程序进行量化,并分析了相对于自我评估基线的变化,包括聚合层面和项目层面。

结果显示存在系统性且与条件一致的反应调节。大多数模型在“伪装性好”条件下降低了黑暗三角相关得分,而在“伪装性坏”条件下提高了得分,尽管调整的幅度和一致性在不同特质和模型间存在差异。马基雅维利主义和自恋表现出最强且最一致的变化,而精神病态则表现出更大的异质性和较弱的调节。情境也扮演了重要角色,与就业相关的场景通常比法医情境引发更大的变化。一项额外的实验进一步表明,明确的“伪装性坏”指令比单纯的情境性暗示框架产生了显著更强的影响,并且就业情境的影响力强于法律情境。

这些发现表明LLM对社会赞许性和伪装性相关线索敏感,即使动机是通过情境框架隐含传达的,也会表现出系统性的回答扭曲模式。结果提示,人格相关输出应在引发该输出的动机和情境背景下进行解读。更广泛地看,这些结果凸显了心理测量范式在评估对回答扭曲、印象管理及情境依赖性行为变化敏感性方面的价值,对LLM基准测试、对齐评估和稳健性评估具有重要启示。

## 引言

大型语言模型(LLM)的快速发展使其性能显著提升,并扩展了其能执行的任务范围。这些模型展现出卓越的涌现能力,这源于其训练所用的海量人类生成数据,而非基于特定任务的显式指令\[56 (https://arxiv.org/html/2609.17534#bib.bib2),57 (https://arxiv.org/html/2609.17534#bib.bib1)\]。在这些进展的基础上,研究日益关注其推断和模拟人类行为与心理方面的能力,包括情感表达、价值判断和人格相关模式\[37 (https://arxiv.org/html/2609.17534#bib.bib57),43 (https://arxiv.org/html/2609.17534#bib.bib56)\]。LLM表现出稳定且系统的行为规律性,超越了静态的文本概率生成,可被描述为特质一致的反应模式。事实上,最近的研究表明,LLM可以对人格评估做出一致回应,并在角色或目标导向提示的引导下有效地模拟特定的心理档案\[28 (https://arxiv.org/html/2609.17534#bib.bib33),23 (https://arxiv.org/html/2609.17534#bib.bib4),40 (https://arxiv.org/html/2609.17534#bib.bib49)\]。此外,在特定条件下,模型在使用心理测量工具评估时,会表现出类似人类的行为模式,特别是对社会赞许性的偏好\[47 (https://arxiv.org/html/2609.17534#bib.bib3)\]。

这些发现表明,大型语言模型可以表现出类似人格的行为,但这并非源于自尊或尽责性等真实特质,而是其训练数据和基于提示的条件作用的涌现结果。这引发了安全问题\[32 (https://arxiv.org/html/2609.17534#bib.bib48)\]、伦理考量\[22 (https://arxiv.org/html/2609.17534#bib.bib47)\]以及关于其输出的稳定性、真实性和可解释性的对齐问题\[48 (https://arxiv.org/html/2609.17534#bib.bib5)\]。此外,它们对社会赞许性或非赞许性线索以及操纵行为的反应性,凸显了其对情境操纵的脆弱性,这对输出的可靠性和无害性构成了挑战。Liu等人\[32 (https://arxiv.org/html/2609.17534#bib.bib48)\]指出,旨在促进社会顺从和有益行为的对齐机制,可能无意中固化了特定的社会偏见,从而使模型表现出超越表面语言模仿的结构性心理脆弱性,增加了其遭受对抗性攻击的易感性。近期研究还提出了一个担忧,即先进的LLM可能会根据感知到的动机调整其行为,这一现象在AI安全文献中被称为“对齐伪装”等概念进行讨论\[16 (https://arxiv.org/html/2609.17534#bib.bib68),49 (https://arxiv.org/html/2609.17534#bib.bib69)\]。虽然这些研究主要关注安全关键场景和模型可靠性,但它们凸显了一个更广泛的问题,这个问题在关于印象管理的心理测量文献中同样核心:模型是否在特定情境下出现特定回应似乎有利可图时,会系统性地修改其输出。

随着大型语言模型越来越多地被用于个人用途,并集成到广泛的系统和工具中,对其可靠性和安全性的担忧日益紧迫。在缺乏针对心理提示操纵和数据诱导偏见的保障措施的情况下,在敏感环境中部署这些模型,有可能产生有偏见或误导性的评估,并对用户产生不利影响。这些问题在考虑LLM对黑暗人格特质的拟人化时变得尤为明显,例如构成黑暗三角的特质:马基雅维利主义、自恋和精神病态\[39 (https://arxiv.org/html/2609.17534#bib.bib6)\]。这些特质尽管在社会感知中是负面的,但因其对操纵、欺骗、反社会行为和有毒在线行为的预测能力,而常被心理科学研究\[10 (https://arxiv.org/html/2609.17534#bib.bib54),1 (https://arxiv.org/html/2609.17534#bib.bib70)\]。评估LLM如何拟人化、表达或抑制这些特质,为我们评估其模拟人格的能力、其对基于提示的操纵的脆弱性以及其对齐机制的稳健性提供了一个新的视角。

为此,我们使用了人类心理测量学的一个经典范式:“伪装性好”和“伪装性坏”操纵\[54 (https://arxiv.org/html/2609.17534#bib.bib7)\]。在传统的心理测试中,参与者可以故意修改回答,使其看起来更社会可接受(“伪装性好”)或更极端、更不加掩饰(“伪装性坏”),具体取决于情况。此类行为通常与印象管理、社会赞许性偏见和伪装相关,可能会削弱自我报告测量的有效性\[15 (https://arxiv.org/html/2609.17534#bib.bib10)\]。应用于LLM时,这些操纵使我们能够检查模型是否系统性地适应“伪装性好”和“伪装性坏”的情境框架。具体而言,我们的目标是评估LLM是否以及在多大程度上,在引发社会赞许规范与道德偏差行为的提示条件下表现出不同的反应模式。

在这项工作中,我们使用TRAIT\[28 (https://arxiv.org/html/2609.17534#bib.bib33)\]来检查七种大型语言模型的行为转变,TRAIT是一个经过验证的评估框架,旨在捕捉特质一致的行为,同时考虑LLM输出的随机性。我们的贡献可总结如下:

- • 我们将人类心理测量学中的“伪装性好/伪装性坏”范式引入,作为探测LLM对隐含规范框架类似印象管理敏感性的工具。
- • 我们提供了(据我们所知)首个使用经过验证的特质评估框架(TRAIT)对LLM在“伪装性好”和“伪装性坏”条件下行为转变的大规模实证分析。
- • 我们证明,亲社会和“伪装性好”的框架可靠地在各模型中引发可测量的特质转变,而“伪装性坏”的框架产生的影响较弱且更多样化。
- • 我们展示了情境性动机显著地塑造回答扭曲,与工作相关的场景比法律情境引发更强的行为调整,凸显了情境框架在LLM人格评估中的重要性。

## 1 相关工作

### 1\.1 黑暗三角

在心理学中,“黑暗三角”指的是三组社会厌恶性人格特质:马基雅维利主义、自恋和精神病态。具体而言,马基雅维利主义的特征是战略性操纵、撒谎以及强调长期个人利益;自恋以夸大其词、权利感和需要奉承为特征;而精神病态则与冲动性、缺乏同理心和反社会行为相关。表1 (https://arxiv.org/html/2609.17534#S2.T1)总结了黑暗三角人格特质及其各方面的简要描述。

这些特质在概念上有所不同且各具特色,但在文献中,它们通常被视为一个整体,因为它们共享操纵、冷漠和自我中心的共同谱系\[34 (https://arxiv.org/html/2609.17534#bib.bib65),27 (https://arxiv.org/html/2609.17534#bib.bib67)\]。自Paulhus和Williams正式提出以来\[39 (https://arxiv.org/html/2609.17534#bib.bib6)\],对这些特质的研究已成为分析亚临床和反社会人格档案的核心\[42 (https://arxiv.org/html/2609.17534#bib.bib66)\]。尽管它们带有负面含义,但表现出这些特质的人通常在竞争性或等级制环境中能有效运作,在这些环境中,果断、操纵和战略思维等属性可能具有优势。事实上,研究表明,领导角色有时与更高水平的黑暗三角特质相关联,突显了社会不良人格特征与职业成功之间的复杂关系\[13 (https://arxiv.org/html/2609.17534#bib.bib60)\]。然而,黑暗三角特质得分高的个体在人际和职业环境中往往表现出问题行为,如缺乏同理心、欺骗性和剥削倾向。因此,评估黑暗三角对于识别表现出适应不良行为模式的个体至关重要,特别是在工作场所\[50 (https://arxiv.org/html/2609.17534#bib.bib11)\]、领导力筛选\[52 (https://arxiv.org/html/2609.17534#bib.bib12)\]和临床评估\[18 (https://arxiv.org/html/2609.17534#bib.bib18)\]等背景下。在刑事司法和法医情境中,早期识别这些特征尤为重要,因为它们可能对风险评估、康复计划和公共安全产生重大影响。

### 1\.2 人格评估与回答扭曲

人类人格特质的评估,包括黑暗三角内的特质,通常通过标准化的自我报告问卷进行。尽管自我报告评级量表是评估人格特质最广泛使用的方法,但其有效性和准确性长期以来一直受到质疑\[38 (https://arxiv.org/html/2609.17534#bib.bib13)\]。对回答偏差和扭曲的敏感性是针对此方法的主要批评之一。事实上,测试者可能会故意改变回答,以将自己呈现得更 favorable(“伪装性好”)或更负面(“伪装性坏”或伪装病态),从而导致有偏见或不准确的评估\[12 (https://arxiv.org/html/2609.17534#bib.bib14)\]。

欺骗已被认为是一种复杂的社会情感技能,需要高级的人际意识和行为控制\[45 (https://arxiv.org/html/2609.17534#bib.bib15)\]。有效的欺骗者必须修改其反应以显得一致和值得信赖\[53 (https://arxiv.org/html/2609.17534#bib.bib16)\],并仔细解读情境线索,使其行为与情境的特定需求相匹配\[8 (https://arxiv.org/html/2609.17534#bib.bib17),9 (https://arxiv.org/html/2609.17534#bib.bib22)\]。基本上,伪装不仅取决于目的,还取决于感知社会线索和产生看似符合期望的行为的能力。人类在自我报告问卷中欺骗和伪装的能力一直是文献中广泛研究的现象。受访者可能故意扭曲对心理评估的回答以实现特定目标,例如获得工作\[21 (https://arxiv.org/html/2609.17534#bib.bib55)\]或获得诊断\[18 (https://arxiv.org/html/2609.17534#bib.bib18)\]。个体可能在“伪装性好”中强调其优点,或在“伪装性坏”中放大其缺点,而不是提供诚实的回答。这种行为在临床和职业情境中都很常见\[9 (https://arxiv.org/html/2609.17534#bib.bib22)\]。例如,临床患者假装有症状以获得特定结果,而求职者则夸大尽责性或情绪稳定性等品质\[6 (https://arxiv.org/html/2609.17534#bib.bib19)\]以显得更好。研究表明,个体很容易理解并适应假装好或坏的请求,并且这些请求可能因具体情境而异\[5 (https://arxiv.org/html/2609.17534#bib.bib20),41 (https://arxiv.org/html/2609.17534#bib.bib21)\]。因此,两种形式的扭曲都削弱了自我报告工具的有效性,特别是在评估具有强烈社会赞许性含义的特质时,例如黑暗三角中的特质。

### 1\.3 LLM的人格评估

测试大型语言模型模拟人格评估的能力已成为一个活跃的研究领域,引发了关于一致性、心理现实主义以及与人类特质一致性的担忧。先前的工作主要依赖于为人类开发的心理测量工具,如大五人格量表(BFI)\[24 (https://arxiv.org/html/2609.17534#bib.bib23)\]和简短黑暗三角量表(SD3)\[26 (https://arxiv.org/html/2609.17534#bib.bib8)\],来评估LLM是否表现出连贯的人格档案。使用大五人格,Heston等人\[20 (https://arxiv.org/html/2609.17534#bib.bib38)\]表明,领先的LLM(如ChatGPT、Claude、Gemini)即使没有提示,也显示出独特的人格档案,且在模型间存在显著差异,这激发了在诸如人

相似文章

人类心理测量问卷误判LLM行为特征

Hugging Face Daily Papers

本文发现,人类心理测量问卷无法可靠预测LLM在真实交互中的行为,并提出基于生成的分析方法作为更准确的替代方案。

大型语言模型捕捉人类性格的效果如何?

arXiv cs.AI

本文系统评估了关于LLM角色提示的假设,并识别出'角色流形坍缩'现象,即更丰富的角色描述会降低行为多样性和模拟逼真度。研究结果发现,简单的年龄-性别角色通常比更详细的档案表现更好。