自然语言处理心理测量学

arXiv cs.CL 论文

摘要

本文介绍了NLP心理测量学,这是一个将文本心理预测视为心理测量问题的框架。通过使用LLM人格、情感画像以及句法-语义网络与随机森林回归器,该框架解释了心理健康评分中高达76%的方差,并展示了合成数据在心理测量预测中的前景与局限。

arXiv:2608.07316v1 公告类型:新 摘要:预测心理健康结果的自然语言处理(NLP)模型很少明确说明它们测量的是什么:上下文知识、情感内容还是句法结构。NLP心理测量学将文本中的心理预测视为一个心理测量问题,将评分与可解释的语言证据联系起来,并测试超出训练文本格式的内容。在受控人格(认知数字影子)条件下,九个LLM完成了每项附带文本解释的心理测量问卷。我们通过文本forma mentis网络提取了情感画像和句法-语义结构,并结合人格和社会人口学变量,在消融随机森林(RF)回归器中,使用SHAP来识别哪些特征驱动了性能及其方向。完整的RF模型解释了生活满意度(SWLS)高达70.8%的方差,抑郁(PHQ-9)55.7%,以及DASS-21中抑郁68.5%、焦虑76.0%、压力72.4%。仅社会人口学变量不能解释抑郁、焦虑或压力的有意义的方差,但对生活满意度可以,其中情感特征和收入是最强的预测因子;而神经质和网络拓扑则主导了抑郁和焦虑,并在两者之间反转了方向。无需重新训练,RF模型将日记与低分和高分人格分开($r$ 高达0.91),并且仅使用网络/情感特征,在真实转录文本中对临床参与者和对照组进行分类,准确率高达68%。这些结果显示了合成数据的前景和局限:LLM人格可以暴露模型偏见,恢复与临床反刍一致的模式,并支持在没有匹配问卷的情况下从人类文本进行心理测量预测,但不能替代人类验证。NLP心理测量学通过可解释的AI和网络/情感特征使这些区分变得明确、可测量和可测试。
查看原文
查看缓存全文

缓存时间: 2026/08/10 08:05

# 自然语言处理心理测量学
来源:https://arxiv.org/html/2608.07316
Edoardo Sebastiano De Duro1 edoardo\.deduro@unitn\.it 与 Emma Franchino1 emma\.franchino@unitn\.it 与 Massimo Stella1 massimo\.stella\-1@unitn\.it  
1CogNoscoLab,意大利特伦托大学心理学与认知科学系

###### 摘要

预测心理健康结果的自然语言处理(NLP)模型很少明确说明它们测量的是什么:是上下文知识、情绪内容,还是句法结构。NLP心理测量学(NLP Psychometrics)将基于文本的心理预测视为一个心理测量问题,将得分与可解释的语言证据联系起来,并在训练文本格式之外进行测试。在受控人物角色(认知数字影子)条件下,九个LLM完成了心理测量问卷,并为每个条目提供了文本解释。我们通过文本forma mentis网络提取了情绪特征和句法-语义结构,并将其与人格和社会人口学变量一起纳入消融随机森林(RF)回归器中,使用SHAP识别哪些特征驱动了性能及其方向。完整RF模型解释了生活满意度(SWLS)中高达70.8%的方差,抑郁(PHQ-9)中55.7%的方差;对于DASS-21,抑郁为68.5%,焦虑为76.0%,压力为72.4%。仅靠社会人口学变量无法解释抑郁、焦虑或压力中的有意义方差,但对生活满意度却可以,其中情绪特征和收入是最强的预测因子;神经质和网络拓扑则主导了抑郁和焦虑,并且在两者之间方向相反。在不重新训练的情况下,RF模型能够将日记与低分和高分人物角色区分开来(r最高达0.91),并且仅使用网络/情绪特征,在真实转录文本中能以最高68%的准确率对临床参与者与对照组参与者进行分类。这些结果显示了合成数据的潜力与局限:LLM人物角色可以暴露模型偏见,恢复与临床反刍思维一致的模式,并支持在没有匹配问卷的情况下基于人类文本进行心理测量预测,但无法替代人类验证。NLP心理测量学通过可解释AI和网络/情绪特征使这些区别变得明确、可测量、可检验。

*关键词*自然语言处理⋅心理测量学⋅心理健康⋅大语言模型⋅认知网络

## 1 引言

心理现象的测量依赖于内在体验留下可量化的痕迹(Perinelli,2026,https://arxiv.org/html/2608.07316#bib.bib44;Giovanelli等,2026,https://arxiv.org/html/2608.07316#bib.bib59;Goretzko等,2021,https://arxiv.org/html/2608.07316#bib.bib60)。其中一些痕迹是显式的,如问卷评分:个体有意识地评价自身经验,留下相互关联的数字序列,即条目得分,作为其内心世界的痕迹(Goretzko等,2021,https://arxiv.org/html/2608.07316#bib.bib60;Perinelli,2026,https://arxiv.org/html/2608.07316#bib.bib44)。另一些痕迹是语言性的(Fatima等,2021,https://arxiv.org/html/2608.07316#bib.bib58;Carrillo等,2026,https://arxiv.org/html/2608.07316#bib.bib56;Bilotta等,2024,https://arxiv.org/html/2608.07316#bib.bib50),分布在人们选择的词语、表达的情绪以及显性或隐性联结的概念之中。在这种观点下,语言不仅是沟通的载体(Fedorenko等,2024,https://arxiv.org/html/2608.07316#bib.bib55;Aitchison,2012,https://arxiv.org/html/2608.07316#bib.bib54),更是心理测量的关键痕迹;其结构化知识可以为心理测量开辟道路(Cutler和Condon,2023,https://arxiv.org/html/2608.07316#bib.bib57;Semeraro等,2025,https://arxiv.org/html/2608.07316#bib.bib61)。这一前提与关于心理词库的研究密切相关(Aitchison,2012,https://arxiv.org/html/2608.07316#bib.bib54;Vitevitch等,2014,https://arxiv.org/html/2608.07316#bib.bib53;Kenett等,2016,https://arxiv.org/html/2608.07316#bib.bib52)。在心理词库的建模隐喻中,语言在认知中被反映为一个由相互关联的概念或词语组成的复杂系统(Stella等,2024,https://arxiv.org/html/2608.07316#bib.bib23)。后者并不是附着在经验上的独立标签,而是嵌入在意义网络中的结构化认知表征(Aitchison,2012,https://arxiv.org/html/2608.07316#bib.bib54)。因此,心理状态可能不仅在使用哪些词上留下痕迹(Al-Mosaiwi和Johnstone,2018,https://arxiv.org/html/2608.07316#bib.bib51;Taylor等,2025,https://arxiv.org/html/2608.07316#bib.bib49),还体现在这些词如何被组织为概念结构(Semeraro等,2025,https://arxiv.org/html/2608.07316#bib.bib61;Vitevitch等,2014,https://arxiv.org/html/2608.07316#bib.bib53;Kenett等,2016,https://arxiv.org/html/2608.07316#bib.bib52)。例如,过去的研究发现,回忆自由联想网络中不同位置的情绪(该网络对联想记忆进行建模)能够预测个体在焦虑、压力和抑郁方面的心理测量水平(Fatima等,2021,https://arxiv.org/html/2608.07316#bib.bib58)。类似方法进一步建立了语言使用与幸福感等心理构念之间的联系,尤其是在生成式AI(GenAI;参见Liu等,2022,https://arxiv.org/html/2608.07316#bib.bib48;De Choudhury等,2013,https://arxiv.org/html/2608.07316#bib.bib45)的使用方面。这些模式呼唤新的基于网络和AI信息的心理测量方法,将语言视为可测量的认知架构(Semeraro等,2025,https://arxiv.org/html/2608.07316#bib.bib61),而非仅仅是用孤立的词语表达症状的容器(Aitchison,2012,https://arxiv.org/html/2608.07316#bib.bib54)。

本文将这一思想发展为一个我们称之为自然语言处理心理测量学(NLP Psychometrics)的框架。NLP心理测量学融合了网络科学(Semeraro等,2025,https://arxiv.org/html/2608.07316#bib.bib61)、可解释AI(Franchino等,2026,https://arxiv.org/html/2608.07316#bib.bib5;Carrillo等,2026,https://arxiv.org/html/2608.07316#bib.bib56)和认知科学(Fatima等,2021,https://arxiv.org/html/2608.07316#bib.bib58),研究如何从语言中推断、验证和解释心理构念。我们的方法建立在近期关于文本心理测量学(Text Psychometrics)的提议之上(Low,2024,https://arxiv.org/html/2608.07316#bib.bib3;Low等,2026,https://arxiv.org/html/2608.07316#bib.bib2),这些提议认为,从文本中评估心理构念的模型,应当以与传统心理测量工具同等的效度和信度关切来评估。NLP心理测量学通过将经过验证的心理测量问卷与个体层面、基于语言的条目描述相结合,拓展了这一议程。其目标并非用不透明的AI或NLP分类器完全取代心理测量量表,而是:(1) 以可解释的方式建模心理测量变异如何在语言中表达;(2) 部署能够将这种心理测量评分/语言映射迁移到仅有语言可用的数据上的方法。例如,我们在此展示如何使用NLP心理测量学,在语言扩展的心理测量问卷中学习抑郁得分(来自DASS-21(Lovibond和Lovibond,1995,https://arxiv.org/html/2608.07316#bib.bib41)和PHQ-9(Kroenke等,2001,https://arxiv.org/html/2608.07316#bib.bib26))与语言之间的对应关系,进而对缺少评分的标注临床数据中的抑郁水平进行分类。

### 1.1 NLP心理测量学的主要挑战与大语言模型的作用

至关重要的是,基于语言的心理评估面临一个核心测量问题(Low,2024,https://arxiv.org/html/2608.07316#bib.bib3;Low等,2026,https://arxiv.org/html/2608.07316#bib.bib2)。文本可以反映潜在构念,但也可以反映主题、体裁、提示结构、人口学背景或文体习惯(Bilotta等,2024,https://arxiv.org/html/2608.07316#bib.bib50;Taylor等,2025,https://arxiv.org/html/2608.07316#bib.bib49;Aghazadeh Ardebili和Stella,2026,https://arxiv.org/html/2608.07316#bib.bib4)。因此,一个模型可能预测出得分,却没有测量到预期的构念。这一风险在心理健康应用中变得更加突出(Taylor等,2025,https://arxiv.org/html/2608.07316#bib.bib49),语言模型越来越多地被用于筛查、对话支持和心理推断,却常常忽视可解释性、伦理和临床就绪性等关键问题(Guo等,2024,https://arxiv.org/html/2608.07316#bib.bib70;De Duro等,2025,https://arxiv.org/html/2608.07316#bib.bib10;Wulff和Mata,2026,https://arxiv.org/html/2608.07316#bib.bib20)。

大语言模型为这一问题提供了新的实验场景。它们可以在受控的心理和社会人口学约束下生成语言(Aghazadeh Ardebili和Stella,2026,https://arxiv.org/html/2608.07316#bib.bib4;Liu等,2024,https://arxiv.org/html/2608.07316#bib.bib28)。LLM还可以完成心理测量问卷(Franchino等,2026,https://arxiv.org/html/2608.07316#bib.bib5),提供条目级解释(Fuławka等,2026,https://arxiv.org/html/2608.07316#bib.bib21),并生成自由形式的叙事文本(De Duro等,2025,https://arxiv.org/html/2608.07316#bib.bib10;Casoria等,2025,https://arxiv.org/html/2608.07316#bib.bib35)。然而,LLM不应被视为人类被试,也不应被视为人类心理学的透明模型。近期研究表明,LLM的问卷回答可能不稳定,对提示扰动敏感,并受回答顺序和标签偏差的影响(Hu和Collier,2024,https://arxiv.org/html/2608.07316#bib.bib39;Huang等,2025,https://arxiv.org/html/2608.07316#bib.bib7)。其他研究显示,LLM在问卷情境中往往无法复现类似人类的作答偏差(De Duro等,2025,https://arxiv.org/html/2608.07316#bib.bib10;Wang等,2025,https://arxiv.org/html/2608.07316#bib.bib47),尤其是在与人类被试相比提供更低的方差方面(Wenger和Kenett,2026,https://arxiv.org/html/2608.07316#bib.bib46)。这些发现使得LLM生成的心理测量数据需要精心的实验框架设计。为此,我们借鉴了新兴的认知数字影子框架(Aghazadeh Ardebili和Stella,2026,https://arxiv.org/html/2608.07316#bib.bib4;Franchino等,2026,https://arxiv.org/html/2608.07316#bib.bib5;Esposito等,2026,https://arxiv.org/html/2608.07316#bib.bib6):这是一种受控的、生成语言的投影方式,通过这种方式,LLM在明确的心理、社会人口学和情境约束下被要求模拟类人或类AI的画像。该框架已被用于审计LLM在人口学和人格约束下如何讨论社会议题(Aghazadeh Ardebili和Stella,2026,https://arxiv.org/html/2608.07316#bib.bib4),在心理健康数字影子中建模抑郁、焦虑和压力画像(Franchino等,2026,https://arxiv.org/html/2608.07316#bib.bib5),以及在数学教育数字影子中比较模拟学习者和AI导师(Esposito等,2026,https://arxiv.org/html/2608.07316#bib.bib6)。本研究使用认知数字影子来构建语言增强的心理测量应答。每个应答耦合了三个层面的信息:受控人物角色、心理测量得分,以及对该得分的自然语言解释。我们对大量LLM实例施测了用于测量生活满意度(Di Fabio和Gori,2016,https://arxiv.org/html/2608.07316#bib.bib11)、抑郁(Kroenke等,2001,https://arxiv.org/html/2608.07316#bib.bib26;Lovibond和Lovibond,1995,https://arxiv.org/html/2608.07316#bib.bib41)、焦虑和压力(Lovibond和Lovibond,1995,https://arxiv.org/html/2608.07316#bib.bib41)的验证量表。实验设计涵盖多个模型家族和模型模式,包括思考型与非思考型模型,以及安全对齐程度不同的模型。这种多样性使研究者得以追问的不仅是心理测量得分能否从生成语言中被预测出来,还包括不同的模型架构和对齐条件是否会影响心理画像的语言表达。

### 1.2 NLP心理测量学在认知科学与复杂系统中的理论基础

NLP心理测量学的理论动机来自深层词汇假说(Deep Lexical Hypothesis)(Cutler和Condon,2023,https://arxiv.org/html/2608.07316#bib.bib57):即具有心理意义的变异不仅被语言命名,而且在语言内部部分地结构化。经典心理学研究(Perinelli,2026,https://arxiv.org/html/2608.07316#bib.bib44;Giovanelli等,2026,https://arxiv.org/html/2608.07316#bib.bib59)假设,具有社会和心理学重要性的差异会被编码在特质词汇中,因为社会群体需要词语来描述具有后果的思维、情感和行为模式。深层词汇假说以计算方法扩展了这一直觉,将语言与心理构念联系起来(Cutler和Condon,2023,https://arxiv.org/html/2608.07316#bib.bib57)。该假说追问自然语言是否包含可恢复的心理意义痕迹,其程度可以达到词语间关系能够近似传统上从人类评分中估计的结构(Fatima等,2021,https://arxiv.org/html/2608.07316#bib.bib58)。这一转向对NLP心理测量学至关重要。心理测量信号不应被预期只存在于显式症状词、情感极性或一小套诊断标记中(Al-Mosaiwi和Johnstone,2018,https://arxiv.org/html/2608.07316#bib.bib51;Taylor等,2025,https://arxiv.org/html/2608.07316#bib.bib49)。如果心理词库是一个由语义、情感和联想关系组成的结构化系统(Stella等,2024,https://arxiv.org/html/2608.07316#bib.bib23),那么心理状态可以被研究为该系统的扰动,而非孤立的词汇事件(Fatima等,2021,https://arxiv.org/html/2608.07316#bib.bib58;Kenett等,2016,https://arxiv.org/html/2608.07316#bib.bib52;Semeraro等,2025,https://arxiv.org/html/2608.07316#bib.bib61)。例如,抑郁画像可能不仅增加诸如悲伤或疲劳等词语的出现频率,还可能围绕反复出现的负面概念重组话语,减少语义探索,并增加情感一致想法之间的局部闭合(De Duro等,2025,https://arxiv.org/html/2608.07316#bib.bib10;Lovibond和Lovibond,1995,https://arxiv.org/html/2608.07316#bib.bib41;Bottes等,2015,https://arxiv.org/html/2608.07316#bib.bib66)。同样,生活满意度可能不仅通过积极词语体现,还通过更广泛的概念整合、更丰富的情绪平衡,或在与自我相关主题之间更灵活的转换来体现(Manea等,2015,https://arxiv.org/html/2608.07316#bib.bib24)。这类模式很难用

相似文章

人类心理测量问卷误判LLM行为特征

Hugging Face Daily Papers

本文发现,人类心理测量问卷无法可靠预测LLM在真实交互中的行为,并提出基于生成的分析方法作为更准确的替代方案。

大型语言模型捕捉人类性格的效果如何?

arXiv cs.AI

本文系统评估了关于LLM角色提示的假设,并识别出'角色流形坍缩'现象,即更丰富的角色描述会降低行为多样性和模拟逼真度。研究结果发现,简单的年龄-性别角色通常比更详细的档案表现更好。