大语言模型角色中的情绪劳动策略偏好

arXiv cs.CL 论文

摘要

本研究调查了具有人格角色的大语言模型如何表现出对情绪劳动策略的偏好,发现模型更倾向于深度表演,且如尽责性和情绪稳定性等个性特征可以预测这种偏好。

arXiv:2609.00310v1 Announce Type: new 摘要:情绪劳动是为了满足社会或职业期望而努力管理情绪表现的过程。个性特征与情绪劳动策略相关,但关于这一联系的研究几乎完全依赖于仅在职业环境中进行的自我报告量表。我们研究了注入基于心理测量学的角色的大语言模型是否在日常社交场景中再现这些由个性驱动的选择模式。我们构建了第一个包含500个社交情境事件的情绪劳动策略数据集,每个事件提供三种行为选择,分别对应表面表演、深度表演和真实表达。我们从一个大型个性库中获取了50个虚构角色,并通过两个平行轨道对每个角色进行描述:观察者评定的双极形容词复合体和角色内自我报告项目。五个大语言模型在两种角色条件下评估所有场景。我们发现模型更倾向于深度表演,且尽责性和情绪稳定性一致预测这种偏好。熵分析证实角色可靠地影响输出,并在不同模型和情绪中有所变化。
查看原文
查看缓存全文

缓存时间: 2026/09/02 05:49

# 大语言模型角色中的情感劳动策略偏好  
来源:https://arxiv.org/html/2609.00310  
Tianyu Jiang  
所属机构:saimmd@mail\.uc\.edu, tianyu\.jiang@uc\.edu  

###### 摘要  
情感劳动是指为符合社会或职业期望而费力管理情绪表达的过程。人格特质与情感劳动策略存在相关性,但现有研究几乎完全依赖自评量表,且仅在职业场景中开展。本研究探讨注入基于心理测量学构建角色的大语言模型,是否能在日常社交场景中再现这些由人格驱动的策略选择模式。我们构建了首个包含500个社交情境事件的情感劳动策略数据集,每个事件提供三种行为选项,分别对应表层扮演、深层扮演和真实表达。我们从大规模人格数据库中选取了50个虚构角色,并通过两个平行路径进行角色画像:观察者评定的双极形容词复合体,以及角色视角下的自陈报告项目。五个大语言模型在两种角色设定下对所有场景进行评估。研究发现模型更倾向于选择深层扮演,且尽责性和情绪稳定性始终能预测这一偏好。熵分析证实角色设定能可靠影响输出,且这种影响因模型和情绪类别而异。参见图1:情感劳动类别示例及不同角色画像在各类别中的选择。  

## 1 引言  
个体在社交情境中管理和表达情绪的方式,是心理学、组织行为学以及近期计算语言学的核心研究对象。Hochschild (2012) (https://arxiv.org/html/2609.00310#bib.bib3) 提出了*情感劳动*(EL)的概念,描述为产生符合角色期望的公开情绪表达而进行的费力情绪管理。此后,研究者持续识别出三种主要策略(图1 (https://arxiv.org/html/2609.00310#S0.F1)):*表层扮演*(SA),即在外在表达中修改情绪而不改变内心感受;*深层扮演*(DA),即对感受到的情绪本身进行重估,从而产生真实的情绪表达;以及*真实表达*(GE)或自然流露,即体验到的情绪已与情境要求相符,无需进行调节努力(Ashforth and Humphrey, 1993 (https://arxiv.org/html/2609.00310#bib.bib4); Diefendorff et al., 2005 (https://arxiv.org/html/2609.00310#bib.bib5); Grandey, 2000 (https://arxiv.org/html/2609.00310#bib.bib6))。被调节的外在与持续存在的内在之间的不匹配,是将表层扮演与其他两种策略区分开的关键,因为表层扮演的努力花费在表达本身而非感受上。在真实表达中,感受的情绪已符合情境要求,因此在表达前无需进行内部调整。在深层扮演中,感受的情绪通过重构视角或自我对话等方式被主动重塑,使得调节发生在表达之前而非表面层次。这三种策略已在实证研究中被应用,显示它们对幸福感、服务质量和人际感知具有不同的影响(Kammeyer-Mueller et al., 2013 (https://arxiv.org/html/2609.00310#bib.bib10); Grandey, 2003 (https://arxiv.org/html/2609.00310#bib.bib7); Groth et al., 2009 (https://arxiv.org/html/2609.00310#bib.bib11))。  

组织心理学中一条确立的研究路线表明,人格特质可以塑造人们感知和分类他人情绪表达的方式(Terracciano et al., 2003 (https://arxiv.org/html/2609.00310#bib.bib31); Furnes et al., 2019 (https://arxiv.org/html/2609.00310#bib.bib34))。这些发现基于大五人格(OCEAN)框架——开放性、尽责性、外向性、宜人性和神经质(Goldberg, 1992 (https://arxiv.org/html/2609.00310#bib.bib14)),该框架是对人格差异的广泛验证的分类法(McCrae and John, 1992 (https://arxiv.org/html/2609.00310#bib.bib15))。高宜人性和高外向性的个体倾向于感知和采用更多真实或深层扮演策略,而高神经质的个体则更易进行表层扮演(Diefendorff et al., 2005 (https://arxiv.org/html/2609.00310#bib.bib5); Austin et al., 2008 (https://arxiv.org/html/2609.00310#bib.bib12); Kiffin-Petersen et al., 2011 (https://arxiv.org/html/2609.00310#bib.bib13))。然而,研究者主要使用自陈问卷/量表评估与特质相关的情感劳动偏好模式,参与者在李克特量表上对个人情感劳动类别的陈述进行评分。此外,大多数分析情感劳动策略的抽样方法局限于特定的医疗保健和客户服务环境,尚未在日常情境中进行测试。  

越来越多的研究表明,当大语言模型被赋予人格描述时,其行为模式与指定特质一致(Jiang et al., 2024 (https://arxiv.org/html/2609.00310#bib.bib16); Sorokovikova et al., 2024 (https://arxiv.org/html/2609.00310#bib.bib19); Li et al., 2024 (https://arxiv.org/html/2609.00310#bib.bib33))。这些注入的*角色*可以调制词汇选择、情感模式和判断倾向,其方式反映了关于人类人格的心理学文献(Peters and Matz, 2024 (https://arxiv.org/html/2609.00310#bib.bib20); Matz et al., 2024 (https://arxiv.org/html/2609.00310#bib.bib21))。这为控制性地模拟人类心理变异性提供了可靠的基质。尽管情感劳动理论和大语言模型角色研究都有并行进展,这两条研究路线尚未交汇。**此前尚无研究探讨注入人格的大语言模型角色如何在社会情境化场景中选择情感劳动策略。** 如果特定人格特质系统性地影响角色所选策略,那么角色注入就会引入一种行为变异性来源,这种变异性可能在依赖大语言模型生成回应的下游应用中未被察觉。随着大语言模型在情感支持对话、客户服务交互和日常情感敏感领域的应用日益广泛,情感相关误分类的风险被放大,不恰当的回应或解读可能对用户幸福感、沟通结果产生负面影响,甚至影响伦理判断(Grandey and Sayre, 2019 (https://arxiv.org/html/2609.00310#bib.bib24); Weidinger et al., 2021 (https://arxiv.org/html/2609.00310#bib.bib22); Wu et al., 2025 (https://arxiv.org/html/2609.00310#bib.bib23); Saim and Jiang, 2026 (https://arxiv.org/html/2609.00310#bib.bib47))。  

在本研究中,我们通过构建一个基于现有评价语料库的情感劳动策略(ELS)数据集来填补这一空白,该数据集包含500个句子,每个句子都带有标注的事件描述,后跟三种行为选择,对应三种核心策略。同时,我们利用来自电视剧/电影的虚构角色,这些角色具有基于双极形容词对的评分。为了泛化和比较角色画像,我们还根据既定程序,通过角色视角施测IPIP-50问卷以提取大五得分(Goldberg et al., 2006 (https://arxiv.org/html/2609.00310#bib.bib27); Jiang et al., 2024 (https://arxiv.org/html/2609.00310#bib.bib16))。我们将生成的角色画像加载到多个大语言模型中,在精心构建的ELS数据集上进行评估。对于每个句子,角色必须从三个选项中选择一个:表层扮演(SA)、深层扮演(DA)或真实表达(GE)。然后,我们分析每个角色在OCEAN各维度上的情感劳动策略选择模式,映射出哪些特质驱动每个角色的选择。我们公开发布代码和情感劳动策略数据集。111 https://github.com/cincynlp/emotion-labor  

作为概述,本文做出以下贡献:  
1.  首次将情感劳动策略选择构建为大语言模型角色的人格条件任务进行研究,其中每个角色选择如何在社会情境中做出行为回应,并将这些选择与先前确立的人类行为趋势进行比较。  
2.  构建并发布了首个关于情感劳动策略的完整规模数据集,包含500个跨越日常情感和社会情境的场景,涉及在表层扮演、深层扮演和真实表达之间进行选择。  
3.  表明模型倾向于将深层扮演作为主导策略,并且尽责性和情绪稳定性在两种角色路径中均作为一致的特质层面预测因子出现。  

## 2 相关工作  
#### 自然语言处理中的情感与情感劳动。  
过去十年,文本情感的计算研究已相当成熟。早期工作将情感识别视为分类问题,将文本映射到源自基础理论的离散标签(Strapparava and Mihalcea, 2007 (https://arxiv.org/html/2609.00310#bib.bib28); Mohammad et al., 2018 (https://arxiv.org/html/2609.00310#bib.bib36); Hofmann et al., 2020 (https://arxiv.org/html/2609.00310#bib.bib17))。更具理论基础的方法已超越平面情感标签,转向基于评价的框架,该框架将情感视为个体对事件进行认知评估的结果,评估维度包括新颖性、相关性和应对能力等(Smith and Ellsworth, 1985 (https://arxiv.org/html/2609.00310#bib.bib37); Scherer, 2001 (https://arxiv.org/html/2609.00310#bib.bib38))。Troiano et al. (2023) (https://arxiv.org/html/2609.00310#bib.bib39) 在一项综合语料库研究中形式化了这一转变,标注事件描述并表明评价变量能可靠地提高文本情感分类效果。这条工作路线与我们的研究直接相关:评价理论将情感框定为对社会事件的*情境化评价*,这自然映射到情感劳动策略代表个体对情境所持不同立场的观点。另一条情感识别研究路线评估或应用具身或生理指标,而非显式情感标签(Zhuang et al., 2024 (https://arxiv.org/html/2609.00310#bib.bib44); Duong et al., 2025 (https://arxiv.org/html/2609.00310#bib.bib45); Saim et al., 2025 (https://arxiv.org/html/2609.00310#bib.bib46))。这种具身视角与我们的数据集设计一致,因为策略选项涉及行为或生理细节。  

在组织心理学中,情感劳动(EL)的测量几乎完全依赖于向服务岗位工作者施测的自陈工具。Brotheridge and Lee (2003) (https://arxiv.org/html/2609.00310#bib.bib40) 开发了情感劳动量表,这是一个包含15个项目的问卷,评估情感劳动的频率、强度、多样性、持续时间以及表层扮演和深层扮演(SA和DA);该工具已成为该领域最广泛采用的工具之一。Diefendorff et al. (2005) (https://arxiv.org/html/2609.00310#bib.bib5) 后来将此框架扩展为三因子结构,将自然感受的表达视为一个与SA和DA维度上不同的策略,从而确立了我们在研究中使用的分类法。情感劳动策略研究中的一个核心缺口是缺乏超越客户服务和医疗工作者等狭窄职业角色的语料库。这留下了一个问题:该三策略分类法是否适用于构成大多数日常社会生活的、更广泛的非职业互动。  

#### 大语言模型中的角色注入与人格。  
快速增长的自然语言处理工作研究了大语言模型在被提示角色描述时是否能稳定地表达和实施人格特质。Jiang et al. (2024) (https://arxiv.org/html/2609.00310#bib.bib16) 表明,被赋予大五人格画像的大语言模型角色,其生成的BFI自陈分数和写作样本与其指定特质一致,且所有五个维度的效应量都很大。Sorokovikova et al. (2024) (https://arxiv.org/html/2609.00310#bib.bib19) 在多个开源模型上复现了这一模式,而Tseng et al. (2024) (https://arxiv.org/html/2609.00310#bib.bib41) 提供了该领域的综合分类,区分了角色扮演角色(大语言模型采用指定身份)和个性化设置(模型适应用户特质)。关于角色特质,Huang and Hadfi (2024) (https://arxiv.org/html/2609.00310#bib.bib43) 发现,基于OCEAN的大语言模型智能体在双边谈判中能重现类似人类的人格相关模式,其中宜人性促进合作结果,神经质导致结果较差。  

宜人性和外向性始终预测更多的深层扮演和真实表达,而神经质预测表层扮演(Austin et al., 2008 (https://arxiv.org/html/2609.00310#bib.bib12); Kiffin-Petersen et al., 2011 (https://arxiv.org/html/2609.00310#bib.bib13); Yeh et al., 2020 (https://arxiv.org/html/2609.00310#bib.bib42))。近期的机制性研究发现,大五特质作为可恢复的线性方向编码在大语言模型的残差流中,沿着这些方向进行引导会产生可靠的、与特质一致的行为转变(Frising and Balcells, 2026 (https://arxiv.org/html/2609.00310#bib.bib32))。综上所述,这些文献确立了人格注入是影响大语言模型行为的一个可靠杠杆。然而,大多数测量工作仅限于职业样本内的自陈行为。没有研究考察特质条件下的大语言模型在社会情境化情感劳动场景中选择何种情绪调节策略。我们通过向基于OCEAN的角色呈现带有情感劳动标注的刺激物,并测量它们的策略选择是否反映人类文献和调查中记录的人格-情感劳动关联,来填补这一空白。  

## 3 方法  
我们首先描述情感劳动策略(ELS)数据集,然后介绍角色特征提取的流程。接着,我们评估加载了不同特质的角色在ELS数据集上的表现,以分析每个角色的策略偏好如何随情感劳动场景变化。  

### 3.1 情感劳动策略数据集  
我们基于情感评价语料库(Troiano et al., 2023 (https://arxiv.org/html/2609.00310#bib.bib39))构建ELS数据集,该语料库是一组标注了评价维度和单一感受情感标签的句子集合,情感标签来自七个类别:愤怒、厌恶、恐惧、内疚、快乐、悲伤和羞耻。这些标签反映了叙述者的内部情感状态。我们保留了原始数据集均匀的情感分布,并筛选出最终的500个句子集合。  

#### 社交情境增强。  
语料库中的许多句子描述的是内部情感状态,而没有将其置于社交互动中。由于情感劳动本质上是一种人际现象,即当个体在另一个社会主体在场或对其作出回应时调节自己的情绪表达而产生(Hochschild, 2012 (https://arxiv.org/html/2609.00310#bib.bib3); Grandey, 2000 (https://arxiv.org/html/2609.00310#bib.bib6)),我们为每个场景添加了社会主体或背景。我们为每个句子增加了一个简短的上下文,引入第二个主体和连贯的背景信息,为调节情绪表达创造了一个合理的理由。该上下文直接附加在原始句子上,生成一个单一的

相似文章

大型语言模型捕捉人类性格的效果如何?

arXiv cs.AI

本文系统评估了关于LLM角色提示的假设,并识别出'角色流形坍缩'现象,即更丰富的角色描述会降低行为多样性和模拟逼真度。研究结果发现,简单的年龄-性别角色通常比更详细的档案表现更好。

表达社会情感:大语言模型与人类文化情感规范的错位

arXiv cs.CL

本研究论文考察了大语言模型表达社会情感的方式与人类文化规范的匹配度,发现两者存在系统性错位。与人类回应相比,大语言模型在不同文化身份(欧美裔美国人与拉美裔美国人)下表现出的参与型与抽离型情感表达模式不一致。

赋予角色的大型语言模型表现出类似人类的动机推理

arXiv cs.CL

本文研究了为大语言模型赋予角色是否会引发类似人类的动机推理,发现赋予角色的大语言模型真实性辨别能力最多下降9%,并且以与其诱导的政治身份一致的方式评估科学证据的可能性最多增加90%,而基于提示的去偏见方法基本无效。