当角色属性提升大型语言模型中的群体对齐时
摘要
本文探讨了使用不同属性选择方法的角色提示如何影响大型语言模型与社会调查中人类响应的对齐。研究发现,其有效性取决于人类响应的变异性和属性的选择。
arXiv:2609.02526v1 公告类型:新
摘要:大型语言模型(LLMs)越来越多地用于预测调查面板中人类参与者的响应。为此,角色提示最近作为一种技术和对齐大型预训练语言模型的方法而兴起。角色提示指的是在提示中使用“角色”的简短文本描述来引导LLMs的生成。角色通过不同的属性描述个体,如他们的社会人口统计、态度或行为,旨在对齐LLMs以产生与相应人类响应相关的响应。然而,最近的工作产生了混合且部分冲突的角色提示结果,没有明确的成功和失败模式。在少数一致的发现中,角色属性的选择很重要,并且使用更多属性并不一定导致更好的性能。目前尚不清楚不同的属性选择方法如何表现以及如何在它们之间进行选择。在本文中,我们提出,观察到的调查问题的人类响应变异性是迄今为止观察到的混合性能的潜在解释。此外,我们比较了与选择角色属性的不同方法相关联的角色提示的性能。我们在两个国家的四个不同(通用)社会调查、六个LLMs和每个调查的二十个预测任务上评估了这些方法。我们的工作有助于识别何时可以期望角色提示在调查预测任务中有用,并为使用角色提示的基于LLM的调查预测中不同属性选择方法的有效性提供了新的见解。
查看缓存全文
缓存时间: 2026/09/03 05:55
# 人格属性何时能改善大型语言模型的人群对齐度 来源:https://arxiv.org/html/2609.02526 \\DeclareCaseLangs Jens Rupprecht 附属机构:曼海姆大学 Markus Strohmaier 附属机构:GESIS – 莱布尼茨社会科学研究所 附属机构:曼海姆大学 附属机构:复杂性科学中心 Claudia Wagner 附属机构:GESIS – 莱布尼茨社会科学研究所 附属机构:复杂性科学中心 附属机构:亚琛工业大学 ###### 摘要 大型语言模型(LLMs)越来越多地被用于预测调查面板中的人类参与者反应。为此目标,**人格提示**(persona prompting)最近作为一种告知和对齐大型预训练语言模型的技术而兴起。人格提示指的是在提示中使用“人格”的简短文本描述来引导LLM生成内容的实践。人格通过不同的属性来描述个体,例如其社会人口统计特征、态度或行为,旨在使LLMs的输出能与相应的人类反应产生关联。然而,近期的研究在人格提示方面产生了混合且部分矛盾的结果,其成功与失败的模式并不清晰。为数不多的共识性发现之一是:**人格属性的选择至关重要**,并且使用更多属性并不一定能带来更好的性能。目前尚不清楚不同的属性选择方法表现如何,以及如何在它们之间进行选择。 本文提出,我们观察到的人类对调查问题反应的变异性,可能是目前观察到的混合性能表现的一个潜在解释。此外,我们还比较了与选择人格属性的不同方法相关的人格提示的性能表现。我们在两个国家的四个不同的(通用)社会调查、六个LLMs以及每个调查的二十个预测任务上评估了这些方法。我们的工作有助于识别人格提示在调查预测任务中何时可望有效,并为基于LLMs调查预测中使用人格提示时,不同属性选择方法的有效性提供了新的见解。 ††\* 同等贡献。 ## 1 引言 **图1:** 概述与实验设置。使用调查数据,我们评估了不同的人格属性选择策略如何帮助预测参与者对具有不同人类反应变异性水平的调查问题的反应。我们假设,采用人格提示的LLMs在预测具有更高人类反应变异性的调查问题反应时表现更佳,并且为优化人格提示而设计的人格属性选择方法优于纯粹数据驱动的方法。 在自然语言处理(NLP)和计算社会科学(CSS)中,使用人格来引入多样性和模拟不同人类视角的方法正迅速获得关注。通过将人口统计、态度或行为特征赋予大型语言模型(LLMs),人格提示有望提供一种可扩展的方法来建模异质性观点和社会行为,通常结合了经验观察与合成数据生成。尽管前景如此,实证发现依然参差不齐。一些研究报告称,在表现多样视角方面有显著改进,而另一些研究则发现改进有限或不一致,这引发了关于人格提示何时及为何成功的根本性问题。特别是,在何种条件下人格能够使LLMs忠实地再现人类判断和行为,仍知之甚少。 关于这些混合结果来源的有限经验证据主要来自主观标注任务。在此背景下,Brown 等(2025)(https://arxiv.org/html/2609.02526#bib.bib5) 和 Sarumi 等(2024)(https://arxiv.org/html/2609.02526#bib.bib30) 表明,人类标注者之间的一致程度可以预测LLM再现人类标注的能力。他们的发现表明,当人类判断相对一致时,人格提示更有效;而当意见存在重大分歧时,则效果较差。虽然这些研究提供了重要的初步见解,但尚不清楚这种关系是否可以推广到他们所分析的特定标注任务之外。 为了在调查背景下研究这个问题,我们引入了“人类反应变异性”的概念,我们将其定义为参与者对给定调查问题反应的变异程度。这一概念化与NLP中的“人类标签变异性”概念密切相关(Plank,2022 (https://arxiv.org/html/2609.02526#bib.bib32)),后者认识到标注的变异可能不仅源于任务模糊性,也源于合理的解释差异和多种可能的反应。然而,调查反应在一个重要方面有所不同:变异通常不是测量假象,而是我们关注的实质现象。受访者在社会人口特征、观点、态度、经验和行为上存在差异,所有这些都可能导致对同一问题产生系统性不同但同样有效的反应。因此,我们的人类反应变异性概念捕捉了人群中有意义的异质性。 我们提出,人类反应变异性上的差异是人格提示方法在不同调查反应预测任务中再现人类反应分布时性能差异的一个潜在解释。除了是一个有前景的应用领域,调查还为方法学的进步提供了理想的评估环境:它们提供了详细的个体层面信息,从基本的社会人口特征到更复杂的行为和信念,这些信息可用于选择构建人格描述的相关属性;并且自然地包含了一系列具有不同人类反应变异水平的多样化问题,可用于评估。 我们通过两个不同的离散度量来操作化人类反应变异性,根据响应变量的类型和尺度进行选择(Wilcox,2008 (https://arxiv.org/html/2609.02526#bib.bib44)):用于名义变量的标准化熵和用于有序变量的异见度。我们基于人格提示文献中为数不多的几个一致发现之一,以进一步理解影响该方法性能的因素:**选择合适的属性集来构建人格描述至关重要**。尽管 Luz de Araujo 等(2025)(https://arxiv.org/html/2609.02526#bib.bib26) 和 Rupprecht 等(2026)(https://arxiv.org/html/2609.02526#bib.bib34) 观察到LLMs对无关的人格细节很敏感,如果包含这些细节,性能会急剧下降,但 Hwang 等(2023)(https://arxiv.org/html/2609.02526#bib.bib19) 发现,在一系列任务中,通过增加过去用户意见来增强一组人口统计属性和意识形态得分,可以带来一致的准确性提升。值得注意的是,先前的工作要么根据预测任务增加或移除整个属性块。相反,我们针对给定的目标调查问题,对选择人格属性的不同方法进行基准测试。 在整个研究中,我们将对特定调查问题的反应预测称为**调查反应预测任务**,因为预测目标和输入都是变化的。在这项工作中,我们解决了以下两个研究问题(RQs): - • 研究问题1:人类反应变异在多大程度上可以解释不同调查反应预测任务中人格提示性能的差异? - • 研究问题2:不同的Persona属性选择方法在多大程度上能够提高人格提示在调查反应预测任务上的性能? 为了解决这些问题,我们使用图1 (https://arxiv.org/html/2609.02526#S1.F1) 中概述的方法,系统地研究了人类反应变异性、Persona变量选择方法与人格提示性能之间的关系。我们使用来自一个在全球70个国家并行运行的国际调查项目“世界价值观调查”(WVS)(EVS/WVS,2024 (https://arxiv.org/html/2609.02526#bib.bib12))的美国和德国国家级数据,以及在这两个国家进行的通用社会调查——美国综合社会调查(GSS)(Davern 等,2025 (https://arxiv.org/html/2609.02526#bib.bib14))和德国综合社会调查(GGSS)(Ackermann 等,2025 (https://arxiv.org/html/2609.02526#bib.bib13))。 ## 2 背景 ### 2\.1 人格提示研究报告结果不一 人格提示已被广泛用于模拟人类对调查问题的反应。然而,结果始终不一:例如,一些研究发现,他们无法通过使用人格提示对LLMs进行条件设定来恢复已知的回归系数(Bisbee 等,2024 (https://arxiv.org/html/2609.02526#bib.bib4)),而另一些研究则指出了结果的模糊性(Lee 等,2024 (https://arxiv.org/html/2609.02526#bib.bib22);Qu 和 Wang,2024 (https://arxiv.org/html/2609.02526#bib.bib33);Sanders 等,2023 (https://arxiv.org/html/2609.02526#bib.bib35))。与此同时,大量研究在各种任务上使用经过人格条件设定的LLMs取得了有前景的结果(Park 等,2026 (https://arxiv.org/html/2609.02526#bib.bib31);Aher 等,2023 (https://arxiv.org/html/2609.02526#bib.bib1);Argyle 等,2023 (https://arxiv.org/html/2609.02526#bib.bib3);Horton 等,2023 (https://arxiv.org/html/2609.02526#bib.bib16);Li 和 Conrad,2026 (https://arxiv.org/html/2609.02526#bib.bib23))。 尽管关于人格的构建方法和应用场景已经非常广泛,但只有少数先前的工作试图理解为什么这种方法在特定情境下有效或无效。在NLP领域,一些作者已经开始探索人格变量选择、人类标注的变异性以及人格提示性能之间的联系。Hu 和 Collier(2024)(https://arxiv.org/html/2609.02526#bib.bib17) 使用人格变量拟合线性回归来预测标注,发现这些变量在不同NLP任务中通常只能解释不到10%的方差。当使用这些人格变量进行人格提示以复制任务的标注时,他们发现与结果度量相关性最强的变量能带来最佳的预测性能,并且对于人类标注熵高但标准差低的任务,预期能获得最大的收益。 此外,Hu 等(2026)(https://arxiv.org/html/2609.02526#bib.bib18) 建立了模型开发阶段与模型表示人类行为不同水平变异能力之间的联系。他们区分了**基础模型**(在预训练期间优化以“[表示]人类语言和意见的完整、多模态多样性”)和**指令微调模型**(优化以“[将]概率质量集中在目标偏好分布的单一、高回报模式上”)。他们发现指令微调LLMs在具有低熵结果的任务上表现最佳,而基础模型在具有高熵结果的任务上表现最佳,这表明指令微调模型更擅长准确表示多数结果,而基础模型则更擅长复制人类行为的完整分布。 从另一个角度,Hwang 等(2023)(https://arxiv.org/html/2609.02526#bib.bib19) 使用具有相同基本人口统计特征的人类参与者的反应变异性,来确定解释观察到的反应变异性需要多少额外属性。他们表明,具有相同人口统计特征的个体之间的一致性得分(通过科恩κ测量)集中在0.5左右,而完全一致性得分为1。这一发现表明,仅使用这组人口统计特征不足以建模分歧,因此需要额外的属性来有意义地解释结果差异。 除了来自NLP研究的这些经验证据(表明人类反应变异性是人格提示LLMs在调查反应预测任务中表现混合的合理解释)之外,我们还从关于LLMs开发和使用的普遍观察中得出了两个互补的解释。 与 Hwang 等(2023)(https://arxiv.org/html/2609.02526#bib.bib19) 的观察类似,我们假设人格提示在预测具有高人类反应变异性的调查问题时效果最佳,因为LLM需要通过人格描述提供的额外属性来建模其默认反应(即在未对人格进行条件设定时它会生成的反应)的偏差。直观地说,如果两个具有不同属性的个体对调查问题的反应不同,用于预测他们个人调查反应的LLM就需要访问这些不同的属性,以便能够有意义地建模他们反应的差异。 与 Hu 等(2026)(https://arxiv.org/html/2609.02526#bib.bib18) 的观察类似,我们假设人格提示在预测具有低人类反应变异性的调查问题时效果最差,因为LLM的最佳反应生成策略是简单地生成其默认反应。正如经验所证明和理论推导的那样,LLMs的默认反应倾向于代表多数观点(Chakraborty 等,2024 (https://arxiv.org/html/2609.02526#bib.bib6);Santurkar 等,2023 (https://arxiv.org/html/2609.02526#bib.bib36);Sorensen 等,2024 (https://arxiv.org/html/2609.02526#bib.bib38))。从这个角度看,任何额外的人格属性都会引入噪声,并有可能引导LLM偏离其与多数观点对齐的默认反应,从而在反应分布高度集中于单一多数反应的情况下降低性能。Hu 等(2026)(https://arxiv.org/html/2609.02526#bib.bib18) 观察到,这种效应对指令微调模型尤其强烈,他们将其描述为优化以产生这种单一最佳反应,而不是完整的(同等)有效反应分布。 关于我们的第一个研究问题,我们因此假设,待预测调查问题的人类反应变异性会影响人格提示方法的性能。我们期望该方法在具有高人类反应变异性的问题上比在具有低人类反应变异性的问题上表现更好,并且当不使用人格时,这种效果会反转。 ### 2\.2 Persona属性选择至关重要 在少数关于人格提示机制的方法论贡献之一中,Luz de Araujo 等(2025)(https://arxiv.org/html/2609.02526#bib.bib26) 指出了我们旨在解决的文献空白:“尽管人格和任务具有多样性,但大多数先前的工作并未系统地区分相关和无关的人格属性,或测量它们对模型行为的具体影响”。 在他们自己的工作中,Luz de Araujo 等(2025)(https://arxiv.org/html/2609.02526#bib.bib26) 提出了人格提示的四个必要条件,其中“与任务无关的属性不应影响模型性能”和“相关属性[...]应塑造模型行为”是他们认为最关键的。
相似文章
城市感知中多模态大语言模型代理生成解释的角色效应分析
本文研究了角色提示如何影响多模态大语言模型在城市感知中生成的语言,发现不同角色的描述趋于一致,而解释则随着角色属性系统性地变化。
大型语言模型捕捉人类性格的效果如何?
本文系统评估了关于LLM角色提示的假设,并识别出'角色流形坍缩'现象,即更丰富的角色描述会降低行为多样性和模拟逼真度。研究结果发现,简单的年龄-性别角色通常比更详细的档案表现更好。
基于人格特征的涌现性错位数据归因
本文研究了微调语言模型中的涌现性错位现象,使用基于SAE的模型差分来识别控制错位的人格特征,并将其归因于预训练网络文档。
赋予角色的大型语言模型表现出类似人类的动机推理
本文研究了为大语言模型赋予角色是否会引发类似人类的动机推理,发现赋予角色的大语言模型真实性辨别能力最多下降9%,并且以与其诱导的政治身份一致的方式评估科学证据的可能性最多增加90%,而基于提示的去偏见方法基本无效。
大规模人口统计提示:更多属性如何损害LLM与人类的一致性
本文研究了在提示中添加人口统计属性如何影响LLM与人类在不同任务中的一致性,发现少数高信号属性能够提升对齐,但过度指定会降低对齐效果。研究使用五个开源LLM和神经元探测,表明属性信号质量和连贯性比数量更重要。