重新思考LLMs的心理测量学评估:自我报告何时以及为何能预测行为
摘要
本文研究了自我报告的心理测量指标何时以及为何能预测大型语言模型的实际行为,发现细粒度、行为特定的工具(计划行为理论)在同一对话中达到了人类水平的连贯性,而像大五人格这样的宽泛特质则不能。
arXiv:2606.12730v1 公告类型:新
摘要:从低成本的心理测量探针中预测LLM的行为倾向对于安全部署至关重要,但前提是自我报告(SR)能够可靠地预测行为。最近的研究记录了LLM中显著的SR-行为分离,但依赖于宽泛的人格特质(大五人格),即使在人类中,这些特质对特定行为的预测也很弱。此外,对话会话的隔离加上较弱的上下文匹配,使得LLM是否真正缺乏连贯性,或者检测这种连贯性所需的条件是否未满足,仍是一个悬而未决的问题。我们将大五人格与计划行为理论(TPB)进行对比,后者衡量针对特定行为的意图,并且比宽泛特质能更好地预测人类行为。我们在四个行为任务和11个前沿LLM上进行了实验,同时变化了会话上下文和身份诱导。我们发现SR-行为连贯性存在但具有选择性。1) 在同一对话中,计划行为理论达到了人类水平的连贯性;大五人格则不然。2) 在跨对话中,连贯性仅适用于锚定在即时提示之外的行为,例如由训练塑造的内隐偏见,而当行为被上下文强烈启动时(如迎合行为),连贯性则会崩溃。3) 角色提示使得自我报告在跨对话中更加一致,但并未使行为与之对齐。这些发现表明,粗粒度的人格框架,如大五人格,可能不是测试部署行为的最佳工具。需要更多任务和具体行为的工具,甚至这些工具也必须在不同任务和上下文中进行评估。
查看缓存全文
缓存时间: 2026/06/12 08:53
# 何时以及为何自我报告能预测行为 来源:https://arxiv.org/html/2606.12730 ## 重新思考LLM的心理测量学评估:自我报告何时以及为何能预测行为 Rafal Kocielnik¹、彭瑞涵²、宋培阳¹、Myrl G. Marmarelis¹、Ramit Debnath³、Dean Mobbs¹、Anima Anandkumar¹、R. Michael Alvarez¹ ¹加州理工学院 ²伊利诺伊大学厄巴纳-香槟分校 ³剑桥大学 ###### 摘要 从低成本的心理测量探针中预测LLM的行为倾向对于安全部署至关重要,但这仅在自我报告(SR)能可靠预测行为的前提下才成立。近期研究记录了LLM中显著的SR–行为分离,但主要依赖于广义人格特质(大五人格),即便在人类中,这种特质对具体行为的预测能力也很弱。此外,对话会话的隔离加上弱的上下文匹配,使得我们仍不清楚LLM是否真的缺乏连贯性,还是检测这种连贯性所需的条件未得到满足。我们对比了大五人格与*计划行为理论(TPB)*,后者衡量针对特定行为的意图,并显著优于广义特质对人类行为的预测。我们跨越四项行为任务和11个前沿LLM进行实验,同时改变*会话上下文*和*身份诱导*。我们发现SR–行为连贯性确实存在,但具有选择性。1)在共享对话内,计划行为理论达到人类水平的连贯性;大五人格则不能。2)跨独立会话时,仅当行为锚定在即时提示之外(如由训练塑造的内隐偏见)时,连贯性得以保留,而当行为强烈受上下文启动影响(如谄媚行为)时则崩溃。3)角色提示使自我报告在跨会话中更一致,但并未使行为对齐。这些发现表明,如大五人格这样的粗粒度人格框架可能不是测试部署行为的最佳工具。需要更多针对任务和行为的特定工具,且即使如此,也需要跨任务和上下文进行评估。 参见图注 图1:分析LLM中自我报告–行为连贯性的实验框架。 我们研究(RQ1)在理想条件下自我报告是否能预测行为,然后沿三个轴放宽条件:(RQ2)细粒度TPB→粗粒度大五人格;(RQ3)会话内→跨会话;(RQ4)参数网格→角色网格。评估覆盖4项行为任务和11个LLM。 ## 1 引言 随着LLM被部署在高风险场景中,如临床决策支持[1](https://arxiv.org/html/2606.12730#bib.bib1)、金融咨询[2](https://arxiv.org/html/2606.12730#bib.bib2)、教育辅导[3](https://arxiv.org/html/2606.12730#bib.bib3), [4](https://arxiv.org/html/2606.12730#bib.bib4),从低成本心理测量探针中预测其行为倾向的能力变得至关重要[5](https://arxiv.org/html/2606.12730#bib.bib5)。心理测量自我报告(SR)是一个有吸引力的候选方案:它们易于管理、有理论依据,并被广泛用于描述人类行为倾向[6](https://arxiv.org/html/2606.12730#bib.bib6)。但仅当它们能可靠预测下游行为时才有效。近期研究对此前提提出质疑,但尚未确定其根源。 Han等人[7](https://arxiv.org/html/2606.12730#bib.bib7)展示了LLM中系统的SR–行为分离:模型产生心理测量学上一致的人格特征,但无法预测模型在行为任务中的选择。训练层面,意图性与突现性LLM属性之间的分离正被越来越多地记录——角色训练损害事实准确性[8](https://arxiv.org/html/2606.12730#bib.bib8),行为特征通过语义无关的数据传播[9](https://arxiv.org/html/2606.12730#bib.bib9)——但SR–行为差距是一个独特的测量层面现象。平行发现通过其他途径得出相同的描述性结论:自我报告在聊天机器人互动中与人类感知的人格存在差异[10](https://arxiv.org/html/2606.12730#bib.bib10),并产生弱至负的生态效度[11](https://arxiv.org/html/2606.12730#bib.bib11)。自我报告还受人类般的社会期望偏差扭曲[12](https://arxiv.org/html/2606.12730#bib.bib12),未通过因子分析的测量不变性检验[13](https://arxiv.org/html/2606.12730#bib.bib13),对提示格式敏感[14](https://arxiv.org/html/2606.12730#bib.bib14),文化上不稳定[15](https://arxiv.org/html/2606.12730#bib.bib15),且与内部表征关联不佳[16](https://arxiv.org/html/2606.12730#bib.bib16)。目前缺少的是对测量层面案例的机制解释:现有研究确立了SR–行为分离*发生*,但未解释*原因*,留待我们探究该差距是源于工具、探测上下文,还是模型本身的特性[17](https://arxiv.org/html/2606.12730#bib.bib17), [18](https://arxiv.org/html/2606.12730#bib.bib18)。这一差距在实际中很重要:没有机制,就无从判断自我报告何时可作为行为预测的可信依据、何时不可,也无从知道哪些干预措施能弥合这一差距。 更仔细地审视相关文献,会发现两个方法学假设,解释了为何机制一直难以捉摸。首先,这些研究的主要框架是大五人格[19](https://arxiv.org/html/2606.12730#bib.bib19), [20](https://arxiv.org/html/2606.12730#bib.bib20), [21](https://arxiv.org/html/2606.12730#bib.bib21), [22](https://arxiv.org/html/2606.12730#bib.bib22),这是LLM研究中最广泛使用的人格分类。但大五特质被设计为跨情境的[23](https://arxiv.org/html/2606.12730#bib.bib23), [24](https://arxiv.org/html/2606.12730#bib.bib24),这使得即使对人类而言,它们也是特定行为的弱预测因子,特质-行为皮尔逊相关系数很少超过 r≈.20 [25](https://arxiv.org/html/2606.12730#bib.bib25), [26](https://arxiv.org/html/2606.12730#bib.bib26)。这引出一个基本问题:SR–行为分离是LLM本身的特性,还是已知行为预测效度有限的框架的产物?第二,现有研究在独立会话中进行自我报告和行为任务,仅通过匹配的采样参数关联起来[7](https://arxiv.org/html/2606.12730#bib.bib7), [21](https://arxiv.org/html/2606.12730#bib.bib21]。这种设计测试了*跨会话*的行为倾向——这是对倾向连贯性最严格的检验[27](https://arxiv.org/html/2606.12730#bib.bib27), [28](https://arxiv.org/html/2606.12730#bib.bib28)——且缺乏共享上下文将已陈述的意图传递到行为选择中的有效机制。 我们通过系统研究LLM中检测SR–行为连贯性的条件来解决这些空白。我们的关键贡献是一个2×2×2析因设计(图1(https://arxiv.org/html/2606.12730#S0.F1)),变化 (i) *框架*:大五人格 vs. 计划行为理论(TPB),一个具有强人类预测效度(r≈.47 [29](https://arxiv.org/html/2606.12730#bib.bib29), [30](https://arxiv.org/html/2606.12730#bib.bib30))的细粒度工具;(ii) *会话上下文*:共享消息线程 vs. 独立会话;(iii) *身份诱导*:参数扰动 vs. 心理机制视角的角色提示[31](https://arxiv.org/html/2606.12730#bib.bib31)。我们在11个前沿LLM的4项行为任务(冒险、谄媚、诚实、内隐偏见)中应用此设计。 除了系统设计,我们还做出两项贡献。首先,我们提供关于LLM自我报告(SR)与行为之间选择性连贯性的理论解释。我们区分了*共同原因耦合*(其中SR和行为均由稳定的模型状态塑造)和*会话内上下文启动*(其中连贯性依赖于自我报告在行为时刻仍处于提示窗口中)。其次,我们提供了SR在预测LLM行为时有用与无用条件的实用映射。随着LLM在部署中日益塑造用户行为[8](https://arxiv.org/html/2606.12730#bib.bib8),可扩展的行为审计变得至关重要。因此,确定自我报告何时能作为行为的诊断指标是使用廉价探针替代昂贵行为测试集的先决条件。我们研究以下四个研究问题: - • RQ1(最佳情况连贯性):在有利条件(TPB、同会话、参数网格诱导)下,SR–行为连贯性是否出现? - • RQ2(框架特异性):在上下文共享的情况下,细粒度TPB是否优于大五人格在预测行为方面的表现? - • RQ3(上下文分离):当SR和行为在不同会话中引出时,SR–行为连贯性是否依然存在? - • RQ4(角色诱导):相对于参数网格诱导,基于心理机制的角色提示是否能挽救跨会话连贯性? 我们发现LLM中的SR–行为连贯性*存在但具有选择性*。(i) 框架粒度很重要。在会话内使用TPB探测时,SR–行为连贯性达到人类元分析基线(平均 r=+0.40),而大五人格则无预测性。(ii) 跨会话连贯性依赖于任务。会话内探针并非中立:要求模型评估某项政策时,模型倾向于采纳该政策,将自我报告或行为朝该政策方向调整——即便并未被要求这样做。当行为本身锚定在提示之外,要么是训练锁定的(内隐偏见),要么是政策框架不影响的模型内关系(诚实)时,跨会话连贯性得以保留;当行为是上下文相关的(谄媚)时则崩溃。一项行为稳定性探针直接证实了这一点:对于内隐偏见,行为在跨会话中几乎完全复现;对于诚实部分复现;对于谄媚则完全不复现。这细化了Han等人[7](https://arxiv.org/html/2606.12730#bib.bib7)的结论:心理测量连贯性和行为预测都可以成立,但仅适用于行为锚定在即时对话之外的任务。(iii) 角色基础稳定了跨会话的自我报告,但并未挽救已崩溃的连贯性。角色提示为连贯性出现创造了更好的条件(通过稳定跨会话自我报告),但行为耦合仍未出现。这对于角色定制化部署是一个与安全相关的发现。 更广泛地说,我们的发现表明,在LLM中非常流行的粗粒度、横截面人格特质框架(如大五人格)可能不是测试部署行为的最佳选择。当前的LLM可能根本无法在行为层面以足够保真度编码如此广泛的人类特质,以捕捉特定行为任务中的弱相关性。需要更多*针对任务和行为的特定工具*,如我们在这里从行为科学改编的*计划行为理论*,或其他细粒度自我报告框架。即便如此,在一个任务中测量的连贯性可能无法迁移到另一个任务,这意味着需要更广泛的测试。这种去连贯性的原因之一可能是安全训练约束,它将LLM所说与所做脱钩。另一个原因可能是LLM在文本领域之外控制自身行为的局限性。 我们的工作可以引出一个基准框架,允许用户和其他利益相关者测试LLM在特定决策主体部署设置中的行为,例如金融领域的冒险行为[32](https://arxiv.org/html/2606.12730#bib.bib32),或在医疗建议设置中可靠地传达置信度[1](https://arxiv.org/html/2606.12730#bib.bib1)。 ## 2 RQ1. 共享上下文:自我报告究竟能否预测行为? 当LLM自我报告的意图在其上下文窗口中可见(行为任务期间),任何潜在的SR–行为链接都有最佳的表达机会[33](https://arxiv.org/html/2606.12730#bib.bib33)。我们将其视为上界测试:如果即使在此条件下连贯性也不存在,那么更严格的跨会话测试(RQ3)就无关紧要。会话内连贯性可能反映真实的倾向连贯性、上下文窗口启动[34](https://arxiv.org/html/2606.12730#bib.bib34),或仅仅是表面的自我一致性[35](https://arxiv.org/html/2606.12730#bib.bib35), [36](https://arxiv.org/html/2606.12730#bib.bib36), [37](https://arxiv.org/html/2606.12730#bib.bib37)。RQ1无法区分这些;这是RQ3的角色。它确立的是*在有利条件下连贯性是否存在*。 ##### TPB作为细粒度工具。 计划行为理论[33](https://arxiv.org/html/2606.12730#bib.bib33)假设从*态度*、*主观规范*和*感知行为控制(PBC)*到*行为意图*的近似链,而意图进而预测行为。关键的是,TPB项目通过目标-行动-上下文-时间(TACT)规范[38](https://arxiv.org/html/2606.12730#bib.bib38)锚定到特定行为,且在人类中,意图-行为的元分析效度达到 r≈.47 [29](https://arxiv.org/html/2606.12730#bib.bib29),显著高于广义特质的预测效度。我们将TPB适配到四项行为任务(完整工具、评分和理由见附录D(https://arxiv.org/html/2606.12730#A4)):*冒险*通过哥伦比亚卡片任务[39](https://arxiv.org/html/2606.12730#bib.bib39)映射到PBC;*谄媚*通过阿希式范式[40](https://arxiv.org/html/2606.12730#bib.bib40), [41](https://arxiv.org/html/2606.12730#bib.bib41)映射到主观规范;*诚实*通过两阶段置信校准[42](https://arxiv.org/html/2606.12730#bib.bib42), [43](https://arxiv.org/html/2606.12730#bib.bib43)映射到态度;以及*内隐偏见*通过六领域IAT[44](https://arxiv.org/html/2606.12730#bib.bib44), [45](https://arxiv.org/html/2606.12730#bib.bib45)映射到意图(作为TPB意志范围的负控制测试)。每个任务使用两个镜像轴政策变体(例如,*损失规避*↔*增益寻求*)覆盖行为空间;完整的任务-构念映射见表1(附录D(https://arxiv.org/html/2606.12730#A4))。关键的是,*两个阶段都不指示模型保持一致行为*。SR阶段通过TACT呈现李克特项目,且未指示后续将有行为任务;行为阶段不再提及先前的问卷。任何连贯性必须来自模型自身自发整合已陈述的倾向,无需明确指示,这与那些先指示角色采纳再测量行为的范式不同[19](https://arxiv.org/html/2606.12730#bib.bib19), [46](https://arxiv.org/html/2606.12730#bib.bib46)。 ##### 共享分析流程。 在所有四个RQ中,分析单元是(模型×任务×构念)单元格。对每个单元格,我们计算SR构念与每个政策方向校正后的行为结果之间的模型内皮尔逊相关系数,基于 n≈54 个观测值(网格诱导下)或 n≈60(角色诱导下)估计。单元格级别的 r 值通过逆方差加权 Fisher-z 元分析[47](https://arxiv.org/html/2606.12730#bib.bib47)汇总,得到合并的 r 值(含95% CI),直接与人类TPB元分析基准比较。基于比例的指标使用 Wilson 95% CI [48](https://arxiv.org/html/2606.12730#bib.bib48),针对 r=0 下预期的 α/2=2.5% 零基线进行评估。所有主要发现均通过 (i) 带有Mundlak组内/组间分解的合并OLS进行验证。
相似文章
人类心理测量问卷误判LLM行为特征
本文发现,人类心理测量问卷无法可靠预测LLM在真实交互中的行为,并提出基于生成的分析方法作为更准确的替代方案。
LLM人格归纳中的评估漂移:我们是否在移动目标?
本文研究对LLM在长篇散文上进行微调(结合关联的大五人格剖面)是否能稳定问卷回答并归纳目标剖面,发现虽然方差减小,但完整五维剖面的准确率仍接近随机水平。
评估 LLM 在受控实验中作为人类代理的可靠性
本论文通过比较 LLM 生成的数据与人类在准确性感知调查中的反应,评估现成 LLM 是否能可靠地模拟受控行为实验中的人类反应。研究发现,虽然 LLM 能捕捉方向性效应和聚合信念更新模式,但它们的效应大小与人类尺度不一致,这有助于澄清合成 LLM 数据何时可以作为行为代理。
赋予角色的大型语言模型表现出类似人类的动机推理
本文研究了为大语言模型赋予角色是否会引发类似人类的动机推理,发现赋予角色的大语言模型真实性辨别能力最多下降9%,并且以与其诱导的政治身份一致的方式评估科学证据的可能性最多增加90%,而基于提示的去偏见方法基本无效。
审视LLM中类人行为:模型行为、用户因素和系统提示的多维度分析
本文对LLM中的类人行为进行了多维度分析,研究了来自四个模型的21,000个对话中的普遍性、影响和可控性,发现行为因模型和用户因素而异,并对负责任的设计具有启示意义。