评估人类和大型语言模型中的心理化能力

arXiv cs.AI 论文

摘要

该研究使用计算建模和经济博弈评估大型语言模型中的心理化能力,发现像GPT-5这样的模型展现出能够超越人类表现的适应性推理。

arXiv:2608.26291v1 Announce Type: new 摘要: 心理化是指推断他人信念和意图以指导自身选择的能力,是支撑人类社会互动的关键认知功能。大型语言模型 (LLMs) 在心智理论任务上表现出与人类一致的行为,但这些模型是否能通过心理化指导适应性行为尚不清楚。在此,我们使用两个经济博弈结合认知计算建模,揭示LLMs中心理化的潜在策略。我们测试了来自四个模型家族的单个LLM代理:DeepSeek、GPT-4.1、GPT-5和Gemini 2.0 Flash(N = 2,099),对手具有不同程度的复杂性,并考察了旨在引发策略性推理的提示策略是否提升了性能。我们将结果与人类参与者(N = 251)作为比较基准进行了对比。在两个博弈中,LLMs均显示出清晰的心理化行为和计算特征,这些特征因模型提供者和规模而有显著差异。策略性提示通常通过引发更复杂的推理来提升性能,但其益处程度在两个任务中有所不同。最后,GPT-5代理灵活地调整其递归推理深度以应对日益复杂的对手,表现出优于人类参与者的性能。总之,我们展示了LLMs中心理化能力的不同,并强调认知计算建模是评估人类与机器比较智能的正式方法。
查看原文
查看缓存全文

缓存时间: 2026/08/28 09:34

# 人类与大型语言模型的心智化能力评估  
来源:https://arxiv.org/html/2608.26291 2026年8月26日  

## 人类与大型语言模型的心智化能力评估  
Aamir Sohail https://orcid.org/0009-0000-6584-45791,2,3\*,Xintong Zhong4,Arkady Konovalov https://orcid.org/0000-0002-9448-66591,2,Patricia L\. Lockwood https://orcid.org/0000-0001-7195-95591,2,3,5,6,Lei Zhang https://orcid.org/0000-0002-9586-595X1,2,3,5\*  

1 英国伯明翰大学人类脑健康中心,伯明翰,英国  
2 英国伯明翰大学心理学院,伯明翰,英国  
3 英国伯明翰大学心理健康研究所,伯明翰,英国  
4 美国弗吉尼亚理工大学心理学系,布莱克斯堡,美国  
5 英国伯明翰大学发展科学中心,伯明翰,英国  
6 英国牛津大学实验心理学系,牛津,英国  

\* 通讯作者邮箱:[email protected][email protected]  

## 摘要  
心智化——推断他人信念和意图以指导自身选择的能力——是支撑人类社会互动的关键认知功能。大型语言模型在心智理论任务中表现出与人类一致的行为,但这些模型能否通过心智化引导适应性行为仍属未知。本研究采用两项经济博弈与认知计算建模,揭示大型语言模型心智化背后的潜在策略。我们测试了来自DeepSeek、GPT-4.1、GPT-5和Gemini 2.0 Flash四大模型系列的独立LLM智能体(N = 2,099),使其与不同复杂程度的对手对战,并探究旨在激发策略推理的提示策略是否能提升表现。同时将结果与人类参与者(N = 251)作为对比基准。在两项博弈中,大型语言模型均表现出清晰的心智化行为与计算特征,且这些特征因模型提供商和规模不同而存在显著差异。策略性提示通常通过诱发更复杂的推理来提升表现,但其收益程度在两项任务中存在差异。最后,GPT-5智能体能够灵活调整递归推理深度以应对日益复杂的对手,其表现优于人类参与者。综合而言,本研究揭示了不同大型语言模型在心智化能力上的差异,并凸显认知计算建模作为评估人类与机器比较智能的规范化方法。  

**关键词**:心智化,大型语言模型,人工智能,计算建模  

## 正文  
心智化是一种将他人行为解读为潜在心理状态、信念和情感结果的认知过程\[\[ref-fonagy2018\]–\[ref-freeman2016\]\]。在人类中,心智化通过预测他人行为并相应调整自身选择,塑造社会情境下的决策过程\[\[ref-apperly2012\]–\[ref-tamir2018\]\]。现有证据也表明,部分非人物种(包括犬类、鸦科动物、黑猩猩和大猩猩)存在心智化能力\[\[ref-berke2025\]–\[ref-taylor2014\]\],这反映了社会智能的进化能力。除人类和其他动物外,近期重要发展议题之一在于生成式人工智能系统(如大型语言模型)是否展现出与心智化一致的行为。研究者借鉴心理学、认知科学和神经科学领域的实验方法,探究大型语言模型的行为特征与推理能力\[\[ref-brady2025\]–\[ref-zador2023\]\]。通过将行为任务转化为文本提示,通常用于人类参与者的评估方法可直接应用于大型语言模型,从而在选择的表面测量之外提供更深入的计算洞见\[\[ref-binz2023\]–\[ref-sucholutsky2025\]\]。尽管大型语言模型是基于大量文本数据训练的神经网络\[\[ref-vaswani2017\]\],但其展现出与人类推理和决策相似的涌现特性\[\[ref-brady2025\],\[ref-binz2023\],\[ref-abdulhai2023\]–\[ref-yax2024\]\]。  

在人类中,心智化传统上通过基于角色的任务进行评估,这类故事要求推断虚构角色的信念\[\[ref-wellman2001\],\[ref-wimmer1983\]\]。大型语言模型同样能够正确解读心理状态并建议恰当行动,通常在此类任务中达到或超越人类水平\[\[ref-bubeck2023\]–\[ref-zhou2023\]\]。然而,大型语言模型在这些评估的简单变体中表现失败\[\[ref-ullman2023\]\],且在需要复杂推理和规划的心智理论任务中表现欠佳\[\[ref-saritas2025\],\[ref-attanasio2024\],\[ref-moore2025\]\],这引发质疑:其成功究竟反映真实心智化还是浅层启发式策略\[\[ref-marchetti2025\]–\[ref-shapira2023\]\]。因此,近期有观点认为,常用的基于角色的任务可能不适合评估复杂认知过程\[\[ref-marchetti2025\]\],因其仅描述行为的表层元素\[\[ref-holtzman2025\]–\[ref-wagner2025\]\],而这些元素可能无需显式、类人的心智状态模拟即可解决\[\[ref-lu2025\]\]。故而,人类与大型语言模型的选择行为虽可能相同,却未必反映相同的推理或认知过程\[\[ref-hu2025\],\[ref-ku2025\],\[ref-blank2023\],\[ref-connell2024\]\]。  

与基于故事的评估相比,经济博弈通过检验特定的行为与计算机制,为评估策略性社会行为提供了正式方法\[\[ref-camerer2003\]–\[ref-zhang2020a\]\]。在这些博弈中,参与者直接参与互动而非作为第三方观察者,常被要求智胜对手(如监察博弈\[\[ref-hampton2008\]\])。重要的是,该情境允许研究者通过实验操控对手的推理深度,测试不同层次的递归心智化。在此框架下,玩家可能尝试估算对手的历史选择分布并形成一阶信念;若预期自身行为被追踪,则形成二阶信念,并根据对手反应调整策略\[\[ref-konovalov2026\],\[ref-camerer2004\],\[ref-devaine2014\]\]。相应地,此推理过程还可达到更高层次。  

经济博弈传统上用于评估人类参与者行为,近期已被用于客观测量大型语言模型中的特定偏见与决策模式\[\[ref-brady2025\],\[ref-binz2023\],\[ref-abdulhai2023\]–\[ref-sun2025a\],\[ref-yax2024\],\[ref-brookins2024\]–\[ref-zhang2024\]\],这些模式展现了深思熟虑思维的涌现特性。此外,大型语言模型在这些任务中的表现常通过针对性提示策略(如链式思考CoT)得到提升\[\[ref-chen2025a\]–\[ref-wei2022\]\],此类策略旨在诱发类人的逐步推理\[\[ref-akata2025\],\[ref-yax2024\],\[ref-anglin2025\]–\[ref-schoenegger2025\]\]。在人类中,选择行为可通过认知计算建模进行形式化分析,这是一种理论驱动的量化方法,将潜在认知过程与计算参数归因于观测行为\[\[ref-farrell2018\]–\[ref-wilson2019\]\]。在动态社会行为情境中,这些参数还可通过逐次试验评估,以揭示认知的时间模式。关于心智化,计算模型已揭示人类具备递归心智化能力\[\[ref-hampton2008\],\[ref-hill2017\]\],且能根据推断的对手策略动态调整递归深度,即*自适应*心智化\[\[ref-buergi2026\]\]。  

认知模型还提供了跨物种行为的机制化形式表达\[\[ref-redish2021\],\[ref-robbins2019\]\],仅需选择数据即可推断认知过程。因此,计算建模近期在人工智能和大型语言模型研究中被推崇为一种从观测选择推断AI系统内部过程的正式方法\[\[ref-palminteri2025\],\[ref-taschereau-dumouchel2026\]\]。例如,该方法通过拟合强化学习模型,揭示了大型语言模型中学习偏见背后的潜在参数\[\[ref-coda-forno2024\]–\[ref-schubert2024\]\]。迄今,尽管对发展“类人”机器智能的兴趣日益增长\[\[ref-lake2017\],\[ref-collins2024\]\],但尚未有研究采用策略性博弈对人类与大型语言模型的心智化能力进行比较评估。  

本研究中,我们采用两项常用经济博弈——监察博弈与石头剪刀布——揭示大型语言模型递归心智化的行为特征与潜在参数。我们纳入多个流行大型语言模型作为实验参与者(总N = 2,099),并检验简单提示策略“社会链式思考”对大型语言模型在经济博弈中表现的提升效果(该策略此前已被证实有效\[\[ref-akata2025\]\])。同时,我们将大型语言模型在两项任务中的表现与人类参与者(总N = 251;平均年龄24.48 ± 3.81岁;范围18–36)进行对比,分析人类与大型语言模型在递归心智化上的差异。通过此举,我们超越了传统描述性评估,为机器智能提供了更规范的理解。  

## 结果  
为开展研究,我们选择了两项常用于评估人类策略性博弈的重复互动游戏:监察博弈和石头剪刀布。为评估递归心智化,我们采用监察博弈\[\[ref-hampton2008\],\[ref-hill2017\]\]——一种重复非合作博弈,两名玩家分别扮演“雇员”与“雇主”角色,在同时做出两种选择之一后获得收益(图1a)。每次试验中,雇员选择“工作”或“偷懒”,雇主选择是否“检查”雇员。在我们的版本中,参与者(即人类/大型语言模型)始终扮演雇员角色。收益矩阵设定使参与者通过适应对手的预期选择获得点数。参与者与计算机算法(指定为雇主,运行在k=2阶信念水平)对战,该算法在任务过程中根据参与者的预期进行自适应选择。因此,总收益反映参与者的递归推理能力。  

我们还测试了参与者的*自适应*心智化能力——即灵活调整递归心智化水平以应对不同复杂程度对手的能力。为此,我们采用此前用于人类参与者的零和石头剪刀布博弈\[\[ref-buergi2026\]\]。与监察博弈(在所有试验中与固定算法对战)不同,石头剪刀布博弈中的参与者与按特定推理水平k(k∈ {0, 1, 2})编程选择的算法对战。每次试验中,参与者获胜得1分,失败失1分,平局得0分。参与者与每个k水平进行40次试验(3个区块共120次试验),区块在参与者间随机化并平衡(图1b)。数据同时从人类参与者(监察博弈:n = 67;石头剪刀布:n = 184)和大型语言模型(监察博弈:所有组n ≥ 49;石头剪刀布:所有组n ≥ 188;详见方法部分)收集。两项任务中的人类参与者均被告知将与真实他人对战,但实际与相应计算机算法对战。监察博弈的人类数据通过线下收集,石头剪刀布数据在线收集(详见方法部分)。任务被适当重编码为文本格式以用于大型语言模型的API推理(详见方法/补充材料)(图1c)。转换后的任务保留了相同的收益规则、对手配置和试验长度,但由于大型语言模型表现出...

相似文章

赋予角色的大型语言模型表现出类似人类的动机推理

arXiv cs.CL

本文研究了为大语言模型赋予角色是否会引发类似人类的动机推理,发现赋予角色的大语言模型真实性辨别能力最多下降9%,并且以与其诱导的政治身份一致的方式评估科学证据的可能性最多增加90%,而基于提示的去偏见方法基本无效。