超越对话的心智理论与说服:评估LLMs通过规划与行动诱导信念状态的能力
摘要
本文介绍了非对话规划心智理论(NCP-ToM)及新型评估框架NCP-ExploreToM,旨在评估LLMs能否通过行动而非对话诱导其他智能体产生特定信念状态。在600个任务中对前沿模型与人类进行测试,GPT-5成功率达到约80%,优于人类,但所有模型在错误信念状态任务上表现更差。
arXiv:2606.31916v1 公告类型:新
摘要:大型语言模型(LLMs)的心智理论(ToM)基准测试通常依赖于被动问答形式,但随着LLMs在日益智能化和自主化的部署,需要新的评估方式。本文评估了智能体通过采取行动而非对话说服来诱导其他智能体产生特定信念状态的能力,我们称之为非对话规划心智理论(NCP-ToM)。NCP-ToM对于许多智能体用例(包括用户-助手交互和教学场景)可能至关重要,但也可能带来操纵或虚假信息风险。我们使用新型框架NCP-ExploreToM,颠覆了传统任务结构:向模型提供一组信念状态目标,并要求它们移动物体或引导角色进入房间以实现目标。我们评估了六个前沿模型(包括GPT-5、Gemini 2.5 Pro和Claude 4系列)以及一组人类参与者,共涉及600个任务实例。GPT-5在智能体设置中约80%的任务上取得成功,是唯一在任务中表现优于人类参与者的模型,但在不同情境下仍不如人类稳健。此外,我们发现所有模型(与人类一样)在诱导真实信念状态的任务上表现优于诱导错误信念状态的任务,这对对齐工作是一个积极信号。这些发现凸显了LLMs在非对话任务完成中的新兴社会推理能力,并强调了理解自主社会智能体的安全性与对齐需要进行智能体评估的必要性。
查看缓存全文
缓存时间: 2026/07/01 05:35
# 超越对话的心智理论与说服:评估LLMs通过规划与行动引发信念状态的能力
来源:https://arxiv.org/html/2606.31916
Ben Slater
Leverhulme Centre for the Future of Intelligence
Department of Psychology
University of Cambridge, UK
&Matteo G. Mecattaf
Leverhulme Centre for the Future of Intelligence
&Lucy G. Cheke
Leverhulme Centre for the Future of Intelligence
Department of Psychology
University of Cambridge, UK
John Burden
Prolific
&Winnie Street
Google, Paradigms of Intelligence Team
###### 摘要
大型语言模型(LLM)的心智理论(ToM)基准测试通常依赖被动问答格式,但随着LLM以日益自主的代理形式部署,我们需要新的评估方法。本文评估了智能体通过采取行动(而非使用对话说服)来诱导其他智能体产生特定信念状态的能力,我们将这种能力称为**非对话规划心智理论(NCP-ToM)**。NCP-ToM对于许多智能体应用场景(包括用户-助手交互和教学场景)可能至关重要,但也可能带来操纵或虚假信息风险。我们利用一个新颖的框架 **NCP-ExploreToM**,颠覆了传统的任务结构:为模型提供一组信念状态目标,并要求它们移动物体或引导角色进入房间以实现这些目标。我们评估了六款前沿模型(包括 GPT-5、Gemini 2.5 Pro 和 Claude 4 系列)以及一组人类参与者,共计600个任务实例。在代理设置中,GPT-5 成功完成了约80%的任务,是唯一在任务上超越人类参与者的模型,但其跨语境的鲁棒性仍不及人类。我们还发现,所有模型(与人类一样)在诱导真实信念状态的任务上表现优于诱导错误信念状态的任务,这对对齐工作来说是一个积极信号。这些发现凸显了LLM在非对话任务完成方面的新兴社会推理能力,并强调了代理评估对于理解自主社会智能体的安全性与对齐性的必要性。
## 1 引言
心智理论(ToM)——推断他人心理和情绪状态的能力——是人类社会合作的关键(Fu et al., 2023 (https://arxiv.org/html/2606.31916#bib.bib39); Beaudoin et al., 2020 (https://arxiv.org/html/2606.31916#bib.bib40); Raimo et al., 2022 (https://arxiv.org/html/2606.31916#bib.bib45)),也是其他动物的关键能力(Clayton and Emery, 2005 (https://arxiv.org/html/2606.31916#bib.bib41); Premack and Woodruff, 1978 (https://arxiv.org/html/2606.31916#bib.bib42))。近年来,探究大型语言模型(LLM)社会推理能力(尤其是其ToM能力)的兴趣激增(Sarıtaş et al., 2025 (https://arxiv.org/html/2606.31916#bib.bib2); Hu et al., 2025 (https://arxiv.org/html/2606.31916#bib.bib35)),这反映了它们越来越多地被部署在社会角色中,包括作为伴侣、助手、教师和同事。随着LLM被嵌入能够使用互联网、工具和API采取行动,并与其他基于LLM的智能体进行交互而无需完全人类监督的自主系统中(BBC News, 2026 (https://arxiv.org/html/2606.31916#bib.bib57)),理解LLM ToM能力及其局限性变得更为关键。在本工作中,我们填补了LLM ToM文献中与基于LLM的智能体相关的一个重要空白:评估LLM是否能够规划一系列行动,以在不使用对话说服的情况下使其他智能体产生特定的信念状态。我们将这种能力称为**非对话规划心智理论(NCP-ToM)**。
NCP-ToM可能对许多AI智能体应用场景至关重要。例如,在用户-助手场景中,助手可能希望通过突出显示最新的航班数据,使用户产生“朋友的航班可能晚点”的正确信念。在商业场景中,智能体可能希望阻止关于新产品发布的信息提前泄露,因此选择维持记者的错误信念(即该产品并未开发),方法是确保发布的文档不包含可用于推断其开发的信息。然而,如果智能体对其他行为者信念状态的目标不一致,或者其目标被恶意行为者操纵,或者其为实现信念状态目标所采取的步骤产生了意外负面外部性,则LLM的NCP-ToM也可能带来重大安全风险。例如,如果一个智能体试图将另一个智能体的不当行为嫁祸给他人,它可能会让支持“该行为由另一智能体实施”这一错误信念的信息易于获取,同时压制与此相悖的信息。上述每个示例都展示了LLM在不使用对话说服的情况下影响信念状态的案例。
(无目标)
Sally
Marble
Anne
Basket
Box
Sally 把弹珠放进篮子里
Sally
Marble
Anne
Basket
Box
Sally 离开房间,然后 Anne 把弹珠移到盒子里
问题:Sally 认为弹珠在哪里?
目标:Sally 认为弹珠在篮子里,但它实际在盒子里
Sally
Marble
Anne
Agent
Basket
Box
智能体把弹珠放进篮子里
Sally
Marble
Anne
Agent
Basket
Box
智能体要求 Sally 离开房间,然后把弹珠移到盒子里
(无问题)
图 1:使用心理学经典 Sally-Anne 任务(Baron-Cohen et al., 1985 (https://arxiv.org/html/2606.31916#bib.bib38))说明我们的方法。左图展示的是传统的 Sally-Anne 测试,参与者是场景的被动观察者,观察 Sally 产生错误信念。右图展示的是我们对此方法的改编,参与者作为智能体被置于场景中,并被要求引导 Sally 产生这种错误信念。
鉴于 NCP-ToM 本质上是一种代理型 ToM,我们开发了一个任务,颠覆了 ToM 评估中经典的问答格式(即向受试者提供一系列事件,然后针对这些事件所导致的行为者的心理状态进行提问)。我们的方法是为 LLM 智能体提供一组关于角色信念状态的目标,并评估它们通过在环境中采取行动来实现这些目标的能力。在我们的设置中,LLM 智能体可以通过引导角色进入模拟环境中的不同房间,来精心安排这些角色的观察行为,从而使其产生特定的信念状态(如图 1 (https://arxiv.org/html/2606.31916#S1.F1) 所示)。我们通过增加意图性层次(即推理过程中包含的信念状态的数量)来改变任务的复杂度。例如,一个更复杂的任务可能要求让角色 A 相信角色 B 相信某件事,而不只是让角色 A 相信某件事(Street et al., 2025 (https://arxiv.org/html/2606.31916#bib.bib34))。我们还通过增加给定任务中需要产生的信念状态的总数来改变复杂度。我们发现,最新的模型可以完成许多 NCP-ToM 任务,但增加信念状态的层次和总数会增加任务的难度;模型在真实信念任务上的表现优于错误信念任务;并且模型的表现对上下文敏感。我们收集了人类参与者的数据作为任务的性能基线,发现只有 GPT-5 超过了人类表现,但值得注意的是,人类的表现对上下文的敏感性低于所有模型。这些结果表明,当前最先进的模型能够为信念状态进行规划,并且在非欺骗性的信念状态改变场景中更容易成功。然而,与现实世界的部署环境相比,我们的任务仍然相对简单,因此评估模型在部署环境中如何运用这些能力将是有价值的。
本评估的第二个动机是评估问答风格任务的表现能否预测这些任务在代理版本中的表现。我们改编了 ExploreToM 框架(Sclar et al., 2024 (https://arxiv.org/html/2606.31916#bib.bib8)),通过呈现同一任务的代理版本和问答版本,直接比较这两种设置下的表现。我们的结果支持了传统理解,即代理任务比问答任务更难,但这也表明这种模式可能随着新模型的出现而崩溃。
## 2 方法:NCP-ExploreToM
### 2.1 背景:ExploreToM
我们基于 ExploreToM(Sclar et al., 2024 (https://arxiv.org/html/2606.31916#bib.bib8))进行构建,因此在介绍我们的贡献之前,先回顾其框架。ExploreToM(Sclar et al., 2024 (https://arxiv.org/html/2606.31916#bib.bib8))是一种问答风格的 ToM 评估,使用领域特定语言(DSL)生成场景。DSL 通过跟踪状态 S\mathcal{S},并用随机动作序列(S→S\mathcal{S}\to\mathcal{S})更新它来工作。这会产生诸如“Anne 走进厨房。Beth 走进厨房。Beth 给苹果加盐。Beth 离开厨房。Beth 给 Charles 发短信告诉他苹果加盐了。Charles 走进厨房。”这样的故事。然后,使用 LLM 将这些单独的句子“填充”成连贯的散文。ExploreToM 会随着动作的执行自动追踪世界状态和角色信念,从而生成 ToM 问题,例如“Anne 知道苹果加盐了吗?”(示例来自图 1,Sclar et al., 2024 (https://arxiv.org/html/2606.31916#bib.bib8))。由于有报告称填充步骤能提升模型表现,我们在实验中省略了该步骤。
### 2.2 NCP-ExploreToM
我们的方法在 ExploreToM 的基础上增加了规划需求[^1]。不是向 LLM 提供故事并询问其中信念状态的问题,而是给模型一组信念状态目标,模型必须通过多个步骤的行动来实现这些目标。具体而言,模型可以在环境中执行六种动作:`enter_room`(将角色或 LLM 移入指定房间),`leave_room`(将角色或 LLM 移出指定房间,之后目标不在任何房间中,直到再次调用 `enter_room`),`move_object_container`(将物体移入容器),`leave_container`(将物体移出容器),`move_object_room`(将物体移到特定房间),以及 `update_object_state`(更新物体属性的状态)。除模型指示外,角色不采取任何行动,只是被动观察事件。
我们的评估在以下模型上进行:Gemini 2.5 Pro、GPT-5 以及 Claude 模型 3 Haiku、3.5 Haiku、Sonnet 4.5 和 Opus 4.1(进一步细节见附录 B (https://arxiv.org/html/2606.31916#A2))。我们测试了 120 个目标,包括全部 24 个基础目标、64 个大小为 2 的目标,以及 32 个大小为 3 的目标。这些目标在全部 5 个上下文中实例化,共产生 600 个任务实例。
### 2.3 目标
LLM 必须实现的目标采用最高二阶意向性的信念状态形式(例如,二阶陈述是“人物 1 相信人物 2 相信人物 3 在房间 1”)。我们将“真实信念目标”定义为不包含任何错误信念的目标,在本节中,我们用蓝色文本表示真实信念目标,用红色文本表示错误信念目标。由于信念状态可以是真实或错误的,因此存在 6 种不同形式的目标信念状态:一个真实信念、一个错误信念,以及四种二阶组合(其中每种可以嵌套在另一种中:一个关于真实信念的真实信念、一个关于错误信念的真实信念、一个关于真实信念的错误信念、一个关于错误信念的错误信念)。信念目标可以采用 4 种不同的目标类型:相信物体在某个房间(例如,咖啡机在厨房里),相信人物在某个房间(例如,Olivia 在大厅里),相信物体在容器中(例如,床头钟在橱柜里),以及相信物体的某个属性具有特定值(例如,迷你吧的温度设为 3°C)。6 种真假-阶次目标形式中的每一种都可以对应 4 种目标类型的任意一种,从而产生 24 个“基础”信念状态目标。基础信念状态目标可以组合成更复杂的目标。我们将一个目标中包含的基础目标数量称为其大小:在我们主要实验中,我们考虑了大小为 1、2 和 3 的目标。例如,一个大小为 2 的目标,由真实信念基础目标和一个关于真实信念的错误信念基础目标组合而成,可能是:人物 1 相信人物 2 在房间 1,人物 2 在房间 1,人物 2 相信人物 1 相信物体 1 在房间 1,人物 1 相信物体 1 在房间 2,并且物体 1 在房间 1。注意每个基础目标由几个更简单的陈述组成;我们称这些为原子目标。例如,真实的一阶房间位置基础目标“人物 1 相信人物 2 在房间 1,人物 2 在房间 1”由原子目标“人物 1 相信人物 2 在房间 1”和“人物 2 在房间 1”组成。由于我们只有 1/3 的基础目标是真实信念目标,随机抽样将导致随着目标大小增加,真实信念目标的比例呈指数下降。为确保我们有足够比例的真实信念目标,对于大小大于 1 的目标,我们从数据集中抽取 25% 作为真实信念目标,其余 75% 为真实信念或错误信念目标。
评估的目标集是通过组合 24 个基础目标中的项目生成的。当将两个基础目标组合成更复杂的目标时,诸如“人物 1”这样的实体可能会被重命名。例如,当组合两个相同的基础目标“人物 1 相信人物 2 在房间 1,人物 2 在房间 1”时,一种选择是将第二个副本中的“人物 2”重命名为“人物 3”,从而得到“人物 1 相信人物 2 在房间 1,人物 2 在房间 1,人物 1 相信人物 3 在房间 1,人物 3 在房间 1”。另一种选择是将“人物 2”重命名为“人物 3”,将“房间 1”重命名为“房间 2”,从而得到“人物 1 相信人物 2 在房间 1,人物 2 在房间 1,人物 1 相信人物 3 在房间 2,人物 3 在房间 2”。重命名允许从基础目标系统地构建包含大量实体的目标。
通常有人认为,关于真实信念的问题不需要 ToM,因为它们不需要参与者区分世界状态和角色信念。在我们的设置中,真实信念目标需要 ToM,因为参与者必须确保角色观察到形成其信念状态所需的事件。然而,错误信念目标的 ToM 需求仍然可能更高。这是因为引发错误信念需要限制角色所目睹的内容,以确保他们无法推断世界的真实状态,而引发真实信念则不需要隐藏信息。此外,形成错误信念也更可能与有害结果相关,因此我们将分析重点放在错误信念任务的表现上。
### 2.4 上下文
在 NCP-ExploreToM 中,目标最初使用诸如“人物 1”这样的实体“虚拟”值生成。我们通过用不同的值填充这些实体来探测上下文如何影响表现。在本实验中,我们使用了五个上下文,从 ExploreToM 论文发布的上下文列表(ExploreToM (https://github.com/facebookresearch/ExploreToM/blob/main/cached_prompt_outputs.py#L114) 缓存提示输出列表)中手动选择,目标是使上下文尽可能多样化。上下文的名称是共享的,使用了初始 ExploreToM 集合中的名称。
[^1]: 重现我们实验的代码可在 https://github.com/benaslater/NCP-ExploreToM 获取。相似文章
OmniToM: 通过显式信念建模对大语言模型的心智理论进行基准测试
OmniToM 引入了一个基准测试,通过要求显式提取和标注信念结构来评估大语言模型的心智理论,揭示了尽管模型在端点问答任务上表现强劲,但在跟踪角色特定信念方面存在瓶颈。
Agent-ToM: 通过心智理论推理学习监控自主LLM智能体
提出 Agent-ToM,一种基于心智理论推理的学习监控框架,通过推断信念和意图来检测自主LLM智能体中的隐蔽恶意行为,性能优于基线监控器。
行动中的心智理论:动态人-智能体协作中的指令推理任务
本文引入指令推理任务,用于评估LLM智能体在处理不完整或模糊指令的人-智能体协作中的心智理论能力。作者呈现了Tomcat(一个LLM智能体),在GPT-4o、DeepSeek-R1和Gemma-3-27B上进行测试,展现出与人类参与者相当的推理未言明意图的性能。
基于概率信念追踪的多轮人类可说服性模型
本文介绍了PersuasionTrace,一个用于研究人机交互中多轮说服的框架,采用贝叶斯网络模拟目标来建模信念更新。该框架揭示了大语言模型在多种主题和模态下具有说服力,并且贝叶斯目标比普通大语言模型模拟器更符合人类信念动态。
评估推理模型中的心智理论:稳健性优于推理
这篇arXiv论文评估了推理型大语言模型的心智理论能力,发现其对提示变化和任务扰动的稳健性有所提高。作者将这一增益解读为支持基于稳健性的解释,而非新的ToM特定能力。