MeetingToM:在多参与者会议中评估多模态大语言模型的心智理论推理

arXiv cs.CL 论文

摘要

介绍MeetingToM,这是一个用于评估多模态大语言模型在多参与者会议中进行心智理论推理的基准,包含个体、二元和群体层面的任务,包括伪共识检测。

arXiv:2607.19235v1 公告类型:新 摘要:心智理论(Theory of Mind, ToM)是指推断他人信念、意图和知识状态的能力,对社会互动至关重要,但对于当前的多模态大语言模型(MLLMs)仍然具有挑战性,尤其是在多参与者会议中,线索分散在言语和行为之中。现有的多模态ToM基准主要关注基于视频的问答,涉及公开的、外部可验证的信号,对潜在社会状态和群体动态的覆盖有限。我们提出了MeetingToM,这是一个用于在自然的多参与者会议中进行复杂社会行为推理的基准。MeetingToM针对会议特有的现象,如\textbf{伪共识},即表面的同意掩盖了社会压力下的私下异议。该基准按层级组织,用于评估社会粒度逐渐增加的ToM,包括:(i) 个体层面的心理状态预测,(ii) 二元层面的受话者理解,以及 (iii) 群体层面的共识推理。我们提供了统一的评估协议,并对代表性MLLMs进行了系统分析,揭示了它们在整合非言语线索、推断隐藏态度以及区分真实共识与伪共识方面持续存在的局限性。我们的结果突出了关键挑战,并将MeetingToM确立为推进多模态模型中基于会议的ToM的测试平台。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:25

# 1 引言

来源:https://arxiv.org/html/2607.19235

\meowtitle MeetingToM:评估多模态大语言模型在多方会议中的心理理论推理能力

\meowauthors 王紫怡\affmark1\equalcontrib 吴宇航\affmark1\equalcontrib 朴东旭\affmark1 刘星宇\affmark1 周天慧\affmark2 刘淼\affmark1\corrauth

\meowaffiliation
\affmark1 清华大学人工智能学院
\affmark2 杜克大学生物统计与生物信息学系

\meowdate 2026年7月20日

\meowlinks
\meowlink 项目页面:https://oliviaziyi.github.io/MeetingToM-Project-Page/
\meowlink 代码:https://github.com/oliviaziyi/MeetingToM
\meowlink 数据集:https://huggingface.co/datasets/OliviaWang1101/MeetingToM11

\makemeowtitle

{meowabstract}
心理理论(Theory of Mind, ToM),即推断他人信念、意图和知识状态的能力,是社交互动的核心,但对于当前的多模态大语言模型(MLLMs)来说仍然具有挑战性,尤其是在多方会议中,线索分布在言语和行为之中。现有的多模态 ToM 基准主要集中在基于视频的问答上,侧重于明显、外部可验证的信号,对潜在的社会状态和群体动态的覆盖有限。我们引入了 MeetingToM,这是一个用于自然主义多方会议中复杂社会行为推理的基准。MeetingToM 针对会议特有的现象,例如伪共识,即表面上的同意掩盖了社会压力下的私下异议。该基准采用分层组织结构,以评估逐渐增加的社会粒度水平的 ToM,包括 (i) 个体层面的心理状态预测,(ii) 双人层面的受话者理解,以及 (iii) 群体层面的共识推理。我们提供了一个统一的评估协议,并对代表性 MLLMs 进行了系统分析,揭示了它们在整合非语言线索、推断隐藏态度以及区分真正共识与伪共识方面的持续局限性。我们的结果突出了关键挑战,并将 MeetingToM 确立为推进多模态模型中基于会议的 ToM 的测试平台。

人类在社交互动过程中会不断推断和更新自己及他人的信念、意图和知识状态。这种能力被称为心理理论(Theory of Mind, ToM),是社会行为推理的基础。先前的研究表明,ToM 具有情境敏感性 [60 (https://arxiv.org/html/2607.19235#bib.bib105)],目标、计划和社会规范会影响人们如何推理他人的信念状态。值得注意的是,这些情境因素在多方会议中尤为突出,参与者带着各自不同的目标、部分知识和社会约束参与其中。因此,我们试图探究会议场景中的计算心理理论。一个能够在这种设定下解释复杂社会状态的人工智能系统,将能够实现诸如协作决策支持和社会感知助手等实际应用。参见图注。

图 1:MeetingToM 基准中的分层结构化任务及伪共识示例。
MeetingToM 在三个层面评估基于会议的 ToM 推理能力:个体层面的心理状态、双人层面的受话者识别和态度推断,以及群体层面的共识推理。示例展示了伪共识,即社会压力下言语同意掩盖了非言语的异议。

随着多模态大语言模型(MLLMs)的出现,人们越来越有兴趣从多模态角度探究它们的心理理论能力,其动机在于信念和意图通常通过言语和非语言线索共同传达。现有的多模态 ToM 基准 [27 (https://arxiv.org/html/2607.19235#bib.bib17), 58 (https://arxiv.org/html/2607.19235#bib.bib18)] 主要强调基于视频的问答,通常侧重于明显、外部可验证的信号,而不是系统地测试在现实群体互动中展现出的微妙、潜在的社会状态。然而,多方会议为多模态 ToM 呈现了一个特别具有挑战性和重要性的场景。除了理解所说内容之外,模型还必须从言语和行为中梳理证据,包括话轮转换、凝视、姿势以及人们如何相互回应 [45 (https://arxiv.org/html/2607.19235#bib.bib76)],同时考虑礼貌和从众等规范。至关重要的是,会议中经常出现表面的同意掩盖了私下保留意见的情况:参与者可能会口头赞同提议,同时微妙地表达怀疑或不参与,而分歧可能仅通过后续行动或间接线索才变得明显。这些现象需要基准来明确评估模型能否推断隐藏的态度和群体层面的社会动态,包括那些仅仅是表面上的共识。为此,我们引入了 MeetingToM,一个用于评估 MLLMs 在自然主义多方会议中进行复杂社会行为推理能力的基准。考虑图 1 (https://arxiv.org/html/2607.19235#S1.F1) 中的示例。我们展示了一个案例,其中参与者 B 口头同意了另一位参与者,但他们的肢体语言却传递了不同的信息,随后的发言也揭示了潜在的担忧。这种社交现象,即在社会压力下表面同意掩盖了私下异议,与群体思维和从众效应密切相关 [25 (https://arxiv.org/html/2607.19235#bib.bib102)]。在 MeetingToM 中,我们将这种会议特有的表现称为伪共识。具体来说,我们的基准任务是分层组织的,对 ToM 能力的要求越来越高:

- • **个体层面心理状态预测**:从简短视频片段和对齐的发言中推断目标参与者的心理状态。
- • **双人层面受话者理解**:利用凝视和身体朝向线索识别“你”的指代对象,然后推断受话者的态度。
- • **群体层面共识推理**:确定群体的一致意见是真实的、反映伪共识还是不存在,并识别任何私下表示异议的参与者。

在我们的实验中,我们首先对专有和开源 MLLMs 进行了基准测试。然后我们分析了输入模态、思考提示、话语标记和上下文先验如何影响基于会议的社会状态理解。

## 2 相关工作

**会议场景中的社交智能。** 社交信号处理的早期研究旨在通过可观察的行为(如会话话轮交换、角色识别和支配层级建立)来量化群体动态 [67 (https://arxiv.org/html/2607.19235#bib.bib71), 45 (https://arxiv.org/html/2607.19235#bib.bib76)]。最近的研究已转向通过非语言线索建模更高层次的社交结构,如群体凝聚力 [54 (https://arxiv.org/html/2607.19235#bib.bib77), 35 (https://arxiv.org/html/2607.19235#bib.bib78)]。例如,[67 (https://arxiv.org/html/2607.19235#bib.bib71)] 通过韵律特征建模社交信号,而 [26 (https://arxiv.org/html/2607.19235#bib.bib79)] 利用视觉注意力推断支配性。最近,[44 (https://arxiv.org/html/2607.19235#bib.bib88)] 提出了一个多说话人注意力对齐框架,用于描述群体层面的融洽关系中的社交目标。然而,这些方法主要关注直接的行为信号,而没有推理内在的社交动态,比如在社会压力下掩盖私下分歧的伪共识 [3 (https://arxiv.org/html/2607.19235#bib.bib80), 66 (https://arxiv.org/html/2607.19235#bib.bib83)]。我们的基准通过引入识别会议场景中内部认知状态和复杂社交动态的新任务来弥补这一差距。参见图注。

图 2:MeetingToM 基准中分层任务的概览。
个体层面任务评估会议场景中的心理状态预测。双人层面任务评估受话者识别和人际态度推断。群体层面任务探究群体共识推理,包括共识质量评估和隐藏分歧的识别。这三个任务需要逐步丰富地整合言语和非语言线索,以进行多方互动中的社会推理。

**多模态社交 AI 基准。** 先前的多模态基准主要评估双人社交情感识别 [77 (https://arxiv.org/html/2607.19235#bib.bib81), 10 (https://arxiv.org/html/2607.19235#bib.bib82), 47 (https://arxiv.org/html/2607.19235#bib.bib86)]。代表性例子包括 Social-IQ [76 (https://arxiv.org/html/2607.19235#bib.bib19)],它针对的是野外的多模态社交问答,以及 SIV-Bench [31 (https://arxiv.org/html/2607.19235#bib.bib21)],它专注于社交场景、状态和动态上的交互推理。面向 ToM 的资源,如 MoMentS [66 (https://arxiv.org/html/2607.19235#bib.bib83)],强调以叙事为中心的心理状态推断,而 MM-Soc [28 (https://arxiv.org/html/2607.19235#bib.bib92)] 则针对社交情境下的在线多模态内容。2025 年引入的较新基准进一步推动了基于证据和多智能体的 ToM 推理:Social Genome [39 (https://arxiv.org/html/2607.19235#bib.bib93)] 评估了基于地面实况的社会推理,其包含人工标注的多模态交互推理轨迹;MuMA-ToM [58 (https://arxiv.org/html/2607.19235#bib.bib18)] 测试了从视频和文本上下文中进行的具身多智能体心理理论推理。会议语料库为多方专业协作提供了一个独特的测试平台,然而像 MISP 2025 [22 (https://arxiv.org/html/2607.19235#bib.bib123)] 这样的大规模资源主要局限于视听说话人日志。相比之下,我们的基准探究 MLLMs 的深度推理能力,涵盖个体层面的内部状态、双人层面的指代理解以及群体层面的共识推理。

**多方交互中的心理理论。** 心理理论(ToM)涉及推断和追踪潜在的心理状态,包括信念、意图和错误信念。早期的 NLP 工作主要通过基于故事问答(例如 ToM QA 数据集 [41 (https://arxiv.org/html/2607.19235#bib.bib84)])来评估 ToM,但后续分析表明,常见的设置可以通过利用数据集规律来解决 [34 (https://arxiv.org/html/2607.19235#bib.bib94)]。最近针对计算 ToM 的 LLM 基准主要集中在基于对话的问答上,强调高阶信念递归 [72 (https://arxiv.org/html/2607.19235#bib.bib14)]、更广泛的技能覆盖 [12 (https://arxiv.org/html/2607.19235#bib.bib13)] 以及包含个性和意图线索的长篇叙事 [73 (https://arxiv.org/html/2607.19235#bib.bib15)]。与人类比较的更广泛评估报告了显著的差距 [32 (https://arxiv.org/html/2607.19235#bib.bib26), 61 (https://arxiv.org/html/2607.19235#bib.bib27)],并激发了明确信念追踪和面向鲁棒性的评估 [55 (https://arxiv.org/html/2607.19235#bib.bib95), 57 (https://arxiv.org/html/2607.19235#bib.bib96)]。除了文本模态之外,ToM 越来越多地在基于视频的问答 [27 (https://arxiv.org/html/2607.19235#bib.bib17), 66 (https://arxiv.org/html/2607.19235#bib.bib83)]、需要信念更新的交互式对话 [49 (https://arxiv.org/html/2607.19235#bib.bib97), 75 (https://arxiv.org/html/2607.19235#bib.bib98)] 以及角色扮演或具身多智能体设置 [59 (https://arxiv.org/html/2607.19235#bib.bib87), 58 (https://arxiv.org/html/2607.19235#bib.bib18)] 中进行测试。我们的工作与多模态 ToM 建模的动机相同,特别关注会议场景,其中共同目标和任务驱动的参与者角色提供了先验信息,这些先验信息塑造了 MLLMs 如何建模参与者的内部状态。参见图注。

图 3:会议场景中参与者认知状态定义的示意图。
对于每个状态,我们展示了一个代表性的特写视图、简短的语义描述、典型的非语言线索(例如,面部表情、凝视和手势),以及(如果存在)示例话语。这些示例突出了细粒度的心理状态如何通过言语和非语言线索共同体现。

## 3 MeetingToM 基准

### 3.1 概述

我们引入了 MeetingToM,这是一个多模态基准,旨在评估 MLLMs 在自然主义多方会议场景中解释参与者信念状态的能力。我们的基准基于对现实世界会议的三个核心观察:(1) 参与者不断归因自己和他人的心理状态;(2) 指称表达需要联合建模话语上下文、说话者意图和参与者角色以进行指代消歧;(3) 表面上的群体共识可能施加社会压力,从而掩盖个体分歧。这些现象要求对视觉线索(如面部表情、手势和姿势)以及言语内容(如转录文本)进行综合推理。具体来说,MeetingToM 包含三个分层结构化的任务,心理理论(ToM)推理深度逐步增加:

- • 任务 1 针对**个体层面**的心理状态识别,使用多模态信号。
- • 任务 2 要求对指代意图和人际态度进行**双人层面**的理解。
- • 任务 3 要求进行关于共识和伪共识的**群体层面**推理。

在接下来的章节中,我们首先正式定义 MeetingToM 基准任务,然后详细介绍数据源和标注过程。

### 3.2 任务定义

#### 输入符号。

我们将 MeetingToM 形式化为一个多项选择视觉问答基准,要求模型根据从特定视角捕获的视频输入和伴随的会话话语选择正确的选项。我们将会话话语表示为 \(\mathcal{U}\),将视角 \(p\) 下的视频片段表示为 \(\mathcal{V}^{p}\),其中 \(p \in \{g, A, B, C, D\}\),\(g\) 表示全局视图,\(A\)–\(D\) 分别表示四位参与者的特写视图。我们还定义了一个马赛克视图 \(\mathcal{V}^{m}\),方法是将同步的特写视图 \(\{\mathcal{V}^{A}, \mathcal{V}^{B}, \mathcal{V}^{C}, \mathcal{V}^{D}\}\) 在空间上拼接成一个 \(2 \times 2\) 的四面板视频。

#### 任务 1:个体层面心理状态预测。

此任务评估模型在给定相应视频片段和话语的情况下,能否在短时间内识别每位参与者的心理状态。基于心理学和认知科学的先前工作 [4 (https://arxiv.org/html/2607.19235#bib.bib99)],我们定义了以下会议心理状态作为标注标签:

- • **积极参与**:积极主导或推动讨论 [30 (https://arxiv.org/html/2607.19235#bib.bib42)]
- • **支持性赞同**:表示同意或肯定 [18 (https://arxiv.org/html/2607.19235#bib.bib44)]
- • **专注倾听**:专注但中性地接收信息 [9 (https://arxiv.org/html/2607.19235#bib.bib48)]
- • **认知冲突**:经历不同意或怀疑 [16 (https://arxiv.org/html/2607.19235#bib.bib54)]
- • **困惑不解**:表现出困惑或不确定 [62 (https://arxiv.org/html/2607.19235#bib.bib49)]
- • **犹豫不决**:在回应或行动前停顿 [14 (https://arxiv.org/html/2607.19235#bib.bib58)]
- • **脱离退缩**:表现出低投入或注意力漂移 [30 (https://arxiv.org/html/2607.19235#bib.bib42)]

图 3 (https://arxiv.org/html/2607.19235#S2.F3) 展示了这些心理状态的视觉插图,详细定义包含在附录 A (https://arxiv.org/html/2607.19235#A1) 中。

给定

相似文章

多模态大语言模型评估中我们缺失了什么?

arXiv cs.AI

本文回顾了当前多模态大语言模型评估基准,找出了关键差距,如时空连贯性、物理世界理解、多模态一致性和选择性注意力,并指出现有的孤立任务基准无法衡量真正的跨模态整合。

评估推理模型中的心智理论:稳健性优于推理

arXiv cs.CL

这篇arXiv论文评估了推理型大语言模型的心智理论能力,发现其对提示变化和任务扰动的稳健性有所提高。作者将这一增益解读为支持基于稳健性的解释,而非新的ToM特定能力。