MultivationBench:多模态序列动机推理基准
摘要
介绍了MultivationBench,这是一个基于马斯洛需求层次和赖斯基本欲望的故事驱动视觉叙事,用于评估多模态大语言模型序列动机推理能力的基准。结果表明,所有测试模型在动态动机推断方面均表现不佳。
arXiv:2607.26465v1 公告类型:新
摘要:多模态大语言模型因其社交智能潜力而引起了广泛关注;然而,它们执行序列动机推理的能力仍未得到充分研究。现有评估主要考察静态文本或孤立的视觉快照,这无法反映现实世界行为驱动因素的累积性。为弥补这一空白,我们提出了MultivationBench,这是一个专门用于在故事驱动的视觉叙事中严格评估多模态动机推理的基准。该基准建立在成熟的心理学框架——马斯洛需求层次和赖斯基本欲望——之上,要求模型整合累积的多模态上下文来推断不断演变的动机。结果表明,MultivationBench带来了巨大挑战:所有测试模型都难以在序列上下文中保持一致的动机推理,揭示了静态识别能力与人类般社会理解所必需的动态推理之间的关键脱节。
查看缓存全文
缓存时间: 2026/07/31 04:00
# MultivationBench:多模态序列动机推理基准
来源:https://arxiv.org/html/2607.26465
Kawai Chung♠ Chunkit Chan♠ Yauwai Yim♠ Yuxuan Liu♠ Haochen Shi♠ Weiqi Wang♠ Qing Zong♠ Tianshi Zheng♠ FU Yixuan♠ Wong Kai Chung♠ Hao Liang♠ Yifan Gao♣ Xi Yang♠ Janet Hui-wen Hsiao♠ Yangqiu Song♠
♠ 香港科技大学
♣ Amazon.com
[ 代码](https://github.com/HKUST-KnowComp/MultivationBench)
\{kwchungac, yqsong\}@cse.ust.hk
###### 摘要
多模态大语言模型因其潜在的社会智能而引发了广泛关注;然而,它们在序列动机推理方面的能力仍未得到充分研究。现有评测主要考察静态文本或孤立的视觉快照,无法反映现实世界行为驱动因素的累积特性。为弥补这一空白,我们提出了 **MultivationBench**,一个专门用于在故事驱动的视觉叙事中严格评测多模态动机推理的基准。该基准建立在成熟的心理学框架之上——马斯洛需求层次理论和赖斯基本欲望理论——并要求模型整合累积的多模态上下文来推断不断演变的动机。结果表明,**MultivationBench** 构成了显著挑战:所有被测试的模型都难以在序列上下文中保持一致的动机推理,揭示了静态识别能力与类人社会理解所必需的动态推理之间的关键脱节。
# MultivationBench: A Benchmark for Multimodal Sequential Motivation Reasoning
Kawai Chung♠ Chunkit Chan♠ Yauwai Yim♠ Yuxuan Liu♠ Haochen Shi♠ Weiqi Wang♠ Qing Zong♠ Tianshi Zheng♠ FU Yixuan♠ Wong Kai Chung♠ Hao Liang♠ Yifan Gao♣ Xi Yang♠ Janet Hui-wen Hsiao♠ Yangqiu Song♠
♠ 香港科技大学
♣ Amazon.com
[ 代码](https://github.com/HKUST-KnowComp/MultivationBench)
\{kwchungac, yqsong\}@cse.ust.hk
参见图注
图1:来自 **MultivationBench** 的一个马斯洛动机示例。给定累积到 I11I_{11} 的故事上下文和图像,Debbie 伸手去拿手机这一行为可以被合理解释为反映认知需求;而当上下文累积到 I13I_{13},揭示了家庭照片以及她在晚餐时的社交孤立后,推断出的动机转变为爱与归属。此示例展示了推断出的实际动机如何随着序列多模态上下文累积而发生变化。
## 1 引言
动机是启动、引导并维持目标导向行为的内在力量,对于解释人类行为至关重要(Hagger and Chatzisarantis, 2005 (https://arxiv.org/html/2607.26465#bib.bib19); Ryan and Deci, 2000 (https://arxiv.org/html/2607.26465#bib.bib20))。它有助于解释为什么人们会在情境展开时开始、坚持或停止某种行为(Kazdin, 2000 (https://arxiv.org/html/2607.26465#bib.bib21))。然而,动机是潜在的,无法被直接观察。相反,它必须从行为和情境中推断出来。因此,人们很少仅凭单个静态时刻来解释行为(Scholl and Tremoulet, 2000 (https://arxiv.org/html/2607.26465#bib.bib72))。随着事件的发展,人们会随时间累积证据,利用后续行动和周围情境来修正先前的解释。这一序列推理过程在叙事中至关重要。一个行为的动机往往只有在额外的视觉和情境信息被揭示之后才会显现(Zacks and Swallow, 2007 (https://arxiv.org/html/2607.26465#bib.bib36); Baldassano et al., 2017 (https://arxiv.org/html/2607.26465#bib.bib63); Baker et al., 2017 (https://arxiv.org/html/2607.26465#bib.bib35); Knoblich and Sebanz, 2008 (https://arxiv.org/html/2607.26465#bib.bib25))。
然而,现有的动机推理基准集中于静态基于文本的场景或孤立的多模态快照(Sap et al., 2019b (https://arxiv.org/html/2607.26465#bib.bib30); Yong et al., 2025 (https://arxiv.org/html/2607.26465#bib.bib29))。这类设置可能奖励局部合理的猜测,但无法评估模型能否在故事发展过程中更新其解释。因此,现有基准所提供的证据有限,无法证明多模态大语言模型(MLLMs,Caffagni et al., 2024 (https://arxiv.org/html/2607.26465#bib.bib82))能否从累积的视觉和文本上下文中进行序列动机推理。
为弥补这一空白,我们提出了 **MultivationBench**,一个大规模基准,专门设计用于在故事驱动的叙事中对多模态序列动机推理进行压力测试。我们的基准基于两个互补的心理学框架:马斯洛扩展需求层次理论(Maslow, 1970 (https://arxiv.org/html/2607.26465#bib.bib2)),它捕捉人类需求的广泛类别;以及赖斯 16 种基本欲望理论(Reiss, 2004 (https://arxiv.org/html/2607.26465#bib.bib4)),它捕捉动机内容中更细粒度的差异。这一设计使得评测既能覆盖粗粒度、普遍性的层面,也能覆盖细粒度、个体性的层面,要求模型基于累积的多模态上下文进行推理,而不仅仅是孤立的观察。
图1 (https://arxiv.org/html/2607.26465#S0.F1) 展示了 **MultivationBench** 所针对的核心挑战。一系列图像显示 Debbie 在一个正式晚宴活动中。在图像 I11I_{11} 处,她伸手去拿手机。单独看这一瞬间,行为是模糊的。模型可能将该行为解释为信息寻求,对应于马斯洛需求层次中的认知需求。然而,后续帧揭示了手机上的家庭照片。更广泛的叙事确认了 Debbie 的社交孤立。解释因此转向寻求与不在身边的亲人建立情感联系,这与爱与归属相一致。挑战不仅仅在于识别行为,还在于随着新证据的累积而修正推断出的动机。依赖表面线索的模型可能会选择更简单的解释,从而遗漏需要更长多模态上下文才能显现的动机。
为了对这一点进行基准评测,**MultivationBench** 包含 1,000 个独特故事、4,023 个视觉落地的行为实例以及 16,092 个评测问题。对最先进 MLLMs 的实验表明,序列动机推理仍然具有挑战性。一些模型在从短故事到中等长度故事时有所提升,表明适度的额外上下文在某些情况下可能有所帮助。然而,这种收益在更长的叙事中并未持续,且各模型的故事级一致性仍然较低,表明在整个叙事中保持正确的动机推理仍然困难。
我们的贡献总结如下:
- 据我们所知,**MultivationBench** 是第一个用于在故事驱动的视觉叙事中评测多模态序列动机推理的人工标注基准。
- **MultivationBench** 将动机标签锚定在两种互补的心理学框架中——马斯洛扩展需求层次理论和赖斯 16 种基本欲望理论——从而能够在累积多模态上下文条件下同时评测粗粒度需求和细粒度欲望。
- 我们在全多模态、纯文本和纯图像三种设置下对最先进的 MLLMs 进行了系统性实验,并对局部任务准确率、故事级一致性、分类粒度以及模型与人类表现之间的差距进行了深入分析。
## 2 相关工作
### 2.1 基于文本的社会与动机推理
关于社会与动机推理的研究主要依赖于基于文本的评测。先前工作研究了以事件为中心的意图和反应推断(Sap et al., 2019a (https://arxiv.org/html/2607.26465#bib.bib70); Rashkin et al., 2018b (https://arxiv.org/html/2607.26465#bib.bib64))、简单故事中的人物心理(Rashkin et al., 2018a (https://arxiv.org/html/2607.26465#bib.bib65))以及情境化故事解释(Mostafazadeh et al., 2020 (https://arxiv.org/html/2607.26465#bib.bib66))。SocialIQA(Sap et al., 2019b (https://arxiv.org/html/2607.26465#bib.bib30))通过呈现日常场景并要求模型推理行为及其影响来评测社会常识。尽管其扩展性好,但对纯文本输入的依赖限制了其评估模型如何理解非语言社会信号的能力。最近,MotiveBench(Yong et al., 2025 (https://arxiv.org/html/2607.26465#bib.bib29))通过整合详细的人物档案和行为描述来推断心理驱动力,明确针对动机推理。然而,它完全依赖文本上下文,并且通常呈现孤立的单轮场景。这种单模态的静态方法忽视了视觉线索的关键作用,也无法测试模型能否在连续的叙事序列中追踪角色不断演变的动机。
#### 多模态社会推理
近期的多模态基准开始将视觉证据纳入社会性落地推理和时间性视觉理解中(Lin et al., 2025 (https://arxiv.org/html/2607.26465#bib.bib69); Villa-Cueva et al., 2025 (https://arxiv.org/html/2607.26465#bib.bib71); Jin et al., 2024 (https://arxiv.org/html/2607.26465#bib.bib15); Li et al., 2024b (https://arxiv.org/html/2607.26465#bib.bib84); Wu et al., 2024a (https://arxiv.org/html/2607.26465#bib.bib87); Ren et al., 2024 (https://arxiv.org/html/2607.26465#bib.bib85); Maaz et al., 2024 (https://arxiv.org/html/2607.26465#bib.bib86))。尽管这些先前工作涉及视觉社会常识、多模态心理理论推理、视频理解、时间定位和视觉目标推断,但它们往往局限于短时距、以事件为中心或面向感知的设置,缺乏对复杂、演变心理状态进行建模的深度。这些方法依赖于表面层面的行为到意图的映射,而非通过有心理学框架支撑的推理来推断潜在欲望,从而限制了它们在累积的多模态叙事语境中评测动机推理的能力(Chen et al., 2025 (https://arxiv.org/html/2607.26465#bib.bib46))。鉴于先前工作的局限性,有必要在真实的多模态环境中评测动机,捕捉超越单纯目标和信念的真实社交互动。
## 3 MultivationBench
在构建 **MultivationBench** 的过程中,我们遵循四个核心设计原则:(1)心理学基础,采用权威框架来定义超越表面意图的标签空间;(2)以人为中心的序列动态,优先选择具有丰富人际互动的叙事,其中序列视觉线索对于追踪心理状态至关重要;(3)长程一致性评测,根据序列长度将数据分层为不同区间,以评估模型在不同记忆范围上保持心理连续性的能力;以及(4)数据完整性,评估并缓解潜在的数据污染风险。
### 3.1 数据来源
遵循这些原则,**MULTIVATIONBENCH** 优先选择序列视觉叙事而非静态场景,因为角色动机往往只有通过后续的视觉和情境证据才会显现。我们整合了三个互补来源的数据——SSID(Malakan et al., 2023 (https://arxiv.org/html/2607.26465#bib.bib16))、StoryReasoning(Oliveira and Matos, 2024 (https://arxiv.org/html/2607.26465#bib.bib17))和 MovieBench(Wu et al., 2024b (https://arxiv.org/html/2607.26465#bib.bib18))——以覆盖多样化的叙事风格和时间复杂度。SSID 提供较短的社交媒体风格故事,而 StoryReasoning 和 MovieBench 则提供更长的电影化叙事,具有更丰富的角色弧线。我们还进行了污染分析,发现所有来源的风险都较低;详情见附录 B.1 (https://arxiv.org/html/2607.26465#A2.SS1)。
### 3.2 心理学框架与任务定义
#### 马斯洛扩展需求层次理论
我们采用马斯洛扩展需求层次理论的 8 层版本(Maslow, 1970 (https://arxiv.org/html/2607.26465#bib.bib2))来表征能够驱动行为的普遍人类需求层级。八个标签分别为:生理需求、安全需求、爱与归属、尊重需求、认知需求、审美需求、自我实现和超越需求。在 **MultivationBench** 中,马斯洛理论作为一种需求优先级理论,用于捕捉某个行为究竟主要由即时生存和安全关切驱动、由社会和尊重需求驱动,还是由更高层次的成长和意义导向动机驱动。
#### 赖斯基本欲望理论及其与马斯洛理论的关联
我们还通过赖斯动机档案(RMP)(Reiss, 2004 (https://arxiv.org/html/2607.26465#bib.bib4))纳入了赖斯的 16 种基本欲望理论。这 16 个标签分别为:身体运动、饮食、秩序、储蓄、宁静、浪漫、家庭、接纳、社交接触、独立、复仇、荣誉、权力、地位、好奇心和理想主义。与马斯洛将动机组织为普遍的需求层级不同,赖斯强调个体差异,即塑造行为的特定欲望的相对强度。因此,这两种理论在我们的基准中扮演不同但互补的角色:马斯洛识别行为所服务的需求层级,而赖斯则区分可能驱动同一行为的更具体的欲望内容。关于框架选择的进一步讨论以及两种理论的完整定义见附录 A (https://arxiv.org/html/2607.26465#A1)。
#### 任务定义
基于这两种心理学框架,**MultivationBench** 在序列视觉叙事中对视觉落地的角色行为进行动机推理评测。对于角色在特定图像索引处表现出的每个视觉落地行为,我们利用累积到该点的故事上下文和图像,定义了四个任务:马斯洛定义(Maslow Definition)、马斯洛实际动机(Maslow Practical Motivation)、赖斯定义(Reiss Definition)和赖斯实际动机(Reiss Practical Motivation)。定义任务要求模型基于标准理论标签对行为动机进行分类,而实际动机任务则要求模型从基于相同理论但在当前叙事情境中实例化的上下文特定选项中进行选择。某些行为在故事上下文支持下可能具有多个有效动机。因此,我们将所有四个任务都构建为多标签预测问题,每个实例可能有一个或多个真实标注。
参见图注
图2:构建 **MulTivationBench** 的 AI-人类流水线。我们在此总结各阶段,提示词和实现细节见附录 D (https://arxiv.org/html/2607.26465#A4)。
### 3.3 基准构建概览
#### 数据构建
我们通过一个紧凑的 AI-人类流水线(图2 (https://arxiv.org/html/2607.26465#S3.F2))构建 **MulTivationBench**。对于每个叙事,多个 MLLMs 首先提取以角色为中心的行为链:一个与图像索引对齐的视觉落地行为列表,并附带候选动机。基于经过验证的行为链以及每个行为之前的故事上下文,我们再生成马斯洛和赖斯定义下的实际动机选项。这些候选选项经过基于 AI 的交叉评审和验证,以确保逻辑一致性、多模态落地以及与心理学理论的对齐。最后,通过人工过滤去除幻觉或弱落地的样本。用于行为提取、选项生成、AI 评审和人工过滤协议的具体提示词描述见附录 D (https://arxiv.org/html/2607.26465#A4)。相似文章
WorldBench:一个具有挑战性且视觉多样化的多模态推理基准
介绍WorldBench,一个视觉多样化的多模态推理基准,揭示了当前多模态大语言模型在视觉理解方面的显著局限性。
MCBench: 面向全模态大语言模型的多语境安全评估基准
MCBench是一个新基准,用于评估全模态大语言模型在视觉、音频和文本模态下的安全性。它包含1196个场景,并发现当前模型难以进行跨模态安全推理。
视觉语言模型真的能进行视觉推理吗?模态差距的严格研究
本文介绍了CrossMath,一个受控多模态推理基准,揭示了当前视觉语言模型的一个关键局限:它们主要在文本空间进行推理,而非真正的视觉接地推理,视觉输入往往会降低性能相比仅文本基线。作者提出了微调方法来减轻这种模态差距并改进多模态推理能力。
DMV-Bench: 通过偶然线索注入诊断长周期多模态智能体的视觉记忆
介绍DMV-Bench,一个用于评估多模态智能体视觉记忆的交互式基准测试,该测试利用产品图像中的偶然视觉线索,并提出了DualMem,一种双编码记忆架构,在各种链长度上优于纯文本和其他多模态基线。
TableVista:在视觉和结构复杂性下对多模态表格推理进行基准测试
介绍了 TableVista,这是一个全面的基准测试,用于评估基础模型在视觉和结构复杂性下的多模态表格推理能力,包含 3,000 个问题,扩展为 30,000 个多模态样本。对 29 个模型的评估显示,在复杂布局和仅视觉设置下性能有所下降。