MoCA:隐式社会情境分析
摘要
介绍了 MoCA(隐式社会情境分析),这是一个新的任务和基准,用于在情感、意图和立场三个维度上建模隐式社会场景,并提出了冲突驱动溯因推理(CoDAR)框架。实验表明,最先进的多模态大语言模型在此任务上表现困难,而 CoDAR 能提升性能,但仍与人类推理存在较大差距。
arXiv:2608.05825v1 公告类型:新
摘要:人类的社会交流,如情感和意图,往往以高度隐式的方式传达,其深层含义通过间接的、基于社会和文化的信号而非明确陈述来表达。这种隐式社会情境在现实交互中无处不在,但目前仍缺乏一个正式且系统的框架来研究它们。在本文中,我们提出了隐式社会情境分析(MoCA),这是一个新任务,沿着三个关键维度系统建模隐式社会场景:情感、意图和立场。我们构建了一个高质量基准,包含从现实来源收集的 3,108 个多模态实例,并带有细粒度的认知标注,揭示谁向谁表达了什么,以及表达的方式和原因。使用 MoCA 数据集,我们发现最先进的多模态大语言模型在此任务上表现明显不佳,因为它们依赖显式线索,且对潜在社会情境的推理能力有限。为应对这一挑战,我们提出了冲突驱动溯因推理(CoDAR),一种新框架,将观察到的表达与预期真实行为之间的差异建模为认知冲突,从而推断隐藏的心理状态。大量实验表明,CoDAR 显著提升了模型性能。尽管如此,与人类推理之间仍存在很大差距,凸显了隐式社会理解的根本难度。
查看缓存全文
缓存时间: 2026/08/07 07:52
# MoCA:隐性社会情境分析 来源:https://arxiv.org/html/2608.05825 \\equalcont 同等贡献作者。 \\equalcont 同等贡献作者。 [2]\\fnmHao\\surFei 1]\\orgname新加坡国立大学,\\orgaddress\\city新加坡,\\country新加坡 2]\\orgname牛津大学,\\orgaddress\\city牛津,\\country英国 3]\\orgname武汉大学,\\orgaddress\\city武汉,\\country中国 ###### 摘要 人类的社会交流(例如情感、意图)往往以高度隐性的方式进行,其内在含义通过间接的、基于社会和文化背景的信号而非直白陈述来表达。这类隐性社会情境在现实世界的互动中无处不在,但遗憾的是,目前仍缺乏一个正式且系统的框架来研究它们。在本文中,我们提出了隐性社会情境分析(MoCA)这一新任务,从情感、意图和立场三个关键维度系统地对隐性社会情境进行建模。我们构建了一个包含 3,108 个来自真实世界来源的多模态实例的高质量基准,并提供了细粒度的认知标注,以揭示谁在向谁表达什么,以及表达的方式和原因。借助 MoCA 数据,我们表明最先进的多模态大语言模型在 MoCA 上表现吃力,这是因为它们依赖显式线索,且对潜在社会情境的推理能力有限。为了解决这一挑战,我们提出了一种新颖的冲突驱动溯因推理(CoDAR)框架,该框架将观察到的表达与预期真实行为之间的差异建模为认知冲突,从而能够推断隐藏的心理状态。大量实验表明,CoDAR 显著提升了模型性能,但与人类推理之间仍存在较大差距,凸显了隐式社会理解的本质难度。 ## 1 引言 人类社会互动已演变成为一个高度复杂的系统,其中沟通和表达深受文化背景、社会角色和情境依赖的影响[grice1975logic,goffman2023presentation]。受权力结构、礼貌规范和自我保护考量等因素的制约,人们在日常互动中往往避免直截了当地表达自己的真实情感、想法或立场[brown1987politeness]。相反,他们倾向于策略性地采用更间接、更隐性的表达方式,在认知上选择一种不明确陈述却又能传达内在含义的方式[searle1975indirect]。无论是在线下互动还是在线社交平台上,这类表达通常通过微妙的语用线索、面部微表情、语音语调变化、细微的身体动作以及表情包或短视频等创造性的多模态载体来实现,往往包含反讽、讽刺、隐喻或间接暗示,以表达复杂的情感和意图[van2020hierarchy,van2016social,cheshin2020impact]。尽管这一现象普遍且重要,但在很大程度上仍未得到充分探索,且缺乏系统性工作以统一的方式对其进行研究。现有工作要么聚焦于纯文本环境下的隐性情感和意图分析[fei2023reasoning,villarroel
相似文章
CORE:面向冲突的通用多模态篡改检测推理
提出了CORE框架,赋予多模态大语言模型显式的冲突捕获能力,以实现可泛化的篡改检测,能够通过少量或零样本适应未见过的篡改类型。
面向智能体与多模态大语言模型的上下文感知强化学习
介绍了ContextRL,一种强化学习方法,教会大语言模型识别哪些上下文支持答案,在智能体和多模态基准上取得了性能提升。
MedLoCoMo:面向大语言模型的长上下文多会话医疗对话基准
MedLoCoMo 是一个新基准,用于评估大语言模型在长上下文、多会话医疗对话推理上的表现,基于 MIMIC-IV 数据构建。它测试了单次入院、跨入院以及对抗性不可回答的问题,揭示出即使对于拥有长上下文窗口的模型,跨入院推理仍然具有挑战性。
多模态属性图的上下文感知模态-拓扑协同对齐
提出CoMAG,一个用于多模态属性图的统一骨干网络,它学习任务自适应可靠上下文并执行模态保持对齐,在图级预测、模态匹配和图条件生成上达到最先进结果。
MoCA-Agent: 一种用于金融和数值推理的声明市场代码智能体
MoCA-Agent是一种声明市场代码智能体,通过将问题分解为原子声明并使用专业智能体买卖这些声明来改进金融和数值推理,在使用固定Qwen 3.6-27B主干的情况下,在多个基准测试中取得了强劲结果。