情感体验、表达与感知:多模态社交媒体帖子的情感分析

arXiv cs.CL 论文

摘要

本文介绍了Mult2EMo数据集,用于研究多模态社交媒体帖子中的情感表达与感知,发现重构情感表达具有挑战性,尤其是当帖子严重依赖图像时。

arXiv:2609.18385v1 公告类型:新 摘要:情感是人类交流的重要方面,特别是在社交媒体上,作者经常结合文字和图像来传达情感。然而,先前对社交媒体帖子情感分析的研究在衡量读者如何重构作者意图方面忽略了两个重要方面:(1)~图像模态,大多数研究只关注文本;(2)~触发所表达情感的真实世界事件及其与帖子内容的关系。因此,我们研究了(a)作者经历触发其撰写社交媒体帖子的事件与(b)帖子内容之间的关系,重点关注读者重构该情感表达的能力。为此,我们引入了多模态多情感模型数据集Mult2EMo,通过收集作者和读者对帖子及其触发事件的注释而创建。我们发现,对于人类读者和计算模型来说,重构是可能的但具有挑战性。我们表明,理解触发事件对于准确重构至关重要,当帖子严重依赖图像表达情感时,重构尤其具有挑战性。
查看原文
查看缓存全文

缓存时间: 2026/09/17 09:17

# 多模态社交媒体帖子中的情感分析  
来源:https://arxiv.org/html/2609.18385  

## 情感体验、表达与感知:多模态社交媒体帖子中的情感分析  
**Christopher Bagdon**  
所属单位:德国班贝格大学自然语言处理基础系  
电子邮件:[christopher\.bagdon@uni\-bamberg\.de](mailto:)  

**Carina Silberer**  
所属单位:德国斯图加特大学机器语言处理研究所  
电子邮件:[roman\.klinger@uni\-bamberg\.de](mailto:)  

**Roman Klinger**  
所属单位:德国班贝格大学自然语言处理基础系  
电子邮件:[CarinaSilberer@posteo\.de](mailto:)  

###### 摘要  
情感是人类交流的重要方面,尤其在社交媒体上,作者经常结合文字和图片来传达情感。然而,先前关于社交媒体帖子情感分析的研究在衡量读者能否准确重构作者意图方面忽略了两个重要方面:(1)图像模态,大多数研究仅关注文本;(2)触发情感表达的现实事件及其与帖子内容的关系。因此,我们研究了 (a) 作者因经历事件而产生的情感体验与 (b) 帖子内容之间的关系,重点关注读者重构该情感表达的能力。为此,我们引入了多模态多情感模型数据集(Mult2EMo),该数据集通过收集作者和读者对帖子及其触发事件的标注创建而成。我们发现,对于人类读者和计算模型而言,重构是可能的但具有挑战性。我们表明,理解触发事件对于准确重构至关重要,并且当帖子主要依赖图像表达情感时,重构尤其困难。  

## 1 引言  
结合文字和图片进行个人交流是随着互联网兴起而普及的近期现象,并随着社交媒体和智能手机的出现进一步传播。近年来,社交媒体上的多模态交流日益普遍(Illendula and Sheth, 2019 (https://arxiv.org/html/2609.18385#bib.bib1);Li and Xie, 2020 (https://arxiv.org/html/2609.18385#bib.bib2))。因此,理解作者如何在多模态帖子中表达情感对于理解现代情感交流以及人们使用社交媒体的方式至关重要。  

在自然语言处理(NLP)中,情感分析涉及解读文本中表达的情感。情感是作者的私人状态,文本则是作者尝试与他人分享这种私人状态的方式(Wilson and Wiebe, 2005 (https://arxiv.org/html/2609.18385#bib.bib25))。获取这些私人状态以创建语料库可通过多种方式实现:请作者自行标注其情感(Kajiwara et al., 2021 (https://arxiv.org/html/2609.18385#bib.bib21);Bagdon et al., 2025 (https://arxiv.org/html/2609.18385#bib.bib9)),从文本信息(如标签)中推断情感(Mohammad, 2012 (https://arxiv.org/html/2609.18385#bib.bib4);Mohammad and Bravo\-Marquez, 2017 (https://arxiv.org/html/2609.18385#bib.bib16)),或请第三方读者进行重构(Demszky et al., 2020 (https://arxiv.org/html/2609.18385#bib.bib8);Liu et al., 2013 (https://arxiv.org/html/2609.18385#bib.bib22)),其中最后一种方法在NLP中最为常见。  

参见图注  
**图1**:社交媒体上的情感交流过程。作者经历触发情感的事件,并在多模态帖子中表达该情感。读者随后解读作者的情感表达。  

这种对作者情感的重构存在误差,源于对文本解读的差异——这一方面已有研究(Troiano et al., 2023 (https://arxiv.org/html/2609.18385#bib.bib5))。然而,尚不清楚这些误差是仅源于读者对作者意图情感的不同解读,还是作者自身在表达时可能存在不准确或对先验知识(例如,导致情感体验的触发事件)做出假设,从而导致帖子解读困难。  

因此,我们在多模态设置中联合研究三个方面(如图1 (https://arxiv.org/html/2609.18385#S1.F1) 所示)——体验、表达与感知:体验的情感与表达的情感有何不同(本文称为情感过程)?这种差异如何影响读者对作者情感过程的感知?我们通过关注作者对事件的认知评估以及情感体验(Scherer, 2005 (https://arxiv.org/html/2609.18385#bib.bib18);Klinger, 2023 (https://arxiv.org/html/2609.18385#bib.bib13)),并比较作者对触发事件的描述与读者对同一事件的解读来进行研究。具体而言,我们回答以下研究问题:  
\(RQ1\) 多模态帖子是否足以重构作者意图的情感表达及其对事件的评价?  
\(RQ2\) 情感重构如何受事件与帖子相关性的影响?  
\(RQ3\) 图像类型及其与文本的关系如何影响情感重构?  

我们的研究引入了两个根本性创新:(a) 我们不仅研究社交媒体帖子内容,还研究触发作者撰写帖子的事件;(b) 我们广泛研究多模态社交媒体帖子,而先前的工作通常专注于更狭窄的领域,如迷因(meme)(Sharma et al., 2020 (https://arxiv.org/html/2609.18385#bib.bib27);Sharma et al., 2024 (https://arxiv.org/html/2609.18385#bib.bib28);Shi et al., 2026 (https://arxiv.org/html/2609.18385#bib.bib29))。  

为支持这些研究,我们引入了多模态多情感模型数据集(Mult2EMo),包含7,200个社交媒体帖子。作者标注了每个帖子因触发事件而体验的情感及其认知评价、该事件的描述,以及帖子中表达的情感。此外,读者标注了1,440个帖子的子集,尝试重构所有作者的标注。我们发现,读者和模型可以在一定程度上重构作者的情感表达和事件评价,尽管模型在重构事件的认知评价(通过评价变量衡量)方面表现优于读者。对于准确的重构,关键要素是对触发事件的对齐解读。人类和模型都更依赖文本信息而非图像模态。  

## 2 相关工作  
### 2\.1 NLP中的情感理论  
情感理论是NLP情感分析的重要方面,它们为理解情感过程提供了框架。例如,在情感分类中,文本通过使用分类框架或维度框架(如效价-唤醒度-支配度(Russell, 1980 (https://arxiv.org/html/2609.18385#bib.bib15))进行标注。分类方法可以使用粗粒度的分类体系,如Ekman的六种基本情感(1999 (https://arxiv.org/html/2609.18385#bib.bib14))(Mohammad, 2012 (https://arxiv.org/html/2609.18385#bib.bib4)),或更细粒度的分类体系,如Demszky et al. (2020) (https://arxiv.org/html/2609.18385#bib.bib8)使用的27种情感类别。这些标注可以是单标签或多标签(Bostan and Klinger, 2018 (https://arxiv.org/html/2609.18385#bib.bib17)),也可以包含强度评分(Mohammad and Bravo\-Marquez, 2017 (https://arxiv.org/html/2609.18385#bib.bib16))。  

然而,这些框架并未捕捉情感过程的全部复杂性,因为它们未考虑对事件的认知评价(即评价),而这是情感过程的重要方面(Scherer, 2005 (https://arxiv.org/html/2609.18385#bib.bib18))。评价是基于个人价值观、动机和上下文的对事件的主观评估,在塑造情感反应中起着关键作用。Scherer (2005) (https://arxiv.org/html/2609.18385#bib.bib18) 在成分过程模型中将其形式化,该模型将情感概念化为一个动态过程,其中事件触发一系列评价检查——例如,评估事件的新颖性、目标相关性以及个人应对能力——这些检查的结果共同产生情感体验。关键是,由于评价具有主观性,相同的事件可能在不同个体中引发不同的情感。  

### 2\.2 情感体验、表达与感知  
NLP中的情感研究可以关注不同方面:作者体验的情感、作者表达的情感、读者对作者情感过程的感知,以及读者对作者表达的情感所产生的体验。研究通常同时涵盖两个方面,然而同时研究超过两个方面的研究较为罕见。Mult2EMo包含了前三个方面的标注。  

##### 体验与表达。  
情感体验是由事件引发的私人状态,而情感表达是分享该私人状态的尝试,可通过文本和图像等模态传达(Wilson and Wiebe, 2005 (https://arxiv.org/html/2609.18385#bib.bib25))。两者对于理解情感交流都很重要,因为作者表达的情感可能与体验的不同。情感体验的研究使用分类和维度框架。诸如Scherer and Wallbott (1997) (https://arxiv.org/html/2609.18385#bib.bib24) 和 Troiano et al. (2023) (https://arxiv.org/html/2609.18385#bib.bib5) 的研究要求参与者回忆并描述他们体验到目标情感(例如,“当...我感到快乐”)的事件,并回答关于该事件的评价问题。Bagdon et al. (2025) (https://arxiv.org/html/2609.18385#bib.bib9) 要求参与者标注他们因事件而体验的情感以及后来在社交媒体帖子中表达的情感。Yeo and Jaidka (2025) (https://arxiv.org/html/2609.18385#bib.bib31) 使用评价信息和情感标签来测试大语言模型在情感推理方面的能力,发现它们在将事件结果与特定情感关联方面表现不佳。  

情感表达是NLP情感研究中最常见的方面;大多数带情感标签的数据集试图捕捉作者在文本中表达的情感(Bostan and Klinger, 2018 (https://arxiv.org/html/2609.18385#bib.bib17))。这可以通过请作者标注他们表达的情感来实现(Kajiwara et al., 2021 (https://arxiv.org/html/2609.18385#bib.bib21);Bagdon et al., 2025 (https://arxiv.org/html/2609.18385#bib.bib9);Li et al., 2025 (https://arxiv.org/html/2609.18385#bib.bib23)),或通过远程标注方法(Mohammad, 2012 (https://arxiv.org/html/2609.18385#bib.bib4);Mohammad and Bravo\-Marquez, 2017 (https://arxiv.org/html/2609.18385#bib.bib16);Liu et al., 2013 (https://arxiv.org/html/2609.18385#bib.bib22))。直接从作者获取的标注更准确,并能捕捉情感被隐含传达的实例,但收集起来更耗时且成本更高。  

##### 感知。  
读者对作者情感表达的感知是NLP中情感分类的一种常见方法(Strapparava and Mihalcea, 2007 (https://arxiv.org/html/2609.18385#bib.bib19);Demszky et al., 2020 (https://arxiv.org/html/2609.18385#bib.bib8);Klinger, 2023 (https://arxiv.org/html/2609.18385#bib.bib13);Liu et al., 2013 (https://arxiv.org/html/2609.18385#bib.bib22);Troiano et al., 2023 (https://arxiv.org/html/2609.18385#bib.bib5);Buechel and Hahn, 2017 (https://arxiv.org/html/2609.18385#bib.bib20)),因为这种标注过程易于进行,并且可以通过众包大规模完成。先前的研究要求第三方读者为文本标注作者表达的情感。这曾被用作作者标注的替代,然而,最近的研究表明,读者在重构作者情感过程方面并不熟练(Troiano et al., 2023 (https://arxiv.org/html/2609.18385#bib.bib5);Li et al., 2025 (https://arxiv.org/html/2609.18385#bib.bib23))。Li et al. (2025) (https://arxiv.org/html/2609.18385#bib.bib23) 发现,使用细粒度和粗粒度情感分类体系时,第三方重构作者私人状态的能力有限;然而,属于作者社交群体的读者表现更好。  

Reader↑\\uparrowCLIP↑\\uparrowCLIP Rand\.↑\\uparrowQwen3↑\\uparrowRRRVTIT\+ITIT\+ITIT\+IAnger\.52\.44\.47\.43\.27\.45\.46\.09\.46\.54\.36\.52Disgust\.44\.38\.40\.39\.23\.36\.40\.08\.38\.29\.20\.35Fear\.52\.44\.45\.53\.32\.56\.55\.17\.53\.58\.33\.59Joy\.82\.58\.58\.58\.41\.58\.59\.15\.58\.54\.42\.56Sadness\.67\.60\.63\.60\.31\.60\.58\.02\.58\.57\.33\.61Surprise\.44\.35\.34\.48\.25\.50\.48\.20\.49\.30\.14\.32Macro Avg\.\.57\.47\.48\.50\.30\.51\.51\.12\.50\.47\.30\.49  
**表1**:读者和模型进行情感分类的F1分数。读者F1分数通过将单个读者(R)或多数票(V)与作者进行比较,以及跨读者对(RR)计算得出。模型F1分数报告了基线CLIP和使用随机图像的CLIP(CLIP Rand.)在3次训练运行中的平均分数,分别跨文本(T)、图像(I)和文本+图像(T+I)。  

### 2\.3 多模态情感分析  
与仅文本研究相比,多模态情感分析(特别是结合文本和图像)仍处于探索阶段。大多数多模态工作关注视频、音频和文本的组合(Shou et al., 2025 (https://arxiv.org/html/2609.18385#bib.bib26))。在图像和文本的研究中,许多专注于迷因(Sharma et al., 2020 (https://arxiv.org/html/2609.18385#bib.bib27);Sharma et al., 2024 (https://arxiv.org/html/2609.18385#bib.bib28);Shi et al., 2026 (https://arxiv.org/html/2609.18385#bib.bib29))或情感分析(Al\-Tameemi et al., 2024 (https://arxiv.org/html/2609.18385#bib.bib30))。虽然这些研究为多模态架构和文本-图像关系提供了有价值的见解,但它们并未解决情感体验、表达和感知之间的相互作用,而这种相互作用是情感交流的基础。  

情感分析面临着多模态建模挑战,例如模态坍缩(Shou et al., 2025 (https://arxiv.org/html/2609.18385#bib.bib26)),即模型过于依赖一种模态(例如文本)而忽略另一种模态(例如图像)。一些相关任务的研究提出了解决此问题的方法。例如,Yang et al. (2024) (https://arxiv.org/html/2609.18385#bib.bib32) 使用不确定性来重新平衡多模态帖子中的仇恨言论检测模态,Wu et al. (2025) (https://arxiv.org/html/2609.18385#bib.bib33) 动态调整模态权重并使用多阶段融合进行假新闻检测。然而,这些方法并非专门为情感分析设计,也未在此处应用。  

## 3 数据收集方法  
我们分两个阶段收集Mult2EMo:(1) 首先直接从作者处收集帖子(作者阶段),以便我们能捕捉情感体验、表达和进一步的上下文,以最佳理解作者意图;(2) 然后收集读者对作者阶段收集的帖子的标注,以理解读者对作者表达和体验的感知(读者阶段)。111匿名数据集和调查可通过 https://www.uni-bamberg.de/en/nlproc/projects/item 请求获取。  

### 3\.1 作者阶段  
我们招募参与者...

相似文章

评估主动式对话智能体中的多模态情绪识别:一项用户研究

arXiv cs.AI

本文介绍了一个用于主动对话智能体的多模态情绪识别模块,该模块结合了面部识别与语言分析。一项涉及20名参与者的用户研究发现了一种“扑克脸”效应,即视觉线索不可靠,而语言分析则更为准确;研究还表明,智能体可以通过对话适应性来引发情绪。