MultiHuSE:一个用于幽默风格和情感的多模态数据集
摘要
本文介绍了MultiHuSE,这是一个多模态数据集,包含演员视频,标注了幽默风格和情感。基线实验表明,多模态融合比单模态方法提高了幽默风格分类的准确性。
arXiv:2609.11322v1 公告类型:新
摘要:言语幽默的计算识别仍然是一个具有挑战性的任务,需要理解语言、表达方式、情感和文化背景。大多数现有方法专注于二元分类,缺乏捕捉幽默的心理维度以及表达变化的数据集。我们介绍了MultiHuSE,这是一个多模态数据集,包含2,407段高清视频,由50位来自不同人口背景的演员表演1,463个文本样本,涵盖四种心理幽默风格(亲和型、攻击型、自我提升型和自我贬低型),以及中性内容。一个子集还标注了潜在情感。该数据集独特地捕捉了演员对相同文本的多种解释,使得对表达多样性进行系统分析成为可能。基线实验表明,在幽默风格分类中,多模态融合优于单模态方法(准确率80.1% vs. 77.4%),特别是在亲和型幽默方面有显著提升(从66%到74%)。虽然文本提供了最强的单一信号,但融合模型带来了有意义的改进。我们希望MultiHuSE能为连接幽默和情感的心理学理论提供实证支持,同时为人类沟通、福祉和AI驱动交互的研究开辟新途径。该数据集可在终端用户许可协议下供学术使用。
查看缓存全文
缓存时间: 2026/09/11 08:27
# 多模态幽默风格与情绪数据集 来源:https://arxiv.org/html/2609.11322 ## MultiHuSE:面向幽默风格与情绪的多模态数据集 致谢:本研究得到尼日利亚石油技术发展基金(PTDF)的支持。 1st Mary Ogbuka Kenneth 单位:伦敦帝国理工学院计算系算法人类发展组,英国伦敦 邮箱:[email protected] 2nd Foaad Khosmood 单位:加州理工大学圣路易斯奥比斯波分校计算机工程系,美国 邮箱:[email protected] 3rd Abbas Edalat 单位:伦敦帝国理工学院计算系算法人类发展组,英国伦敦 邮箱:[email protected] ###### 摘要 言语幽默的计算识别仍是一项具有挑战性的任务,需要理解语言、表达方式、情绪及文化背景。现有方法多集中于二元分类,缺乏能捕捉幽默心理维度及表达变化的数据集。我们引入MultiHuSE——一个包含2,407段高清视频的多模态数据集,涵盖50位人口统计学背景多样化的演员,表演1,463段文本样本,涵盖四种心理幽默风格(亲和型、攻击型、自我增强型、自贬型)以及中性内容。数据集子集额外标注了基础情绪。该数据集独特之处在于能捕捉同一文本的多种演员诠释,从而系统分析表达多样性。基准实验表明,在幽默风格分类任务中,多模态融合优于单模态方法(准确率80.1% vs. 77.4%),尤其在亲和型幽默上提升显著(从66%提升至74%)。虽然文本提供最强的单一信号,但融合模型仍能带来有意义的改进。我们希望MultiHuSE能为连接幽默与情绪的心理学理论提供实证支持,同时为人类沟通、幸福感和AI驱动交互研究开辟新途径。该数据集可在最终用户许可协议下用于学术研究。 ###### 索引关键词: 计算幽默,多模态情绪识别,幽默风格分类,面部表情分析,情感计算 ## 一、引言 幽默识别人工智能系统面临重大挑战,尤其在需整合语言、视觉和声学线索的多模态情境中\[1 (https://arxiv.org/html/2609.11322#bib.bib7),2 (https://arxiv.org/html/2609.11322#bib.bib3),3 (https://arxiv.org/html/2609.11322#bib.bib10)\]。尽管多模态幽默检测研究有所进展\[4 (https://arxiv.org/html/2609.11322#bib.bib32),5 (https://arxiv.org/html/2609.11322#bib.bib24),6 (https://arxiv.org/html/2609.11322#bib.bib35)\],多数方法仍局限于二元分类(幽默 vs. 非幽默)\[7 (https://arxiv.org/html/2609.11322#bib.bib30)\],忽视了Martin等人\[8 (https://arxiv.org/html/2609.11322#bib.bib16)\]所提出的幽默深层心理维度:自我增强型、自贬型、亲和型和攻击型风格。这些分类对心理健康具有重要意义:亲和型与自我增强型通常促进积极结果\[9 (https://arxiv.org/html/2609.11322#bib.bib29),10 (https://arxiv.org/html/2609.11322#bib.bib33),11 (https://arxiv.org/html/2609.11322#bib.bib12),12 (https://arxiv.org/html/2609.11322#bib.bib9)\],而攻击型与自贬型可能损害心理健康\[13 (https://arxiv.org/html/2609.11322#bib.bib27),14 (https://arxiv.org/html/2609.11322#bib.bib22),15 (https://arxiv.org/html/2609.11322#bib.bib13)\]。 在治疗场景中针对抑郁和焦虑的基于笑声的干预措施日益普及\[16 (https://arxiv.org/html/2609.11322#bib.bib34),17 (https://arxiv.org/html/2609.11322#bib.bib18)\],结合特定幽默风格对心理健康结果有不同影响的证据\[18 (https://arxiv.org/html/2609.11322#bib.bib19),19 (https://arxiv.org/html/2609.11322#bib.bib11),8 (https://arxiv.org/html/2609.11322#bib.bib16)\],凸显了需要能够检测幽默风格及其相关情绪表达的计算系统。与捕捉明确情绪状态的传统情绪数据集不同,我们的方法研究幽默表达中细微的情绪基调——这些情绪可能在喜剧表演情境中被微妙表达或过滤\[20 (https://arxiv.org/html/2609.11322#bib.bib31)\]。这种整合使得计算验证心理学理论以及开发面向心理健康应用的情绪感知系统成为可能。 现有用于分析幽默风格的多模态数据集存在若干局限。UR-FUNNY\[21 (https://arxiv.org/html/2609.11322#bib.bib36)\]聚焦于TED演讲的二元幽默检测;MHD\[5 (https://arxiv.org/html/2609.11322#bib.bib24)\]使用带笑声轨迹的情景喜剧录像;Passau-SFCH\[22 (https://arxiv.org/html/2609.11322#bib.bib25)\]提供风格标注但仅限于德语足球新闻发布会。此外,这些数据集通常只捕捉单次表演实例,限制了表达变化的研究。 为解决这些空白,我们引入MultiHuSE——一个包含2,400多段录音的新多模态数据集,由五十位多样化表演者执行四种心理类别及中性内容的幽默,并附有基础情绪标注。该数据集独特捕捉同一文本的多重诠释,支持表达变化和多模态幽默感知的系统分析。我们的贡献包括: 1. 1\. 首个标注心理幽默风格并附加情绪标签的英语多模态数据集。 2. 2\. 不同演员对同一文本的多重视频表演,支持幽默表达和主观变化的分析。 3. 3\. 基准实验表明多模态融合优于单模态模型(F1值80% vs. 77%)。 ## 二、相关工作 近期数据集推动了多模态幽默检测,但存在显著局限(对比见表I (https://arxiv.org/html/2609.11322#S2.T1))。UR-FUNNY\[21 (https://arxiv.org/html/2609.11322#bib.bib36)\]包含来自TED演讲的16,514个视频片段(二元分类),MHD\[5 (https://arxiv.org/html/2609.11322#bib.bib24)\]提供13,633个基于笑声标注的电视剧片段。两者均提供有价值的数据规模和自然情境,但仅聚焦二元幽默检测,忽视了对幸福感具有不同影响的心理学基础幽默风格\[8 (https://arxiv.org/html/2609.11322#bib.bib16),2 (https://arxiv.org/html/2609.11322#bib.bib3)\]。 Passau-SFCH数据集\[22 (https://arxiv.org/html/2609.11322#bib.bib25)\]通过包含39,682个德语足球新闻发布会片段中的四种幽默风格来弥补这一空白,但仅6%包含实际幽默内容。然而其仅限于单一领域的男性德语使用者,且缺乏受控录制条件,限制了其在多样化人群和情境中的普适性。类似地,YouTube单口喜剧数据集\[23 (https://arxiv.org/html/2609.11322#bib.bib23)\]捕捉真实表演但聚焦笑声检测而非幽默风格分类。 多模态情绪数据集为情感分析提供方法论基础,但对幽默研究具有局限。MELD\[24 (https://arxiv.org/html/2609.11322#bib.bib20)\]包含13,708段《老友记》视频片段,附有丰富情绪标注,但仅38%包含幽默内容且缺乏幽默特定风格标签。SHEMuD\[25 (https://arxiv.org/html/2609.11322#bib.bib2)\]在6,191个电视剧对话片段中结合二元幽默检测与情绪标签,但其幽默分类仍为二元,未区分具有心理学意义的幽默风格。两者仅捕捉内容的单一表达,无法分析表演者如何以不同情绪基调表达相同幽默素材。 表I:现有情感与多模态幽默数据集比较。该表展示关键特征,包括数据来源、视频样本数量、平均视频时长(秒)、使用模态、标注粒度,以及数据集是否捕捉同一内容的单次或多次表演。 | 数据集 | 内容来源 | 视频数量 | 平均时长[秒] | 模态 | 标注类型 | 主要局限/特点 | | :--- | :--- | :--- | :--- | :--- | :--- | :--- | | UR-FUNNY\[21\] | TED演讲 | 16,514 | 4.58 | 视频、音频、文本 | 二元幽默 | 单一英语;无幽默风格区分 | | MHD\[5\] | 电视剧(《生活大爆炸》) | 13,633 | 3.83 | 视频、音频 | 二元幽默 | 单一英语;制作者添加笑声;无风格 | | Passau-SFCH\[22\] | 足球新闻发布会 | 39,682 | 无数据 | 视频、音频、文本 | 四种幽默风格 | 单一德语;限于单一领域男性演讲者 | | MELD\[24\] | 电视剧(《老友记》) | 13,708 | 3.59 | 视频、音频、文本 | 仅情绪 | 单一英语;无幽默风格标注 | | SHEMuD\[26\] | 电视剧对话 | 6,191 | 无数据 | 视频、音频、文本 | 二元幽默+情绪 | 印地语/英语;单一来源;无风格标注 | | YouTube单口喜剧\[23\] | YouTube单口喜剧 | 39,127 | 无数据 | 视频、音频、文本 | 基于笑声 | 俄语/英语;聚焦笑声而非幽默风格 | | **MultiHuSE(本研究)** | 受控工作室 | 2,407 | 6.66 | 视频、音频、文本 | 四种幽默风格+情绪 | **多重表演**;英语;多样化表演者;质量一致;943个相同笑话的替代表演,表达多样 | ### 二、A 数据缺口与研究动机 对现有数据集的分析揭示了三个关键缺口:(1)主要关注二元分类而非心理学意义的幽默风格,(2)单次表达捕捉忽视了诠释多样性,(3)与连接幽默、情绪表达和幸福感的心理学理论整合有限。我们开发MultiHuSE旨在弥补这些缺口,支持计算与心理学理论交叉领域的研究。 ## 三、数据集创建 我们介绍MultiHuSE——一个未发表的用于幽默风格与情绪识别的多模态数据集。该收集包含2,407段高清录像(1080p,25fps),由五十位人口统计学背景不同的参与者表演近1,500个文本实例。文本来源于Kenneth等人\[2 (https://arxiv.org/html/2609.11322#bib.bib3)\]的幽默风格语料库,包含心理学基础的幽默风格标注。虽然文本标注来自这项先前工作,但所有视频录制、演员表演和情绪标注均为我们数据集的新贡献。 ### 三、A 数据收集 ##### 录制设置 我们在伦敦帝国理工学院一间专用房间的专业受控录制环境中进行录制,使用佳能EOS Rebel数码单反相机和罗德VideoMic Pro定向麦克风。所有录制在相同设置条件下进行——白色背景、一致照明和标准化参与者位置(头部至膝盖),以确保面部表情和身体手势清晰可见,同时最小化可能干扰模型训练的环境变量。 ##### 参与者人口统计 通过结构化招募流程招募了50位演员(54%女性,40%男性,6%其他性别;年龄18-69岁;72%白人,12%亚裔/亚裔英国人,6%黑人/非洲/加勒比裔,10%其他背景)111详细招募流程见:https://sites.google.com/view/laughterai-com/recruitement。参与者获得50英镑报酬,用于约2.5小时的工作(包括准备和录制)。 ##### 参与者准备 参与者收到详细说明,解释每种幽默风格(完整说明在线可获取222https://sites.google.com/view/laughterai-com/dataset),并附有以下定义: - •亲和型(Affiliative):用于建立联系和社交纽带的幽默,聚焦共享经历。 - •自我增强型(Self-enhancing):在逆境中寻找乐趣的幽默;一种积极适应性的风格。 - •攻击型(Aggressive):通过讽刺或贬低攻击或贬低他人的幽默。 - •自贬型(Self-deprecating):通过自嘲凸显个人弱点的幽默。 - •中性(Neutral):非笑话或不符合其他幽默风格的陈述。 参与者在录制日前收到文本样本,以熟悉内容、练习不同情绪的表达,并可选择退出任何他们感觉不适表演的样本。他们被指导在准备表演时考虑六种情绪类别(喜悦、共情、愤怒、中性、尴尬和优越感)。 ##### 数据集构成 我们的视频收集包含2,400多个样本,分布在五个类别中,呈现近似均衡分布:自我增强型(500个视频,20.8%)、攻击型(529个视频,22.0%)、中性(495个视频,20.6%)、自贬型(457个视频,19.0%)和亲和型(426个视频,17.7%)实例。 数据集的独特之处在于包含943个重新表演的视频(约占数据集的40%),捕捉相同内容的多重诠释,以直接比较表达变化。这种方法支持系统分析幽默表达的主观本质——表演者为相同文本内容带来独特诠释。图1 (https://arxiv.org/html/2609.11322#S3.F1)通过攻击型幽默样本“听说你出生在4月2日,晚了一天”的例子阐释了这种诠释多样性。第一位表演者(图1(a) (https://arxiv.org/html/2609.11322#S3.F1.sf1))带着明显愤怒表演笑话,而第二位表演者(图1(b) (https://arxiv.org/html/2609.11322#S3.F1.sf2))则表达优越感——展示了相同文本如何引发不同情绪表达和表演风格。这种变化对于研究幽默风格、情绪表达与表演技巧之间微妙关系特别有价值。 [图片说明](a)表演者1表达愤怒 [图片说明](b)表演者2表达优越感 图1:相同攻击型笑话的表达变异性:(a)愤怒与(b)优越感表达,笑话:“听说你出生在4月2日,晚了一天”。 ##### 录制时长 视频时长从2秒到74.96秒不等(平均=6.66秒),其中91.3%在10秒内,6.7%(10–20秒),1.2%(20–30秒),0.8%(>30秒)。短视频包含简洁笑话,如“做你的事,别在乎别人喜不喜欢”(自我增强型,2秒),“他们说好事多磨,所以我总是迟到”(自我增强型,3秒),以及“我觉得除了我自己,已经没有垃圾可烧了”(自贬型,2秒)。这些短片段捕捉完整但简洁的幽默表达,而较长的视频则包含更详细的笑话叙述。时长的这种变化反映了幽默表达的自然多样性,从快速的一句笑话到长篇趣事。 ### 三、B 标注与表演方法 ##### 幽默风格与文本类别 我们使用了现有文本数据集\[2 (https://arxiv.org/html/2609.11322#bib.bib3)\]的标签,
相似文章
多模态大语言模型的计算幽默:方法、数据集、评估与挑战
关于使用大语言模型进行多模态幽默理解的全面综述,涵盖方法、数据集、评估协议以及在解读迷因、卡通和漫画中幽默的挑战。
多模态大语言模型的计算幽默:方法、数据集、评估与挑战
本综述探讨了多模态大语言模型中的计算幽默理解,涵盖了方法、数据集、评估协议以及诸如易受捷径影响的评估和证据基础薄弱等挑战。
超越玩笑:多角度推理用于检测和解释模因中的有害幽默
本文介绍了MAR-12,一个利用视觉语言模型和多角度推理来检测和解释模因中有害幽默的框架,在PrideMM和Memotion数据集上达到了最先进的准确率。
分离、细化、整合:为情感分析分解多模态融合
一篇研究论文,提出了SeRIn,一种多模态融合方案,将模态特定细化与跨模态交互分离,在CH-SIMS和CMU-MOSEI情感分析基准上取得了最先进的结果。
EmoS:面向细粒度流式情感理解的高保真多模态基准
本文介绍了 EmoS,这是一个专为细粒度流式情感理解设计的高保真多模态基准,旨在解决现有数据集中存在的生态效度不足和标注可靠性低的问题。