多模态大语言模型的计算幽默:方法、数据集、评估与挑战

arXiv cs.CL 论文

摘要

关于使用大语言模型进行多模态幽默理解的全面综述,涵盖方法、数据集、评估协议以及在解读迷因、卡通和漫画中幽默的挑战。

arXiv:2607.19011v1 Announce Type: new Abstract: 迷因、卡通和漫画中的多模态幽默对人工智能系统来说仍然难以处理,因为预期含义依赖于非字面机制、共享文化知识和交际意图,而非字面场景描述。本综述聚焦于单图像和多面板作品中的视觉幽默理解,同时将幽默生成视为一个新兴的下游前沿。我们将本领域文献与先前的幽默、讽刺及通用多模态大语言模型综述进行对比,并使用以能力为中心的层次结构进行组织,涵盖识别、解释与推理以及生成。在此视角下,我们综合了基准设计、评估协议和建模范式,追踪了该领域从任务特定融合模型到基于多模态对齐、证据支撑推理和可控生成的大模型方法的转变。最后,我们指出了进展的主要障碍:易受捷径影响的评估、有限的文化和叙事覆盖、薄弱的证据支撑,以及未解决的安全性和所有权问题。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:24

# 方法、数据集、评估与挑战
来源:https://arxiv.org/html/2607.19011
1\]凯斯西储大学 2\]香港理工大学

## 多模态大语言模型的计算幽默:方法、数据集、评估与挑战

###### 摘要

模因、漫画和连环画中的多模态幽默对人工智能系统来说仍然很困难,因为其预期含义依赖于非字面机制、共享文化知识和交际意图,而非字面的场景描述。本综述聚焦于单图像和多面板制品中的视觉幽默理解,同时将幽默生成视为一个新兴的前沿领域。我们将相关文献与先前的幽默、讽刺及通用多模态大语言模型综述进行对比,并使用一个以能力为中心的分层结构进行组织,涵盖识别、解释与推理、以及生成三个层次。在此框架下,我们综合了基准设计、评估协议和建模范式,追溯了该领域从特定任务融合模型向基于多模态对齐、基于证据的推理和可控生成的大模型方法的转变。最后,我们指出了制约进展的主要障碍:易受捷径影响的评估、有限的文化与叙事覆盖范围、薄弱的证据基础、以及未解决的安全性与所有权问题。

11\`\`这些作者贡献相同。22\`\`通讯作者。

## 1 引言

人工智能的最新进展使模型能够以前所未有的规模和性能联合处理文本和图像。多模态大语言模型目前在图像描述、视觉问答和跨模态检索等任务上取得了强劲成果,这些任务主要强调对显性视觉和文本内容的识别、定位和推理。然而,当处理那些含义超出字面感知的内容时,这种范式仍然存在局限性。人类交流经常依赖于模因、漫画、讽刺图像等具有表现力的制品,其意义来源于幽默、文化指涉、符号联想或模态间的有意不协调。解读这类媒体需要推理隐含意义和交际意图,而不仅仅是识别可观察的内容。

我们将此问题设定称为**多模态幽默理解**:解读那些其幽默、讽刺或反讽意义源自视觉内容和相关文本相互作用的基于图像的制品。我们专注于单图像和多面板图像制品,并将幽默生成视为一个新兴的前沿领域,它有助于探究模型是否已内化了幽默解读的机制,而非作为一项需要独立评估的能力。

**为何这一差距至关重要。** 感知识别与交际解释之间的差距并非微小的残留误差;它是多模态大语言模型构建和评估方式中一个结构性的盲点。一个模型可以正确识别出一栋着火的房子、一个法庭或一张笑脸,但仍然可能无法恢复这些元素共同编码的隐喻、社会攻击目标或笑点。这是因为核心困难不在于通常意义上的多模态对齐,而在于推理某个并置为何有趣、它预设了何种背景知识、以及它向受众传达了什么样的立场。随着多模态大语言模型越来越多地部署在内容审核、社交媒体分析和创意辅助等应用中,系统地理解它们在这些任务中的能力、局限性和失败模式变得愈发迫切。

**现有综述的空白。** 尽管兴趣日益增长,现有的综述仅部分覆盖了这一领域。基于文本的计算幽默综述聚焦于双关、文字游戏和言语反讽等语言现象,但未涉及视觉基础或跨模态不协调。存在多模态综述,但每一种都局限于单一任务:讽刺检测或模因分类。同时,更广泛的多模态大语言模型综述通常将创意性和比喻性理解作为通用多模态推理下的一种能力,而没有进行专门的系统性处理。

本综述旨在填补这一空白。我们不按任务名称或模型架构来组织工作,而是围绕三种逐步递进的能力来组织文献:**识别**,即系统检测或分类幽默现象;**解释与推理**,即系统解释其机制、目标或隐含含义;以及**生成**,即模型必须基于输入产生与幽默一致的输出。这一框架不仅阐明了不同基准测量了什么,还阐明了从标签预测转向基于证据的解释需要哪些建模假设。

具体而言,本综述做出以下贡献:

- • 我们提出了一种以能力为中心的组织方式,将背景概念、基准设计和建模范式对齐。
- • 我们综合了数据集和评估协议,特别关注当前基准在解释性理解方面测量了什么、未测量什么。
- • 我们识别了当前制约进展的技术和社会技术瓶颈,包括易受捷径影响的评估、稀疏的机制级标注、薄弱的文化基础、以及安全性和所有权问题。

**综述范围。** 我们涵盖多模态视觉幽默,例如**多模态幽默**、**模因理解**、**视觉讽刺**、**讽刺检测**、**漫画理解**、**幽默字幕生成**和**视觉比喻语言**。我们聚焦于当代多模态大语言模型的工作,并简要介绍了后多模态大语言模型时代之前的特定任务多模态模型(见附录C (https://arxiv.org/html/2607.19011#A3))。我们收录了研究基于图像的制品且成功依赖于超越字面基础的推理(通常通过视觉-文本交互、非字面机制或交际意图)的论文。我们排除了以音频和视频为中心的幽默、通用美学建模和说服性媒体,除非它们被直接用作基于图像的幽默理解的评估资源。我们还通过从基准和综述论文中进行前向和后向滚雪球搜索来寻找密切相关的作品。我们的目标不是对每个与幽默相关的数据集进行详尽编目,而是对最直接测试多模态视觉幽默理解的资源和建模策略进行有原则的综合。

参见图注 图1:综述概览。我们定义了**多模态幽默**及其两种**表示形式**:静态视觉-文本关联和顺序视觉叙事。三个逐步递进的**能力**——识别、解释与推理、以及生成——构成了列(§3 (https://arxiv.org/html/2607.19011#S3))。第三行给出了每种能力的**主导建模范式**:跨模态对齐 \(p_\theta(y \mid x)\),基于证据的推理 \(p_\theta(y, r_{1:K} \mid x, \mathcal{K}_{x})\),以及可控生成 \(p_\theta(y_{\mathrm{gen}} \mid x, c)\)(§4 (https://arxiv.org/html/2607.19011#S4), 表1 (https://arxiv.org/html/2607.19011#S4.T1))。第四行列出了**基准家族和评估协议**,按表示形式标记(§5 (https://arxiv.org/html/2607.19011#S5), 表2 (https://arxiv.org/html/2607.19011#S5.T2));第五行(突出显示)强调了我们的跨基准分析所暴露的**持续存在的差距**(§6 (https://arxiv.org/html/2607.19011#S6), §7 (https://arxiv.org/html/2607.19011#S7))。水平箭头表示能力演进;垂直箭头追踪每一列从任务到开放问题的自上而下过程。

## 2 背景

### 2.1 多模态幽默的定义

在本综述中,我们使用**多模态幽默**来指代那些通过协调使用视觉内容和相关文本,有意识地传达超出字面描绘含义的交际制品,例如网络模因、社论漫画、连环画和讽刺图像。

与自然图像或描述性文本不同,人类的创意媒体旨在传达富有表现力、幽默、叙事或讽刺的含义,需要解读的是暗示的内容而非直接展示的内容。对其解读不仅依赖于感知识别,还依赖于对隐含意图和共享社会知识的推理。我们专注于单图像和多面板图像制品,其含义源于视觉-文本交互以及非字面推理。

### 2.2 表示形式

多模态幽默涵盖了广泛的图文数据形式,包括带标题的单图像和带对话的多面板序列。建模多模态创意理解可以形式化为学习一个条件映射:\(p(y\|x)\),其中 \(x\) 表示多模态输入,\(y\) 表示特定任务的输出,例如幽默标签、解释或生成的续写。\(x\) 的结构决定了建模此条件分布所需的感知编码、对齐机制和架构组件。

与传统视觉或语言任务不同,创意媒体通常将意义分布在各个模态之间(对于漫画而言,分布在各个面板之间)。因此,表示形式不仅定义了输入空间,还定义了模型所需的整合能力。我们将表示形式分为两个面向建模的类别:

参见图注 图2:我们将视觉幽默数据分为**静态视觉-文本制品**,例如漫画、模因和幽默图像,以及**顺序视觉叙事**,例如连环画、漫画和多面板模因。常见的标注包括标题、图像文本、问题、对象边界框、幽默度或强度分数,以及特定任务标签。(1) **静态视觉-文本制品**包括模因、社论漫画和带标题的图像,其中 \(x = \{x^{img}, x^{text}\}\) 包含一个图像和可选的短文本。含义通常源于跨模态不协调或隐含的符号对齐。建模需要联合嵌入空间、多模态对齐以及对社会知识先验的敏感性。架构通常依赖于视觉-语言编码器或带有交叉注意力机制的多模态大语言模型。

(2) **顺序视觉叙事**包括连环画和多面板模因,其含义源于面板间的进展,其中 \(x = \{x_{1}, x_{2}, \ldots, x_{T}\}\) 表示有序的视觉序列。理解这些形式需要跟踪实体和事件、推断因果关系,并在视觉序列中整合信息。

在所有类别中,数据形式不仅塑造了感知需求,也塑造了理解和生成创意含义所需的推理和对齐类型。

### 2.3 创意意义构建

超越表示形式,创意制品通过非字面机制传达含义。对于人工智能系统而言,解读因此需要的不仅仅是识别视觉和文本模式:模型还必须推断为何使用这些模式。在本综述中,我们将创意意义构建视为反复出现的表达机制之间的交互。

在不同数据形式中,四种机制反复出现。**不协调**通过期望与观察之间的不匹配创造意义,在多模态幽默中通常通过跨模态冲突实现。**类比与概念映射**将一个熟悉源域的结构投射到目标概念上,如隐喻和象征表征。**夸张与渲染**根据隐含规范放大属性以强调或传达情感,而**叙事结构**则组织设定、高潮和随时间变化的因果进展。这些机制共同解释了创意制品如何编码超越表面语义的含义,以及它们为何对字面化的AI系统构成挑战。

### 2.4 为何多模态幽默对AI而言很难

多模态幽默从根本上对AI模型构成挑战,因为预期的含义通常无法从可观察的输入中直接推断出来。与答案基于显性视觉或文本证据的字面多模态任务不同,创意理解需要对潜在变量进行推理,例如隐含的隐喻、被违反的期望、文化指涉和交际意图。模型必须检测不协调、推断隐含规范、整合外部社会文化知识,并推理出某个制品为何被创作以及意图如何被解读。因此,创意理解超越了多模态特征融合,要求在一个统一的建模框架内整合感知对齐、结构化推理和语用推断。

参见图注 图3:多模态幽默的以能力为中心的任务层级。我们将任务组织为三个层次——识别、解释与推理、以及生成——反映出对非字面基础、机制感知推理以及超越判别性标签的评估日益增长的需求。

## 3 任务层级:识别、解释与生成

我们将现有工作组织为三个能力层次,并将每个层次与其最直接要求的评估信号配对(图3)。该层级并非纯粹按时间顺序排列:最近的基准经常混合多个层次,但这种区分是有用的,因为标签预测的增益不会自动转移到解释或生成上。

### 3.1 第1层:识别

识别任务询问多模态输入是否包含幽默、讽刺效果,在更细粒度的设定中,询问哪些组件体现了这种效果。典型问题包括二元或多类分类、目标或角色提取以及强度估计。这些任务主导了多模态讽刺、模因分类和视觉幽默检测的早期工作。它们需要可靠的视觉-文本对齐和对局部线索的敏感性,但本身并不能验证模型是否掌握了使某个制品变得有趣或具有批判性的机制。

识别任务通常使用判别性指标进行评估,例如准确率、F1分数、AUROC或与人类评分的相关性。这些指标适用于测试线索敏感性和类别分离,但仍然是真正理解的弱代理指标:一个模型可以通过利用重复出现的表面模式来预测正确标签,而无法解释预期含义。

### 3.2 第2层:解释与推理

解释任务要求模型解释某个制品**为何**幽默、讽刺或具有反讽意味。一个有用的区分是**描述性解释**,它将显著线索语言化或复述笑点;以及**基于机制的推理**,它识别产生效果的具体冲突、类比、目标或叙事步骤。

相似文章