多模态大语言模型的计算幽默:方法、数据集、评估与挑战

Hugging Face Daily Papers 论文

摘要

本综述探讨了多模态大语言模型中的计算幽默理解,涵盖了方法、数据集、评估协议以及诸如易受捷径影响的评估和证据基础薄弱等挑战。

模因、卡通和漫画中的多模态幽默对于AI系统而言仍然困难,因为其预期含义依赖于非字面机制、共享文化知识和交际意图,而非字面的场景描述。本综述聚焦于单图像和多面板制品中的视觉幽默理解,同时将幽默生成视作一个新兴的前沿下游任务。我们将其与先前的幽默、讽刺和通用MLLM综述进行对比,并使用以能力为中心的分层结构来组织文献,涵盖识别、解释与推理以及生成。在此视角下,我们综合了基准设计、评估协议和建模范式,追溯了该领域从特定任务融合模型到基于多模态对齐、证据驱动的推理和受控生成的大模型方法的转变。最后,我们强调了进展的主要障碍:易受捷径影响的评估、有限的文化和叙事覆盖、薄弱的证据支持,以及未解决的安全和所有权问题。
查看原文
查看缓存全文

缓存时间: 2026/07/22 10:42

论文页面 - 基于多模态大语言模型的计算幽默:方法、数据集、评估与挑战

来源:https://huggingface.co/papers/2607.19011

摘要

对于AI系统而言,理解模因、卡通和漫画中的多模态幽默仍然具有挑战性,因为其预期含义依赖于非字面机制、共享文化知识和交际意图,而非字面的场景描述。本综述聚焦于单图像和多面板作品中的视觉幽默理解,同时将幽默生成视为一个新兴的待探索前沿。我们将现有文献与之前的幽默、讽刺及通用多模态大语言模型(MLLM)综述进行对比,并采用以能力为中心的层级结构(涵盖识别、解释与推理、生成)来组织内容。在此视角下,我们综合分析了基准设计、评估协议和建模范式,梳理了该领域从任务特定融合模型向基于多模态对齐、证据驱动推理和可控生成的大模型方法的转变。最后,我们指出了当前面临的主要障碍:易受捷径影响的评估、有限的文化与叙事覆盖范围、薄弱的证据基础,以及尚未解决的安全性和所有权问题。

查看 arXiv 页面 (https://arxiv.org/abs/2607.19011)查看 PDF (https://arxiv.org/pdf/2607.19011)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.19011)

在您的 agent 中获取此论文:

hf papers read 2607\.19011

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

请在模型 README.md 中引用 arxiv.org/abs/2607.19011,以便从此页面链接。

引用此论文的数据集0

没有数据集链接此论文

请在数据集 README.md 中引用 arxiv.org/abs/2607.19011,以便从此页面链接。

引用此论文的 Spaces0

没有 Space 链接此论文

请在 Space README.md 中引用 arxiv.org/abs/2607.19011,以便从此页面链接。

包含此论文的收藏集0

没有收藏集包含此论文

请将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 中,以便从此页面链接。

相似文章

多模态LLM中的乘法:基于文本、图像和音频输入的计算

Hugging Face Daily Papers

# 论文页面 - 多模态LLM中的乘法:基于文本、图像和音频输入的计算 来源:[https://huggingface.co/papers/2604.18203](https://huggingface.co/papers/2604.18203) ## 摘要 多模态大语言模型在不同的表示形式与模态下执行精确的多位数乘法时,均表现出一致的计算局限性;其性能与一种新颖的算术负载指标密切相关,该指标比传统的步骤计数方法更能预测准确性

多模态大语言模型评估中我们缺失了什么?

arXiv cs.AI

本文回顾了当前多模态大语言模型评估基准,找出了关键差距,如时空连贯性、物理世界理解、多模态一致性和选择性注意力,并指出现有的孤立任务基准无法衡量真正的跨模态整合。