多模态大语言模型的计算幽默:方法、数据集、评估与挑战
摘要
本综述探讨了多模态大语言模型中的计算幽默理解,涵盖了方法、数据集、评估协议以及诸如易受捷径影响的评估和证据基础薄弱等挑战。
查看缓存全文
缓存时间: 2026/07/22 10:42
论文页面 - 基于多模态大语言模型的计算幽默:方法、数据集、评估与挑战
来源:https://huggingface.co/papers/2607.19011
摘要
对于AI系统而言,理解模因、卡通和漫画中的多模态幽默仍然具有挑战性,因为其预期含义依赖于非字面机制、共享文化知识和交际意图,而非字面的场景描述。本综述聚焦于单图像和多面板作品中的视觉幽默理解,同时将幽默生成视为一个新兴的待探索前沿。我们将现有文献与之前的幽默、讽刺及通用多模态大语言模型(MLLM)综述进行对比,并采用以能力为中心的层级结构(涵盖识别、解释与推理、生成)来组织内容。在此视角下,我们综合分析了基准设计、评估协议和建模范式,梳理了该领域从任务特定融合模型向基于多模态对齐、证据驱动推理和可控生成的大模型方法的转变。最后,我们指出了当前面临的主要障碍:易受捷径影响的评估、有限的文化与叙事覆盖范围、薄弱的证据基础,以及尚未解决的安全性和所有权问题。
查看 arXiv 页面 (https://arxiv.org/abs/2607.19011)查看 PDF (https://arxiv.org/pdf/2607.19011)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.19011)
在您的 agent 中获取此论文:
hf papers read 2607\.19011
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2607.19011,以便从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
请在数据集 README.md 中引用 arxiv.org/abs/2607.19011,以便从此页面链接。
引用此论文的 Spaces0
没有 Space 链接此论文
请在 Space README.md 中引用 arxiv.org/abs/2607.19011,以便从此页面链接。
包含此论文的收藏集0
没有收藏集包含此论文
请将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 中,以便从此页面链接。
相似文章
多模态大语言模型的计算幽默:方法、数据集、评估与挑战
关于使用大语言模型进行多模态幽默理解的全面综述,涵盖方法、数据集、评估协议以及在解读迷因、卡通和漫画中幽默的挑战。
HumorRank:基于锦标赛的排行榜,用于评估大语言模型的幽默生成能力
HumorRank 通过成对比较和 Bradley-Terry 最大似然估计,构建锦标赛式排行榜,对 LLM 的幽默生成进行排名,发现幽默质量取决于喜剧技巧而非模型规模。
多模态LLM中的乘法:基于文本、图像和音频输入的计算
# 论文页面 - 多模态LLM中的乘法:基于文本、图像和音频输入的计算 来源:[https://huggingface.co/papers/2604.18203](https://huggingface.co/papers/2604.18203) ## 摘要 多模态大语言模型在不同的表示形式与模态下执行精确的多位数乘法时,均表现出一致的计算局限性;其性能与一种新颖的算术负载指标密切相关,该指标比传统的步骤计数方法更能预测准确性
超越玩笑:多角度推理用于检测和解释模因中的有害幽默
本文介绍了MAR-12,一个利用视觉语言模型和多角度推理来检测和解释模因中有害幽默的框架,在PrideMM和Memotion数据集上达到了最先进的准确率。
多模态大语言模型评估中我们缺失了什么?
本文回顾了当前多模态大语言模型评估基准,找出了关键差距,如时空连贯性、物理世界理解、多模态一致性和选择性注意力,并指出现有的孤立任务基准无法衡量真正的跨模态整合。