多模态大语言模型的计算幽默:方法、数据集、评估与挑战
摘要
本综述探讨了多模态大语言模型中的计算幽默理解,涵盖了方法、数据集、评估协议以及诸如易受捷径影响的评估和证据基础薄弱等挑战。
查看缓存全文
缓存时间: 2026/07/22 10:42
论文页面 - 基于多模态大语言模型的计算幽默:方法、数据集、评估与挑战
来源:https://huggingface.co/papers/2607.19011
摘要
对于AI系统而言,理解模因、卡通和漫画中的多模态幽默仍然具有挑战性,因为其预期含义依赖于非字面机制、共享文化知识和交际意图,而非字面的场景描述。本综述聚焦于单图像和多面板作品中的视觉幽默理解,同时将幽默生成视为一个新兴的待探索前沿。我们将现有文献与之前的幽默、讽刺及通用多模态大语言模型(MLLM)综述进行对比,并采用以能力为中心的层级结构(涵盖识别、解释与推理、生成)来组织内容。在此视角下,我们综合分析了基准设计、评估协议和建模范式,梳理了该领域从任务特定融合模型向基于多模态对齐、证据驱动推理和可控生成的大模型方法的转变。最后,我们指出了当前面临的主要障碍:易受捷径影响的评估、有限的文化与叙事覆盖范围、薄弱的证据基础,以及尚未解决的安全性和所有权问题。
查看 arXiv 页面 (https://arxiv.org/abs/2607.19011)查看 PDF (https://arxiv.org/pdf/2607.19011)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.19011)
在您的 agent 中获取此论文:
hf papers read 2607\.19011
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2607.19011,以便从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
请在数据集 README.md 中引用 arxiv.org/abs/2607.19011,以便从此页面链接。
引用此论文的 Spaces0
没有 Space 链接此论文
请在 Space README.md 中引用 arxiv.org/abs/2607.19011,以便从此页面链接。
包含此论文的收藏集0
没有收藏集包含此论文
请将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 中,以便从此页面链接。
相似文章
多模态大语言模型的计算幽默:方法、数据集、评估与挑战
关于使用大语言模型进行多模态幽默理解的全面综述,涵盖方法、数据集、评估协议以及在解读迷因、卡通和漫画中幽默的挑战。
我构建了一个基准测试,用于测试LLMs是否能够理解并创作笑话
一位开发者构建了一个名为lolbench的基准测试,用于评估LLMs在理解与创作笑话方面的表现,揭示了模型在解释真实笑话时表现强劲,但在解释失败的笑话时表现不佳,并融入了人类投票进行偏好测试。
HumorRank:基于锦标赛的排行榜,用于评估大语言模型的幽默生成能力
HumorRank 通过成对比较和 Bradley-Terry 最大似然估计,构建锦标赛式排行榜,对 LLM 的幽默生成进行排名,发现幽默质量取决于喜剧技巧而非模型规模。
多模态LLM中的乘法:基于文本、图像和音频输入的计算
# 论文页面 - 多模态LLM中的乘法:基于文本、图像和音频输入的计算 来源:[https://huggingface.co/papers/2604.18203](https://huggingface.co/papers/2604.18203) ## 摘要 多模态大语言模型在不同的表示形式与模态下执行精确的多位数乘法时,均表现出一致的计算局限性;其性能与一种新颖的算术负载指标密切相关,该指标比传统的步骤计数方法更能预测准确性
MultiHuSE:一个用于幽默风格和情感的多模态数据集
本文介绍了MultiHuSE,这是一个多模态数据集,包含演员视频,标注了幽默风格和情感。基线实验表明,多模态融合比单模态方法提高了幽默风格分类的准确性。