用于事实核查的多模态声明提取
摘要
研究人员提出了首个用于从社交媒体中进行多模态声明提取的基准,评估了最先进的多模态大语言模型,并引入了MICE——一个意图感知框架,在处理图文结合帖子中的修辞意图和上下文线索方面有所改进。
arXiv:2604.16311v1 公告类型:新发布
摘要:自动事实核查(AFC)依赖于声明提取作为第一步,但现有方法在很大程度上忽视了当今虚假信息的的多模态特性。社交媒体帖子通常将简短、非正式的文字与图像(如表情包、截图和照片)结合在一起,这带来了与纯文本声明提取以及图像描述或视觉问答等研究较为充分的多模态任务不同的挑战。在本工作中,我们提出了首个用于从社交媒体中进行多模态声明提取的基准,该基准由包含文字和一张或多张图片的帖子组成,并附有来自真实fact-checker的金标准声明标注。我们在一个三部分评估框架(语义对齐、忠实度和去情境化)下评估了最先进的MMLLM,发现基线模型在建模修辞意图和上下文线索方面存在困难。为解决这一问题,我们引入了MICE,一个意图感知框架,在意图关键案例中表现出改进。
相似文章
口语对话中的上下文感知多模态声明验证
本文介绍了MAD2,一个用于口语对话中多模态声明验证的新基准,并提出了音频和文本模型的校准融合,利用对话上下文来提高验证准确性。
多模态大语言模型的计算幽默:方法、数据集、评估与挑战
本综述探讨了多模态大语言模型中的计算幽默理解,涵盖了方法、数据集、评估协议以及诸如易受捷径影响的评估和证据基础薄弱等挑战。
多模态大语言模型在阅读前先看吗?诊断上下文谄媚现象
本文介绍了大语言模型中的多模态上下文谄媚现象,即外部文本覆盖视觉证据,并提出了一种使用 System-2 Visual Arbitration 的诊断方法来提高性能。
多视角证据合成与推理的无监督多模态实体链接
MSR-MEL 提出一种无监督框架,利用大语言模型对多视角证据进行合成与推理,实现多模态实体链接,在标准基准上全面超越既有方法。
情感体验、表达与感知:多模态社交媒体帖子的情感分析
本文介绍了Mult2EMo数据集,用于研究多模态社交媒体帖子中的情感表达与感知,发现重构情感表达具有挑战性,尤其是当帖子严重依赖图像时。