超越准确性:模因中仇恨言论检测的视觉-语言模型定性分析
摘要
本文对模因中仇恨言论检测的视觉-语言模型进行定性分析,评估了它们在零样本和少样本提示下的性能和推理能力。
arXiv:2608.26143v1 公告类型:新
摘要:模因已成为一种强大的工具,个人通过它分享关于当代社会和政治问题的观点。其匿名性以及病毒式传播的能力使其成为传播仇恨的有力媒介。识别这种复杂且依赖上下文的仇恨言论仍然非常困难。尽管视觉-语言模型(VLMs)在多模态任务上表现出色,但它们往往忽略上下文、讽刺和其他在识别仇恨模因中起关键作用的微妙线索。在本研究中,我们对四种最先进的VLMs进行了定性分析:LLaVA-7B、Qwen-VL、GPT-4o mini和Claude 3 Haiku。我们评估了这些模型在零样本和少样本提示下的表现,以检验上下文框架如何影响其输出。我们的分析超越了简单的分类准确性,专注于模型生成理由的定性评估,以更深入地理解它们在处理仇恨模因时的思维过程和限制。
查看缓存全文
缓存时间: 2026/08/28 09:20
# Taylor and Francis 图书章节
来源:https://arxiv.org/html/2608.26143
###### 目录
1. 0超越准确率:视觉语言模型在表情包仇恨言论检测中的定性分析 (https://arxiv.org/html/2608.26143#id2)1. 1引言 (https://arxiv.org/html/2608.26143#Ch0.S1) 2. 2研究方法 (https://arxiv.org/html/2608.26143#Ch0.S2)1. 1数据集 (https://arxiv.org/html/2608.26143#Ch0.S2.SS1) 2. 2模型与提示配置 (https://arxiv.org/html/2608.26143#Ch0.S2.SS2) 3. 3任务设定与评估 (https://arxiv.org/html/2608.26143#Ch0.S2.SS3) 3. 3实证分析与发现 (https://arxiv.org/html/2608.26143#Ch0.S3)1. 1定性错误分析 (https://arxiv.org/html/2608.26143#Ch0.S3.SS1)1. 提示敏感性与推理失败 (https://arxiv.org/html/2608.26143#Ch0.S3.SS1.SSSx1) 2. 分类正确但推理有缺陷 (https://arxiv.org/html/2608.26143#Ch0.S3.SS1.SSSx2) 3. 上下文误解 (https://arxiv.org/html/2608.26143#Ch0.S3.SS1.SSSx3) 4. 对关键词过度敏感 (https://arxiv.org/html/2608.26143#Ch0.S3.SS1.SSSx4) 5. 无法检测编码或细微的仇恨言论 (https://arxiv.org/html/2608.26143#Ch0.S3.SS1.SSSx5) 2. 2量化表现概览 (https://arxiv.org/html/2608.26143#Ch0.S3.SS2) 3. 3讨论 (https://arxiv.org/html/2608.26143#Ch0.S3.SS3) 4. 4结论与未来展望 (https://arxiv.org/html/2608.26143#Ch0.S4)
2. 参考文献 (https://arxiv.org/html/2608.26143#bib)
\\chapterauthor
Muhammad Jawad Chowdhuryhttps://orcid.org/0009-0009-4129-546X, Adiba Hasanhttps://orcid.org/0009-0006-9072-4054, Ishrak Hossainhttps://orcid.org/0009-0004-1995-6122, Shahriar Ivan✉https://orcid.org/0009-0001-2801-3028, and Sabbir Ahmedhttps://orcid.org/0000-0001-5928-4886孟加拉国加济布尔伊斯兰科技大学计算机科学与工程系。\{jawad, adibahasan, ishrakhossain, shahriarivan, sabbirahmed\}@iut-dhaka.edu
## 章节 0超越准确率:视觉语言模型在表情包仇恨言论检测中的定性分析
\\chaptermark
超越准确率:视觉语言模型在表情包仇恨言论检测中的定性分析
\\chapterinitial
表情包已成为一种强大的工具,个人借此分享他们对当代社会和政治问题的看法。其匿名性以及病毒式传播的能力,使其成为传播仇恨的强大媒介。识别此类复杂且依赖上下文的仇恨言论仍然非常困难。尽管视觉语言模型(VLMs)在多模态任务上表现出色,但它们往往忽略上下文、讽刺以及其他在识别仇恨表情包中起关键作用的微妙线索。在这项工作中,我们对四种最先进的VLMs:LLaVA-7B、Qwen-VL、GPT-4o mini和Claude 3 Haiku进行了定性分析。我们在零样本和少样本提示下评估这些模型,以研究上下文框架如何影响其输出。我们的分析超越了简单的分类准确率,重点关注对模型生成理由的定性评估,从而更深入地理解它们在处理仇恨表情包时的思维过程和局限性。
### 1引言
作为一种文化表达形式,表情包通常是带有简短幽默文本的图像内容,在网络上广泛传播。虽然它们通常用于娱乐,但也可以用来表达针对个人或社区的仇恨言论,不幸的是,这在近年来已成为一个非常普遍的问题\[24 (https://arxiv.org/html/2608.26143#bib.bib9)\]。围绕网络仇恨日益增长的社会关注,促使业界和学术界投入越来越多的努力来应对这一挑战\[50 (https://arxiv.org/html/2608.26143#bib.bib70),21 (https://arxiv.org/html/2608.26143#bib.bib71),31 (https://arxiv.org/html/2608.26143#bib.bib72),36 (https://arxiv.org/html/2608.26143#bib.bib1)\]。当内在的上下文需要同时参考图像和文本时\[29 (https://arxiv.org/html/2608.26143#bib.bib10)\],这项任务就变得更加具有挑战性。在多模态数据的情况下,仇恨言论可能源于文本和图像的综合解释,而不是分别考虑的各个单独模态。每个模态单独看似乎都无害,但当它们结合在一起时,整体上可能会传递出冒犯性或仇恨性的信息\[38 (https://arxiv.org/html/2608.26143#bib.bib52),13 (https://arxiv.org/html/2608.26143#bib.bib74)\]。
参考图片
参考图片
参考图片
图1:来自仇恨表情包挑战数据集(HMCD)\[36 (https://arxiv.org/html/2608.26143#bib.bib1)\]的样本表情包图像演示,在不理解上下文的情况下,很难捕捉到针对特定社群的潜在仇恨言论。这里的表情包需要在理解上下文的同时进行多模态解读。最近,深度学习的进展通过在计算机视觉\[6 (https://arxiv.org/html/2608.26143#bib.bib5),47 (https://arxiv.org/html/2608.26143#bib.bib4),23 (https://arxiv.org/html/2608.26143#bib.bib16),5 (https://arxiv.org/html/2608.26143#bib.bib15)\]、自然语言处理\[34 (https://arxiv.org/html/2608.26143#bib.bib20),42 (https://arxiv.org/html/2608.26143#bib.bib2)\]及相关领域\[27 (https://arxiv.org/html/2608.26143#bib.bib13),15 (https://arxiv.org/html/2608.26143#bib.bib12),33 (https://arxiv.org/html/2608.26143#bib.bib8),14 (https://arxiv.org/html/2608.26143#bib.bib11)\]的广泛应用,为各种下游任务提供了最先进的解决方案,从而革新了现代时代。在这些进展的基础上,现代语言模型在大规模知识表示、上下文推理和语义结构捕获方面展现出巨大潜力\[8 (https://arxiv.org/html/2608.26143#bib.bib14),35 (https://arxiv.org/html/2608.26143#bib.bib3),9 (https://arxiv.org/html/2608.26143#bib.bib7),7 (https://arxiv.org/html/2608.26143#bib.bib6)\]。这催生了大型语言模型(LLMs)\[37 (https://arxiv.org/html/2608.26143#bib.bib24)\]和视觉语言模型(VLMs)\[26 (https://arxiv.org/html/2608.26143#bib.bib25)\]的出现,它们将这些能力扩展到多模态理解领域。LLMs和VLMs在生成类人文本和理解复杂多媒体内容方面表现出强大的性能\[19 (https://arxiv.org/html/2608.26143#bib.bib68),12 (https://arxiv.org/html/2608.26143#bib.bib23),1 (https://arxiv.org/html/2608.26143#bib.bib22),20 (https://arxiv.org/html/2608.26143#bib.bib69)\]。由于表情包本质上是多模态的,常常依赖于讽刺、文化细微差别以及复杂的视觉-文本交互,它们为评估此类模型的实际推理能力提供了一个特别具有挑战性的测试平台。
最近多模态学习的进展激发了将VLMs应用于表情包分析这一复杂任务的兴趣\[10 (https://arxiv.org/html/2608.26143#bib.bib80),30 (https://arxiv.org/html/2608.26143#bib.bib73)\]。Kiela等人提出的仇恨表情包挑战数据集\[36 (https://arxiv.org/html/2608.26143#bib.bib1)\]引入了一个基准,其中,当综合解释时,单独无害的模态可能形成仇恨信息。Mathias等人\[39 (https://arxiv.org/html/2608.26143#bib.bib63)\]通过增加两个子任务扩展了该数据集,目标是识别表情包中的仇恨类别。这一方向的早期研究包括使用CLIP\[46 (https://arxiv.org/html/2608.26143#bib.bib55)\],它将图像和文本映射到一个共享的嵌入空间。然而,这些系统如HateCLIPper\[38 (https://arxiv.org/html/2608.26143#bib.bib52)\]和MemeCLIP\[17 (https://arxiv.org/html/2608.26143#bib.bib53)\],作为一个关键限制,常常难以检测隐蔽的或具有文化细微差别的仇恨,因为它们更多地依赖表征匹配,而非深层的上下文推理。
现代的预训练VLMs,如Flamingo\[10 (https://arxiv.org/html/2608.26143#bib.bib80)\]、LLaVA\[40 (https://arxiv.org/html/2608.26143#bib.bib31)\]和GPT-4\[44 (https://arxiv.org/html/2608.26143#bib.bib81)\],最近获得了显著的关注。像MemeGuard\[32 (https://arxiv.org/html/2608.26143#bib.bib28)\]这样的框架使用了经过微调的VLM来解释表情包上下文,而He等人\[28 (https://arxiv.org/html/2608.26143#bib.bib62)\]提出了包含潜在仇恨上下文原因标注的HatReD数据集。最近的几项研究工作集中在有效的提示策略上,以引导VLM的推理。Gavit等人\[25 (https://arxiv.org/html/2608.26143#bib.bib27),41 (https://arxiv.org/html/2608.26143#bib.bib51)\]对VLM在各种表情包分类任务上的能力进行了结构化分析,比较了零样本学习\[48 (https://arxiv.org/html/2608.26143#bib.bib21)\]、少样本学习\[4 (https://arxiv.org/html/2608.26143#bib.bib19),2 (https://arxiv.org/html/2608.26143#bib.bib18)\]和思维链(CoT)\[52 (https://arxiv.org/html/2608.26143#bib.bib17)\]等方法。类似地,Zhuang等人\[55 (https://arxiv.org/html/2608.26143#bib.bib58)\]在GPT-4上使用思维链提示取得了最先进的结果,Van和Wu\[49 (https://arxiv.org/html/2608.26143#bib.bib56)\]引入了一种定义引导的提示策略。
除了基准性能之外,关于这些模型常见失败模式的大量研究,为我们的定性分析提供了基础\[30 (https://arxiv.org/html/2608.26143#bib.bib73)\]。上下文误解这一核心挑战——即模型无法综合多模态线索——本身就是仇恨表情包挑战的主要动机之一\[36 (https://arxiv.org/html/2608.26143#bib.bib1)\]。模型对关键词过度敏感(一种非预期偏见,即只要出现敏感词,无论上下文如何都会导致错误分类)的情况常常加剧了这一点\[22 (https://arxiv.org/html/2608.26143#bib.bib83)\]。此外,研究强调了在检测编码或细微仇恨方面的持续弱点,特别是当涉及讽刺或反语时,模型常常按字面意思解释\[51 (https://arxiv.org/html/2608.26143#bib.bib84)\]。或许最微妙的是,研究人员发现模型有时通过完全错误的推理得出正确分类的现象——一种“错误原因导致正确结果”的问题,掩盖了真正的理解缺失\[43 (https://arxiv.org/html/2608.26143#bib.bib45)\]。这些已确认的挑战凸显了仅依赖准确率指标的局限性,并促使我们对VLM评估采取更深入、更具诊断性的方法\[16 (https://arxiv.org/html/2608.26143#bib.bib85)\]。
虽然现有文献已识别出这些关键的失败模式,但大多数对现代VLMs的经验评估仍然优先考虑一组狭窄的量化指标或仅测试有限范围的模型。一个关键的空白仍然存在于理解不同模型架构(例如开源和基于API的模型)在不同提示条件下的定性推理和失败模式方面有何异同。大多数现有工作侧重于分类准确率,而对不同模型决策过程中的重要因素研究不足。为了解决这一空白,我们的工作做出了以下关键贡献:
- 对四种现代VLMs进行了严格的实证评估:LLaVA-7B、Qwen-VL、GPT-4o mini和Claude 3 Haiku,以比较它们的能力。
- 通过为每个模型比较零样本方法和富含上下文的少样本方法,系统地分析了提示策略的影响,揭示了它们对提示设计的敏感性。
- 详细的定性分析展示了已建立的失败模式(如推理缺陷和上下文误解)如何在这些模型中表现出来。
### 2研究方法
为了评估现代VLMs在多模态表情包中检测仇恨言论的有效性,我们使用四种最先进的模型在两种提示策略下进行了实证研究。我们的重点是定性分析,以捕捉模型推理和失败模式的细微差别,而不是仅仅依赖量化指标。图2 (https://arxiv.org/html/2608.26143#Ch0.F2)概述了研究方法,包括三个部分:1) 数据集描述,2) 模型与提示设置,3) 支持分析的任务设定与评估指标。
#### 1数据集
我们使用了仇恨表情包挑战数据集(HMCD)\[36 (https://arxiv.org/html/2608.26143#bib.bib1)\]进行实验,该数据集是在NeurIPS 2020仇恨表情包竞赛中提出的。由于表情包分类通常依赖于视觉和文本内容的联合解释,该基准专门用于评估复杂的多模态推理。该数据集的一个关键挑战是包含了良性混淆项(benign confounders),即那些通过单一模态看似仇恨,但当两个模态结合考虑时却是非仇恨的实例。
完整数据集包含10,000个图像-文本对,标记为仇恨或非仇恨。每个样本属于以下五个语义类别之一\[36 (https://arxiv.org/html/2608.26143#bib.bib1)\]:
- 随机非仇恨:不含恶意内容的表情包。
- 良性图像混淆项:仅凭说明文字看似仇恨,但图像否定了其仇恨含义。
- 良性文本混淆项:仅从图像看似仇恨,但说明文字澄清了其意图。
- 单模态仇恨:表情包仅基于图像或文本之一是仇恨的。
- 多模态仇恨:仇恨性仅在图像和文本被共同解释时才会出现。
我们使用了来自dev_seen.json划分的500个表情包子集进行实验。该子集是类别平衡的,包含250个仇恨样本和250个非仇恨样本。所选示例反映了原始数据集的多样性和复杂性,涵盖了所有五个语义类别的实例。这很重要,因为在多模态仇恨检测的背景下,理解源于对视觉和文本内容的联合分析。使用平衡数据确保了模型和提示之间的公平比较。
参考图片图2:实证评估框架概述,流程从数据集采样和提示配置(零样本 vs. 少样本)到四个VLMs的评估,最终分析其分类和解释输出。
#### 2模型与提示配置
我们评估了四种大型VLMs,选择它们是为了对其多样化的推理能力提供平衡的视角。我们的选择包括以高精度视觉定位著称的模型(Qwen2-7B)\[3 (https://arxiv.org/html/2608.26143#bib.bib82)\],强大的通用推理模型(GPT-4o mini\[45 (https://arxiv.org/html/2608.26143#bib.bib36)\]、Claude 3 Haiku\[11 (https://arxiv.org/html/2608.26143#bib.bib32)\]),以及基础指令遵循能力模型(LLaVA-7B)\[40 (https://arxiv.org/html/2608.26143#bib.bib31)\]。这种选择使我们能够将三种不同的开源模型与一个高度强大的专有API模型(Claude 3 Haiku)进行比较,后者作为最先进的性能基准。为了评估模型对提示设计的敏感性,我们使用了两种不同的提示策略:零样本(zero-shot)和少样本(few-shot),这两种策略常用于评估LLMs的推理能力\[18 (https://arxiv.org/html/2608.26143#bib.bib38)\]。
表1:用于表情包分类的零样本提示示例在零样本(zero-shot)设置中,模型仅获得任务指令,要求将表情包分类为仇恨或非仇恨,并提供解释说明,不提供任何示例。相比之下相似文章
超越玩笑:多角度推理用于检测和解释模因中的有害幽默
本文介绍了MAR-12,一个利用视觉语言模型和多角度推理来检测和解释模因中有害幽默的框架,在PrideMM和Memotion数据集上达到了最先进的准确率。
AHA-Memes:用于理解阿拉伯语迷因中仇恨的细粒度多模态基准
本文介绍了 AHA-Memes,这是首个具有细粒度多标签注释的大规模阿拉伯语仇恨迷因基准,包含 5K 条人工注释和约 66K 条银标签迷因,并评测了多种多模态模型在基于文化的仇恨检测中的表现。
ZeroR@CHiPSAL 2026:基于对比学习的两阶段视觉-语言适配用于尼泊尔表情包分类
本文描述了一个用于尼泊尔表情包分类的两阶段视觉-语言适配系统,使用Qwen3-VL-8B-Instruct,结合LoRA微调和对比学习。该系统在CHiPSAL 2026共享任务中,在仇恨言论检测中排名第二,在情感分析中排名第四。
小型视觉-语言模型知道自己错了但说不出来:一项关于在现实图像退化下陈述信心与内部信心的双模型研究
本文评估了小型开源视觉-语言模型(Qwen2-VL-2B和SmolVLM)如何处理现实图像退化,发现它们口头表达的信心不可靠,而内部令牌概率提供了更好的错误检测能力,尽管两者在严重低光条件下均失败。
在辩论中辨别是非:中文有害迷因的归因分析
本文介绍了Ex-ToxiCN-MM——首个中文有害迷因解释数据集,以及知识库C-HarmKB和归因分析框架RIKE,通过考虑文化背景和语义模糊性,提升有害迷因的可解释检测能力。