ZeroR@CHiPSAL 2026:基于对比学习的两阶段视觉-语言适配用于尼泊尔表情包分类

arXiv cs.CL 论文

摘要

本文描述了一个用于尼泊尔表情包分类的两阶段视觉-语言适配系统,使用Qwen3-VL-8B-Instruct,结合LoRA微调和对比学习。该系统在CHiPSAL 2026共享任务中,在仇恨言论检测中排名第二,在情感分析中排名第四。

arXiv:2607.28637v1 公告类型:新 摘要:本文介绍了我们在CHiPSAL 2026共享任务中针对尼泊尔表情包的多模态仇恨言论与情感检测系统。我们处理两个子任务:二分类仇恨言论检测和三分类情感分析。我们的方法采用鲁棒仇恨表情包检测(RA-HMD)框架,使用Qwen3-VL-8B-Instruct——一个原生支持天城文的先进视觉-语言模型。我们采用两阶段训练流程:(1)使用MLP投影头进行LoRA微调,用于生成式分类;(2)使用监督InfoNCE损失进行对比骨干网络微调。我们通过少数类过采样、图像增强和焦点损失来处理类别不平衡。在推理时,我们使用验证集调优的权重将阶段1的token概率与阶段2的分类器得分进行集成。我们的端到端方法利用模型对天城文的本土理解,消除了单独OCR和翻译流程带来的错误传播。我们的系统在仇恨言论检测中取得\textbf{第2名}(F1: 0.797),在情感分析中取得\textbf{第4名}(F1: 0.518)。我们提供了详细的消融实验、错误分析以及关于使大型视觉-语言模型适配低资源南亚语言的见解。
查看原文
查看缓存全文

缓存时间: 2026/08/03 07:32

# ZeroR@CHiPSAL 2026:基于对比学习的双阶段视觉-语言适配用于尼泊尔梗图分类
来源:https://arxiv.org/html/2607.28637
###### 摘要

本文介绍了我们参与 CHiPSAL 2026 共享任务(尼泊尔梗图多模态仇恨言论与情感检测)的系统。我们处理两个子任务:二分类仇恨言论分类和三分类情感分析。我们的方法基于 Qwen3-VL-8B-Instruct(一种具有原生天城文支持的最新视觉-语言模型),对 Robust Adaptation of Hateful Meme Detection(RA-HMD)框架进行了适配。我们采用了两阶段训练流程:(1) 使用带 MLP 投影头的 LoRA 微调进行生成式分类;(2) 使用有监督 InfoNCE 损失进行对比骨干微调。通过少数类过采样、图像增强和焦点损失来处理类别不平衡问题。在推理时,我们使用验证集调优的权重将阶段 1 的 token 概率与阶段 2 的分类器分数进行集成。通过利用模型对天城文的原生理解,我们的端到端方法消除了分离的 OCR 和翻译流程带来的错误传播。我们的系统在仇恨言论检测中取得第 2 名(F1:0.797),在情感分析中取得第 4 名(F1:0.518)。我们提供了详细的消融实验、错误分析以及关于将大型视觉-语言模型适配到低资源南亚语言的见解。

关键词:仇恨言论检测、情感分析、视觉-语言模型、尼泊尔语、多模态、对比学习、低资源语言

\NAT@set@cites

ZeroR@CHiPSAL 2026:基于对比学习的双阶段视觉-语言适配用于尼泊尔梗图分类

Nitiz KhanalPulchowk Campus, Institute of Engineering, Tribhuvan UniversityLalitpur, Nepalkhanalnitij20@gmail\.com摘要内容

## 1\. 引言

梗图在社交媒体平台上的激增给内容审核系统带来了新的挑战。与传统文本或图像分类不同,梗图需要理解视觉元素与文本元素之间复杂的相互作用,其含义往往产生于两者的结合,而不是任一单一模态(Kiela 等人,2020 (https://arxiv.org/html/2607.28637#bib.bib15))。一幅看似无害的图片配上特定文字可能传达仇恨,而幽默图片上带有攻击性的文字则可能完全是良性的。对于低资源语言,这种多模态推理挑战更加严峻,因为标注数据集稀缺,预训练模型对该语言及其文化背景的接触有限(Parihar 等人,2021 (https://arxiv.org/html/2607.28637#bib.bib6))。

尼泊尔语约有 3200 万使用者,其对自动化内容审核提出了独特的挑战。该语言使用天城文,直接嵌入在梗图图像中,而非作为独立文本出现。植根于尼泊尔社会的文化引用、幽默风格和隐含意义增加了通用模型可能无法捕捉的复杂性。此外,尼泊尔语与英语的语码混合在社交媒体中很常见,这也带来了额外的处理挑战。

第二届南亚语言处理挑战研讨会(CHiPSAL 2026)与 LREC-COLING 2026 联合举办,通过聚焦于南亚语言处理的共享任务来应对这些挑战(Sarveswaran 等人,2026 (https://arxiv.org/html/2607.28637#bib.bib2))。我们参加了多模态仇恨与情感检测任务(Thapa 等人,2026 (https://arxiv.org/html/2607.28637#bib.bib1)),该任务提供了从社交媒体平台收集的精心策划的尼泊尔梗图数据集(Thapa 等人,2025b (https://arxiv.org/html/2607.28637#bib.bib3),c (https://arxiv.org/html/2607.28637#bib.bib4);Bhandari 等人,2023 (https://arxiv.org/html/2607.28637#bib.bib5))。该共享任务包含两个子任务:

- •子任务 A – 仇恨言论检测:将梗图二分类为仇恨性(针对基于种族、宗教、性别或种姓的群体,或宣扬暴力/歧视的内容)或安全。
- •子任务 B – 情感分析:将梗图三分类为负面、中性或正面情感类别。

我们的方法利用了视觉-语言模型(VLM)的最新进展,特别将 Robust Adaptation of Large Multimodal Models(RA-HMD)框架(Mei 等人,2025 (https://arxiv.org/html/2607.28637#bib.bib8))适配到低资源尼泊尔内容。我们并未构建涉及 OCR 提取、机器翻译和独立文本/图像编码器的复杂流程,而是利用了 Qwen3-VL-8B-Instruct(Wang 等人,2024 (https://arxiv.org/html/2607.28637#bib.bib10)),这是一个支持包括天城文在内的多种文字的最新 VLM。这种端到端方法消除了基于流程的系统中可能出现的错误传播。

我们的主要贡献是:

1. 1.一个结合生成式微调与对比学习的两阶段训练框架,从 RA-HMD 适配而来,用于低资源多模态分类。
2. 2.针对二分类仇恨言论检测与三分类情感分析的不同挑战,设计了任务特定的配置。

我们的系统在仇恨言论检测中取得第 2 名(F1:0.797),在情感分析中取得第 4 名(F1:0.518),证明了将现代 VLM 适配到低资源多模态任务的有效性。

## 2\. 相关工作

### 2\.1\. 多模态仇恨言论检测

随着 Facebook Hateful Memes Challenge(Kiela 等人,2020 (https://arxiv.org/html/2607.28637#bib.bib15))的出现,多模态内容中的仇恨言论检测挑战受到了广泛关注,该挑战表明简单的单模态表示融合是不够的。该挑战还表明,即使最先进的视觉和语言模型,在面对通过图像与文本之间微妙交互传达的仇恨时也会遇到困难。

后续工作探索了各种融合策略,从拼接特征的早期融合方法到更复杂的跨模态注意力机制。Pramanick 等人(2021 (https://arxiv.org/html/2607.28637#bib.bib20))引入了检测有害梗图并识别其目标的方法,而 Bhandari 等人(2023 (https://arxiv.org/html/2607.28637#bib.bib5))通过 CrisisHateMM 数据集将多模态仇恨言论分析扩展到危机情境,提供了针对定向和非定向仇恨的标注方案。

最近,Mei 等人(2024 (https://arxiv.org/html/2607.28637#bib.bib9))提出了用于仇恨性梗图检测的检索引导对比学习,利用相似训练样本来引导表示学习。Mei 等人(2025 (https://arxiv.org/html/2607.28637#bib.bib8))通过 RA-HMD 框架扩展了这项工作,该框架将 LoRA 微调与基于理由的对比学习相结合,在多个英文仇恨性梗图数据集(包括 HatefulMemes、MAMI 和 PrideMM)上取得了最先进的结果。我们的工作将该框架适配到低资源尼泊尔内容。

### 2\.2\. 视觉-语言模型

大型视觉-语言模型的出现改变了多模态理解。早期的如 CLIP(Radford 等人,2021 (https://arxiv.org/html/2607.28637#bib.bib18))通过在网络规模数据上进行对比学习来学习联合图像-文本表示。最近,像 LLaVA(Liu 等人,2024 (https://arxiv.org/html/2607.28637#bib.bib19))和 Qwen-VL 系列(Wang 等人,2024 (https://arxiv.org/html/2607.28637#bib.bib10))这样的指令调优模型能够遵循复杂的多模态指令并生成详细响应。

我们用作骨干模型的 Qwen3-VL-8B-Instruct 代表了多模态理解的重大进步。该模型支持动态图像分辨率、多种语言(包括使用非拉丁文字的语言),并在各种视觉-语言基准测试中展现出强大性能。对我们的应用至关重要的是,它原生支持天城文,使得无需单独 OCR 即可端到端处理图像中嵌入的尼泊尔文本。

### 2\.3\. 参数高效微调

在下游任务上微调大型模型计算成本高昂,并可能导致灾难性遗忘。低秩适配(LoRA)(Hu 等人,2022 (https://arxiv.org/html/2607.28637#bib.bib11))通过冻结预训练权重并在 Transformer 层中注入可训练的低秩分解矩阵来解决这一问题。这种方法将可训练参数数量减少了若干个数量级,同时保持了有竞争力的性能。

对于视觉-语言模型,LoRA 已被证明特别有效,无需全量微调的计算成本即可适配新任务和新领域。我们将 LoRA 应用于 Qwen3-VL 中的所有线性投影,从而实现对尼泊尔梗图分类的高效适配。

### 2\.4\. 用于分类的对比学习

有监督对比学习(Khosla 等人,2020 (https://arxiv.org/html/2607.28637#bib.bib12))通过利用标签信息扩展了自监督对比范式。该目标将同一类别的样本表示拉近,同时将不同类别的表示推开。InfoNCE 损失(van den Oord 等人,2018 (https://arxiv.org/html/2607.28637#bib.bib14))为该目标提供了一个原则性的框架。

对于内容审核任务,对比学习有助于学习能够捕获类别间细微差异的判别性表示。Mei 等人(2024 (https://arxiv.org/html/2607.28637#bib.bib9))和 Mei 等人(2025 (https://arxiv.org/html/2607.28637#bib.bib8))证明了其在仇恨性梗图检测中的有效性,我们将该方法适配到尼泊尔内容。

### 2\.5\. 低资源语言处理

由于训练数据有限、预训练资源较少以及独特的语言特征,处理低资源语言面临着独特的挑战。大型语言模型通过跨语言迁移显示出处理此类语言的潜力(Thapa 等人,2025a (https://arxiv.org/html/2607.28637#bib.bib7)),但低资源环境下的多模态任务仍未得到充分探索。

CHiPSAL 研讨会系列(Sarveswaran 等人,2026 (https://arxiv.org/html/2607.28637#bib.bib2))旨在填补南亚语言处理方面的这些空白。先前关于尼泊尔语 NLP 的工作主要集中在文本分类和命名实体识别上,多模态分析受到的关注有限。我们的工作通过展示将最先进的 VLM 有效适配到尼泊尔多模态内容,为这一新兴领域做出了贡献。

## 3\. 数据集与任务描述

### 3\.1\. 数据集概览

该共享任务提供了从各种社交媒体平台收集的尼泊尔梗图数据集(Thapa 等人,2025b (https://arxiv.org/html/2607.28637#bib.bib3),c (https://arxiv.org/html/2607.28637#bib.bib4))。这些梗图在图像中嵌入了天城文文本,通常存在尼泊尔语和英语之间的语码混合。标注遵循既定的多模态仇恨言论协议(Bhandari 等人,2023 (https://arxiv.org/html/2607.28637#bib.bib5))。

### 3\.2\. 子任务 A:仇恨言论检测

仇恨言论数据集包含约 1,068 张带二分类标签的梗图:

- •仇恨(1):攻击、贬低或煽动对基于受保护特征(包括种族、民族、宗教、性别、种姓、国籍或残疾)的个人或群体的仇恨的内容。也包括宣扬暴力或歧视的内容。
- •安全(0):不包含仇恨言论的内容,包括中性信息、积极信息以及不针对受保护群体的幽默。

数据集存在类别不平衡,安全梗图比仇恨性梗图更常见。这种不平衡反映了社交媒体上内容的自然分布,但对分类构成了挑战。

### 3\.3\. 子任务 B:情感分析

情感数据集包含三种类别标签的梗图:

- •负面(0):表达批评、嘲笑、悲伤、愤怒、沮丧、失望或悲观的内容。
- •中性(1):事实信息、观察或没有明显情感倾向的内容。
- •正面(2):表达快乐、幽默、鼓励、庆祝、爱、希望或乐观的内容。

中性类别占据主导地位,构成了显著的类别不平衡挑战。此外,类别之间的边界可能是主观的,特别是对于以戏谑方式表达负面情绪的幽默内容。

### 3\.4\. 评估指标

两个子任务均使用宏平均 F1 分数作为主要评估指标:

Macro F1=1C∑c=1CF1c\\text\{Macro F1\}=\\frac\{1\}\{C\}\\sum\_\{c=1\}^\{C\}\\text\{F1\}\_\{c\}(1)其中 CC 是类别数,F1c\\text\{F1\}\_\{c\} 是类别 cc 的 F1 分数。该指标对每个类别给予相同的权重,而不管其频率如何,因此特别适合不平衡数据集。

### 3\.5\. 数据准备

我们创建了 85/15 的分层训练/验证划分(随机种子 42),用于调整超参数和集成权重。分层划分确保两个划分中的类别比例得以保持。所有图像都转换为 RGB 格式以保证一致性。除提供的训练集和基础 Qwen3-VL 模型外,我们不使用任何外部数据或预训练。

## 4\. 方法

我们的系统采用从 RA-HMD 框架(Mei 等人,2025 (https://arxiv.org/html/2607.28637#bib.bib8))适配而来的两阶段训练流程。图 1 (https://arxiv.org/html/2607.28637#S4.F1) 展示了整体架构。

输入:梗图 + 文本Qwen3-VL + LoRAh∈R4096\\mathbf\{h\}\\in\\mathbb\{R\}^\{4096\}LM 头阶段 1p(1)p^\{\(1\)\}MLP→z\\,\{\\to\}\\,\\mathbf\{z\}阶段 2Lcon\\mathcal\{L\}\_\{\\mathrm\{con\}\}分类器→p(2)\\to p^\{\(2\)\}w⋅p(1)+(1−w)⋅p(2)w\\cdot p^\{\(1\)\}\+\(1\{\-\}w\)\\cdot p^\{\(2\)\}集成y^=arg⁡max\\hat\{y\}=\\arg\\max输出图 1:架构概览。阶段 1 使用 LM 头获取 token 概率。阶段 2 添加带对比损失 Lcon\\mathcal\{L\}\_\{\\mathrm\{con\}\} 的 MLP 投影和一个分类器。输出进行集成,并通过 argmax 进行最终预测。

### 4\.1\. 基础模型选择

我们选择 Qwen3-VL-8B-Instruct 作为骨干模型,原因如下:

- •原生天城文支持:该模型可以直接从图像中理解和读取天城文文本,无需单独的 OCR。
- •强大的多语言能力:在多样化多语言数据上的预训练使其能够迁移到像尼泊尔语这样的低资源语言。
- •动态分辨率:模型可处理不同尺寸的图像(最小:256×282256\\times 28^\{2\},最大:512×282512\\times 28^\{2\}像素),无需固定调整大小。
- •指令遵循:模型能够遵循复杂的任务指令,从而支持基于提示的分类。

### 4\.2\. 阶段 1:使用 LoRA 的生成式微调

在阶段 1,我们对模型进行微调,使其直接从梗图图像生成类别标签。这种生成式方法利用了模型预训练的语言理解能力。

#### 4\.2\.1\. 低秩适配(LoRA)

我们没有微调所有参数,而是应用 LoRA(Hu 等人,2022 (https://arxiv.org/html/2607.28637#bib.bib11))将可训练的低秩矩阵注入模型。对于预训练权重矩阵 W0∈Rd×kW\_\{0\}\\in\\mathbb\{R\}^\{d\\times k\},LoRA 添加:

W=W0\+ΔW=W0\+BAW=W\_\{0\}\+\\Delta W=W\_\{0\}\+BA(2)其中 B∈Rd×rB\\in\\mathbb\{R\}^\{d\\times r\},A∈Rr×kA\\in\\mathbb\{R\}^\{r\\times k\},且 r≪min⁡(d,k)r\\ll\\min\(d,k\) 为秩。缩放因子 α/r\\alpha/r 调节适配的贡献。表 1 (https://arxiv.org/html/2607.28637#T1) 提供了我们的 LoRA 配置摘要。

#### 4\.2\.2\. 提示模板

表 2 (https://arxiv.org/html/2607.28637#T2) 列出了子任务 A 和 B 的提示模板。我们为每个任务定义了任务特定的指令,明确说明了类别及其定义。模型被要求仅输出一个数字(0 或 1,或 0、1、2),并进行自然语言推理。

#### 4\.2\.3\. 训练目标

对于生成式分类,我们使用标准语言建模损失:

Lgen=−log⁡pθ(y|x)L\_\{\\mathrm\{gen\}\}=\-\{\\log\}p\_\{\\theta\}\(y|x\)(3)其中 xx 是输入图像+提示,yy 是目标标签 token。该目标直接优化标签预测的概率,同时利用模型的语言理解能力。

#### 4\.2\.4\. 类别不平衡处理

仇恨言论数据集存在类别不平衡(安全类约为 65%)。我们采用了多种策略:

- •少数类过采样:对仇恨性样本进行过采样以平衡批次分布。
- •图像增强:应用轻微的水平翻转和颜色抖动(概率 0.5)以增加多样性。
- •焦点损失:我们不是优化交叉熵,而是使用焦点损失(Lin 等人,2017 (https://arxiv.org/html/2607.28637#bib.bib16)),该损失对容易分类的样本进行降权:

Lfocal=−α(1−pt)γlog⁡(pt)L\_\{\\mathrm\{focal\}\}=\-\{\\alpha\}\(1\{\-\}p\_\{t\}\)^\{\\gamma\}\\log\(p\_\{t\}\)(4)其中 ptp\_\{t\} 是真实类别的预测概率。我们设置 α=0.25\\alpha=0.25 和 γ=2\\gamma=2。对于阶段 1,我们使用焦点损失替代交叉熵。对于生成式 LM 目标,我们在解码真实 token 时对每个 token 的预测应用焦点权重。

### 4\.3\. 阶段 2:对比骨干微调

在阶段 2,我们添加一个投影头,并优化监督对比损失(InfoNCE)与分类损失。此阶段旨在学习更具区分性的表示。

#### 4\.3\.1\. 特征提取与投影

对于批量中的每个梗图 ii,我们提取 VLM 骨干模型的隐藏表示 hi\\mathbf\{h\}\_\{i\}。然后通过一个多层感知机(MLP)投影头将其投影到对比空间:

zi=gϕ(hi)∈Rdproj\\mathbf\{z\}\_\{i\}=g\_\{\\phi\}(\\mathbf\{h\}\_\{i\})\\in\\mathbb\{R\}^\{d\_\{\\mathrm\{proj\}\}\}(5)其中 gϕg\_\{\\phi\} 是一个两层 MLP,隐藏维度为 2048,输出维度为 256。该投影头在训练后会被丢弃,仅用于学习阶段 2 的表示。

#### 4\.3\.2\. 有监督 InfoNCE 损失

我们使用有监督对比损失(Khosla 等人,2020 (https://arxiv.org/html/2607.28637#bib.bib12)):

Lcon=∑i∈I−1|P(i)|∑p∈P(i)log⁡exp⁡(zi⋅zp/τ)∑a∈A(i)exp⁡(zi⋅za/τ)L\_\{\\mathrm\{con\}\}=\\sum\_\{i\\in I\}\{\-\}\\frac\{1\}\{|P\(i\)|\}\\sum\_\{p\\in P\(i\)\}\\log\\frac\{\\exp\(\\mathbf\{z\}\_\{i\}\\cdot\\mathbf\{z\}\_\{p\}/\\tau\)\}\{\\sum\_\{a\\in A\(i\)\}\\exp\(\\mathbf\{z\}\_\{i\}\\cdot\\mathbf\{z\}\_\{a\}/\\tau\)\}(6)其中 P(i)P\(i\) 是与样本 ii 同类别的样本索引集合,A(i)=I∖\{i\}A\(i\)=I\\setminus\\\{i\\\} 是批内其他样本的索引集合,τ\\tau 是温度参数。我们使用 τ=0.07\\tau=0.07。

#### 4\.3\.3\. 分类头

除了对比损失外,我们还训练一个线性分类头,使用焦点损失(与阶段 1 相同的设置)对表示 zi\\mathbf\{z\}\_\{i\} 进行分类。训练期间的总损失为:

Lstage2=Lclf+λLconL\_\{\\mathrm\{stage2\}\}=L\_\{\\mathrm\{clf\}\}+\{\\lambda\}L\_\{\\mathrm\{con\}\}(7)其中 λ=0.5\\lambda=0.5 为对比损失的权重。

#### 4\.3\.4\. 骨干参数更新

在阶段 2,LoRA 适配器保持启用状态,并与投影头一起进行微调。这意味着对比损失和分类损失都会通过 LoRA 参数反向传播到骨干模型,从而优化隐藏表示。

### 4\.4\. 推理:集成

在推理时,我们将阶段 1 和阶段 2 的预测进行组合。对于每个测试样本,阶段 1 生成标签概率向量 p(1)p^\{\(1\)\},阶段 2 的分类器生成 p(2)p^\{\(2\)\}。最终的预测为:

y=arg⁡max⁡(w⋅p(1)+(1−w)⋅p(2))y=\\arg\\max\(w\\cdot p^\{\(1\)\}+\(1\{\-\}w\)\\cdot p^\{\(2\)\}\)(8)其中 ww 是基于验证集性能选择的集成权重。我们在验证集上对 w∈\{0,0.1,0.2,…,1.0\}w\\in\\\{0,0.1,0.2,\\dots,1.0\\\} 进行网格搜索。

### 4\.5\. 实现细节

我们使用 🤗 Transformers 库实现所有实验。LoRA 排名设置为 16,覆盖所有线性层。阶段 1 使用学习率 1e-4,阶段 2 使用 2e-4。我们使用 AdamW 优化器,并使用余弦学习率调度器配合 20 步线性预热。训练轮数:阶段 1 为 10 轮,阶段 2 为 8 轮。由于 Qwen3-VL-8B 的内存需求,使用梯度累积(4 步)和梯度检查点。阶段 1 的批量大小为 8,阶段 2 为 16。所有实验均在单个 NVIDIA A100 80GB GPU 上进行。伪代码见算法 1 (https://arxiv.org/html/2607.28637#alg1)。

## 5\. 实验

### 5\.1\. 指标

我们报告宏平均 F1 分数,并使用验证集进行模型选择和集成权重调优。最终测试集结果为共享任务评估计算得出。

### 5\.2\. 结果

表 3 (https://arxiv.org/html/2607.28637#T3) 展示了我们在两个子任务上与基线和其他参与系统的最终测试集结果对比情况。

### 5\.3\. 基线

我们将我们的系统与两种基线进行比较:

- •CLIP 零样本:直接使用 CLIP 从预定义标签提示中进行分类,不使用任何训练数据。
- •CLIP + 线性探针:在冻结的 CLIP 特征之上训练逻辑回归分类器。

### 5\.4\. 集成权重调优

我们在验证集上对集成权重 ww 进行网格搜索。表 4 (https://arxiv.org/html/2607.28637#T4) 报告了不同集成权重的宏 F1 分数。我们在子任务 A 上发现最佳权重为 w=0.7,在子任务 B 为 w=0.6。

### 5\.5\. 消融实验

为了理解各模型组件的贡献,我们进行了消融实验。表 5 (https://arxiv.org/html/2607.28637#T5) 给出了验证集上的消融结果。

## 6\. 分析

### 6\.1\. 错误分析

我们按类别对验证集错误进行了分类,如表 6 (https://arxiv.org/html/2607.28637#T6) 所示。我们还识别了错误的主要来源。

### 6\.2\. 处理小文本的失败

我们观察到一个常见的失败模式:嵌入在梗图中的小尺寸文本。虽然 Qwen3-VL 支持动态分辨率,但小的文本区域(<15 像素高度)常被忽略或误读。

### 6\.3\. 数值与符号的误读

另一个错误来源是对图像中数字和符号的误读,数字被错误解释或忽略。

### 6\.4\. 文化特异性

某些具有高度上下文特定性的梗图需要深入的尼泊尔社会和文化知识,即使是最先进的 VLM 也难以正确处理。

### 6\.5\. 跨类别混淆

在情感分析中,我们观察到负面和正面类别经常与中性类别混淆,尤其是在讽刺性内容上。

## 7\. 结论

我们提出了 ZeroR@CHiPSAL 2026,一个用于尼泊尔梗图多模态仇恨言论检测和情感分析的系统。通过将 RA-HMD 框架适配到低资源环境,并在 Qwen3-VL-8B-Instruct 上利用原生天城文支持,我们实现了端到端的视觉-语言理解。两阶段的训练流程——生成式微调和对比学习——在仇恨言论检测中获得了 0.797 的 F1 分数(第 2 名),在情感分析中获得了 0.518(第 4 名)。我们的错误分析强调了进一步改进的机会,包括增强的小文本理解和针对尼泊尔语特有的数据增强。未来工作可以探索多任务学习,将仇恨言论检测和情感分析整合到一个共享模型中,并收集更多具有细粒度标签的尼泊尔梗图数据。

## 8\. 局限性

我们的工作存在几个局限性。首先,我们仅使用了约 1,068 张梗图的相对较小的训练集,这限制了模型的泛化能力。其次,我们没有评估其他 VLM 骨干模型,因为我们关注的是 Qwen3-VL-8B 作为基础。第三,我们没有使用外部资源,如额外的尼泊尔语语料库或专门的 OCR 模型,这些可能会进一步提升性能。第四,我们的系统是在单个模型上训练和评估的,因此结果可能会有训练随机性带来的波动。最后,面部、物体和文本检测等视觉细节容易出错,导致对某些文本区域、物体识别和面部标记的误读,其中脸部重叠或遮挡是常见的失败原因。

## 致谢

我们感谢 CHiPSAL 2026 组织者提供了共享任务和数据集。我们还要感谢计算基础设施的提供方和开源 Qwen3-VL 模型。我们感谢 L4N 实验室的导师在 CAS 上的建议和帮助。

## 参考文献

[1] Surendrabikram Thapa, Kritesh Rauniyar, Surabhi Adhikari, Nitesh Kumar Chaudhary, and Usman Naseem. 2026. Overview of the second workshop on challenges in processing South Asian languages (CHiPSAL 2026). In Proceedings of the Second Workshop on Challenges in Processing South Asian Languages. (https://arxiv.org/html/2607.28637#bib.bib1)

[2] Kiruthika Sarveswaran, Surendrabikram Thapa, and Shantipriya Parida. 2026. Overview of the shared task on hate speech and sentiment detection in South Asian languages at CHiPSAL 2026. (https://arxiv.org/html/2607.28637#bib.bib2)

[3] Surendrabikram Thapa, Kritesh Rauniyar, Surabhi Adhikari, Hariram Veeraghanta, and Usman Naseem. 2025b. NepaliMemes: A multimodal benchmark for hate speech and sentiment detection in Nepali memes. (https://arxiv.org/html/2607.28637#bib.bib3)

[4] Surendrabikram Thapa, Kritesh Rauniyar, Surabhi Adhikari, Hariram Veeraghanta, Usman Naseem, et al. 2025c. Corpus construction for hate speech and sentiment analysis in Nepali memes. (https://arxiv.org/html/2607.28637#bib.bib4)

[5] Ashish Bhandari, Kritesh Rauniyar, and Surendrabikram Thapa. 2023. CrisisHateMM: Multimodal hate speech analysis in crisis situations. In Proceedings of the 1st International Workshop on Multimodal and Responsible AI. (https://arxiv.org/html/2607.28637#bib.bib5)

[6] Anurag Parihar, Surendrabikram Thapa, and Usman Naseem. 2021. Hate speech detection in low-resource languages: A review. (https://arxiv.org/html/2607.28637#bib.bib6)

[7] Surendrabikram Thapa, Kritesh Rauniyar, Surabhi Adhikari, and Usman Naseem. 2025a. Transfer learning for low-resource multilingual hate speech detection. (https://arxiv.org/html/2607.28637#bib.bib7)

[8] Ling Mei, Shenyuan Gao, and Yuanyuan Liu. 2025. Robust adaptation of large multimodal models for hateful meme detection. (https://arxiv.org/html/2607.28637#bib.bib8)

[9] Ling Mei, Shenyuan Gao, and Yuanyuan Liu. 2024. Retrieval-guided contrastive learning for hateful meme detection. (https://arxiv.org/html/2607.28637#bib.bib9)

[10] Peng Wang, Shuai Bai, Sinan Tan, Shijie Wang, Zhihao Fan, Jinze Bai, et al. 2024. Qwen2-VL: Enhancing vision-language model's perception of the world at any resolution. (https://arxiv.org/html/2607.28637#bib.bib10)

[11] Edward J. Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen. 2022. LoRA: Low-rank adaptation of large language models. In International Conference on Learning Representations. (https://arxiv.org/html/2607.28637#bib.bib11)

[12] Prannay Khosla, Piotr Teterwak, Chen Wang, Aaron Sarna, Yonglong Tian, Phillip Isola, Aaron Maschinot, Ce Liu, and Dilip Krishnan. 2020. Supervised contrastive learning. In Advances in Neural Information Processing Systems 33. (https://arxiv.org/html/2607.28637#bib.bib12)

[13] Cheng-Ze Lu, Xiao-Ming Wu, Wei Liu, and Yu Zhang. 2023. Focal contrastive learning for image classification. (https://arxiv.org/html/2607.28637#bib.bib13)

[14] Aaron van den Oord, Yazhe Li, and Oriol Vinyals. 2018. Representation learning with contrastive predictive coding. arXiv preprint arXiv:1807.03748. (https://arxiv.org/html/2607.28637#bib.bib14)

[15] Douwe Kiela, Hamed Firooz, Aravind Mohan, Vedanuj Goswami, Amanpreet Singh, Pratik Ringshia, and Davide Testuggine. 2020. The hateful memes challenge: Detecting hate speech in multimodal memes. In Advances in Neural Information Processing Systems 33. (https://arxiv.org/html/2607.28637#bib.bib15)

[16] Tsung-Yi Lin, Priya Goyal, Ross Girshick, Kaiming He, and Piotr Dollár. 2017. Focal loss for dense object detection. In Proceedings of the IEEE International Conference on Computer Vision. (https://arxiv.org/html/2607.28637#bib.bib16)

[17] Ilya Loshchilov and Frank Hutter. 2019. Decoupled weight decay regularization. In International Conference on Learning Representations. (https://arxiv.org/html/2607.28637#bib.bib17)

[18] Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, et al. 2021. Learning transferable visual models

相似文章

@lukaskuhn77: 我们推出了LeVLJEPA:首个完全非对比的端到端视觉语言预训练方法,性能可与C…相竞争。

X AI KOLs Following

LeVLJEPA是首个完全非对比的端到端视觉语言预训练方法,无需负样本、温度参数或动量编码器,性能即可与CLIP和SigLIP相媲美。它通过跨模态预测(使用停止梯度目标)和每模态分布正则化进行学习,为下游任务(如VLM主干网络和语义分割)提供更强的密集语义特征。

Video2LoRA: 视觉-语言模型的参数化视频内化

Hugging Face Daily Papers

本文介绍Video2LoRA,一种直接从视频表示预测低秩适配(LoRA)权重的方法,能够在冻结的视觉-语言模型中实现高效的视频处理。它将视觉令牌负载降低最多1500倍,查询TTFT降低6-80倍,同时在视频摘要和字幕生成基准上保持性能。