NepOOC-M: 双语尼泊尔语-英语基准与多模态架构用于OOC检测的比较分析

arXiv cs.CL 论文

摘要

本文介绍了NepOOC,这是首个面向尼泊尔语主导的多语言基准,用于检测脱离上下文的虚假信息,并评估了多模态架构,发现纯文本模型表现出色。

arXiv:2608.19212v1 Announce Type: new Abstract: 脱离上下文(OOC)虚假信息将真实图像与误导性标题配对,以构建虚假叙述而不进行图像操作,使得检测成为多模态对齐问题而非图像取证。尽管OOC虚假信息在尼泊尔普遍存在并造成后果,但尚无针对尼泊尔语的公开基准。我们介绍了NepOOC,这是首个公开可用的尼泊尔语主导多语言OOC基准,包含1,090对图像-标题对(545对原始,545对OOC),标注了五种类型(捏造、误标、时间不匹配、地理不匹配、身份不匹配),标注者间一致性kappa = 0.84。对五种多模态架构与纯文本和纯图像基线的系统评估表明,在当前数据集规模下,标题语义似乎足以实现高性能。一个纯文本mBERT模型达到了94.65+/-0.20%的宏平均F1分数,与最佳多模态系统(ResNet-50+mBERT,94.65+/-0.20%)在统计上等价(McNemar中位p = 1.000,0/5个种子在alpha = 0.05时显著)。纯图像模型表现接近随机水平(33-50%),而训练规模扩大表明,数据集扩展比架构复杂性或区域专业化是更直接的进步途径。
查看原文
查看缓存全文

缓存时间: 2026/08/21 10:00

# 尼泊尔语-英语双语基准与多模态架构在上下文不匹配检测中的对比分析
来源:https://arxiv.org/html/2608.19212
桑吉夫·卡蒂瓦达 独立研究员 尼泊尔加德满都 skhatiwada558@gmail\.com

###### 摘要

上下文不匹配(OOC)虚假信息将真实图像与误导性配文配对,无需图像篡改即可构建虚假叙事,因此其检测问题属于多模态对齐范畴而非图像取证。尽管OOC虚假信息在尼泊尔普遍存在且后果严重,但此前尚无公开的尼泊尔语基准数据集。我们推出了NepOOC——首个公开可用的以尼泊尔语为主导的多语言OOC基准数据集,包含1,090组图像-配文对(545组真实图像、545组OOC图像),按五种类型进行标注(伪造、错误配文、时间错位、地理错位、身份错位),标注者间一致性κ=0\.84。对五种多模态架构系统性评估并与纯文本、纯图像基线对比表明,在当前数据集规模下,配语文本语义已足以实现高性能。纯文本mBERT模型达到94\.65±0\.20%宏观F1分数,与最佳多模态系统(ResNet‑50+mBERT,94\.65±0\.20%)统计学等效(McNemar检验中位数p=1\.000,α=0\.05时0/5种子具有显著性)。纯图像模型性能接近随机猜测(33–50%),而训练规模缩放实验表明,数据集扩展是比架构复杂化或区域专业化更直接的改进路径。

## 一、引言

上下文不匹配(OOC)虚假信息通过将真实未篡改的图像与虚假或误导性配文配对,构建看似合理但语义失实的陈述[2 (https://arxiv.org/html/2608.19212#bib.bib2),3 (https://arxiv.org/html/2608.19212#bib.bib3),4 (https://arxiv.org/html/2608.19212#bib.bib4)]。与合成或篡改图像不同,OOC内容通过视觉合理性检验,因此对人类和自动系统而言都难以检测[5 (https://arxiv.org/html/2608.19212#bib.bib5)]。核心挑战不在于图像本身是否真实,而在于图像与配文共同是否准确呈现真实事件或情境。这一区分促使OOC检测成为独立于深度伪造或图像篡改检测的研究方向。

在尼泊尔,OOC虚假信息既普遍又影响重大,涉及选举、公共卫生、自然灾害和社群事务。重大事件期间常出现反复高峰,真实照片被重新传播并配以捏造的配文,旨在重塑所描绘情境[27 (https://arxiv.org/html/2608.19212#bib.bib27)]。一个典型案例是某马德什省官员使用德里照片虚假宣称该省基础设施建设成就[28 (https://arxiv.org/html/2608.19212#bib.bib28)]。另一起事件中,一张旧照片与2023年达兰争议的煽动性配文结合,几乎在事实核查员介入前引发社群冲突[27 (https://arxiv.org/html/2608.19212#bib.bib27)]。这些案例具有共同结构,使尼泊尔OOC区别于英语语境:关键证据在于配文对地区人物、地点和事件的宣称,需要本地知识才能评估。

尽管问题严峻,OOC检测研究仍集中于高资源英语环境。基准如NewsCLIPpings[2 (https://arxiv.org/html/2608.19212#bib.bib2)]、COSMOS[3 (https://arxiv.org/html/2608.19212#bib.bib3)]和VERITE[4 (https://arxiv.org/html/2608.19212#bib.bib4)]推动了方法进步,但均未解决低资源双语环境中的独特挑战:天城文与拉丁文的语码转换、尼泊尔人物和地点的命名实体覆盖稀疏,以及缺乏适应区域语境的多模态OOC工具。我们将此称为*区域语境缺口*:在英语新闻上表现良好的视觉语言模型,可能因缺乏识别该领域图像-配文不一致所需的脚本层面和文化基础,而在尼泊尔内容上失效。

本文通过三项贡献填补区域语境缺口:

1. 1\) NepOOC数据集。首个公开可用的以尼泊尔语为主导的多语言OOC基准,包含1,090组图像-配文对,按五种类型标注,Cohen’s κ=0\.84,源自真实尼泊尔虚假信息事件。
2. 2\) 架构对比研究。系统评估五种多模态架构,辅以专用纯文本和纯图像基线,旨在识别哪些归纳偏置和模态能有效迁移至该低资源双语环境。
3. 3\) 文本充分性发现。多指标评估表明,配语文本语义足以在该基准上实现高性能:纯文本mBERT与最佳多模态系统统计学等效,而纯图像模型性能接近随机猜测。这挑战了关于低资源环境下多模态融合效益的常见假设。

核心实证发现为:(1)ResNet‑50+mBERT在多模态系统中取得最高宏观F1分数(94\.65±0\.20%);(2)纯文本mBERT匹配此性能,表明在当前数据集规模下视觉特征贡献微小;(3)训练规模缩放表明数据集扩展是未来进步的主要杠杆。

## 二、相关工作

我们从四个维度组织文献:OOC检测方法、视觉语言架构、低资源与尼泊尔语言现状,以及NepOOC所填补的空白。

### 2.1 上下文不匹配虚假信息检测

OOC虚假信息区别于图像伪造或深度伪造检测:图像是真实的,但其配文将其从原始语境中错位[2 (https://arxiv.org/html/2608.19212#bib.bib2),3 (https://arxiv.org/html/2608.19212#bib.bib3)]。检测需要跨模态语义对齐而非像素级取证。

早期工作建立了任务基础。NewsCLIPpings[2 (https://arxiv.org/html/2608.19212#bib.bib2)]引入从新闻语料库构建大规模OOC基准的自动流水线。COSMOS[3 (https://arxiv.org/html/2608.19212#bib.bib3)]提出基于自监督一致性目标的图像-配文表征,VERITE[4 (https://arxiv.org/html/2608.19212#bib.bib4)]引入单模态偏置控制以确保模型进行真正的跨模态推理。伴随这些基准,实体增强融合[8 (https://arxiv.org/html/2608.19212#bib.bib8)]、基于Transformer的架构[7 (https://arxiv.org/html/2608.19212#bib.bib7)]和上下文感知推理[9 (https://arxiv.org/html/2608.19212#bib.bib9)]提升了高资源环境下的检测,开放域方法通过检索网络证据扩展了该任务[5 (https://arxiv.org/html/2608.19212#bib.bib5)]。

近期该领域转向可解释性与外部知识。RED‑DOT[10 (https://arxiv.org/html/2608.19212#bib.bib10)]表明检索到的证据文档显著提升OOC检测,确立了证据感知流水线作为标准范式。COVE[11 (https://arxiv.org/html/2608.19212#bib.bib11)]融入上下文验证信号,SNIFFER[37 (https://arxiv.org/html/2608.19212#bib.bib37)]证明多模态大语言模型可生成人类可读解释与二元判定。基于图的架构也成为有前景的方向[38 (https://arxiv.org/html/2608.19212#bib.bib38)]。综合调研[33 (https://arxiv.org/html/2608.19212#bib.bib33)]勾勒了从早期融合架构[1 (https://arxiv.org/html/2608.19212#bib.bib1)]向检索增强系统的转变。模态贡献研究[24 (https://arxiv.org/html/2608.19212#bib.bib24)]记录了文本在某些环境下常提供充分信号——这一发现本研究在低资源非英语语境中予以证实和扩展。

### 2.2 视觉语言架构与融合策略

视觉侧方面,卷积网络——特别是ResNet[22 (https://arxiv.org/html/2608.19212#bib.bib22)]——仍是空间特征提取的竞争性基线,而视觉Transformer(ViT)[16 (https://arxiv.org/html/2608.19212#bib.bib16)]将基于补丁的表征学习扩展至视觉输入。CLIP[17 (https://arxiv.org/html/2608.19212#bib.bib17)]通过大规模对比预训练生成高度可迁移的图像-文本表征,尽管该目标优化全局相似度排序而非监督二元分类,可能限制其在小规模特定领域基准上的适用性。

文本侧方面,BERT式编码器[14 (https://arxiv.org/html/2608.19212#bib.bib14)]及其多语言扩展[15 (https://arxiv.org/html/2608.19212#bib.bib15)]提供强跨语言迁移基线。融合策略涵盖晚期拼接、基于补丁token的跨注意力及基于图的关系建模[38 (https://arxiv.org/html/2608.19212#bib.bib38)]。文献中反复出现的观察及我们自身消融研究的结果表明,当标注数据稀缺时,架构复杂化并不总能提升性能;强预训练文本编码器通常已足够[24 (https://arxiv.org/html/2608.19212#bib.bib24)]。然而,架构复杂化能否提升具有语码转换、脚本多样配文的OOC检测,仍待实证检验。

### 2.3 低资源与尼泊尔语言处理

尼泊尔语NLP研究有所增长,但多模态虚假信息检测仍待探索。MuRIL[18 (https://arxiv.org/html/2608.19212#bib.bib18)]在17种印度和南亚语言(包括天城文)上训练,为尼泊尔语文本处理提供最强现成基础。尼泊尔语特定语言模型——NepBERTa[20 (https://arxiv.org/html/2608.19212#bib.bib20)]和NepaliBERT[21 (https://arxiv.org/html/2608.19212#bib.bib21)]——以及基于Transformer的分类器[19 (https://arxiv.org/html/2608.19212#bib.bib19),30 (https://arxiv.org/html/2608.19212#bib.bib30),31 (https://arxiv.org/html/2608.19212#bib.bib31),32 (https://arxiv.org/html/2608.19212#bib.bib32)]表明脚本感知预训练能提升文本分类。然而这些模型仅处理纯文本任务,未扩展至多模态或OOC场景。

在多模态前沿,近期印度语言研究开始结合MuRIL与视觉Transformer进行多语言虚假新闻检测[39 (https://arxiv.org/html/2608.19212#bib.bib39)],但缺乏专用OOC评估或类型学方案。双语尼泊尔语-英语虚假信息工具[40 (https://arxiv.org/html/2608.19212#bib.bib40)]处理语码转换,但限于文本且缺乏图像-配文对分类。尼泊尔OOC操作的普遍性及后果在[27 (https://arxiv.org/html/2608.19212#bib.bib27),28 (https://arxiv.org/html/2608.19212#bib.bib28)]中有文献记载,推动了专用检测资源的建立。

此前尚无研究提供具有类型标注的尼泊尔语或任何相近低资源南亚语言的多模态OOC基准。这正是NepOOC所填补的空白。

### 2.4 NepOOC的定位

表I (https://arxiv.org/html/2608.19212#S2.T1)将NepOOC与最相关的现有基准进行定位。NewsCLIPpings[2 (https://arxiv.org/html/2608.19212#bib.bib2)]和COSMOS[3 (https://arxiv.org/html/2608.19212#bib.bib3)]提供大规模英语OOC资源,但缺乏类型标签和多语言覆盖。VERITE[4 (https://arxiv.org/html/2608.19212#bib.bib4)]解决单模态偏置但以英语为主。MuMiN[6 (https://arxiv.org/html/2608.19212#bib.bib6)]在低资源环境下覆盖多语言,但未聚焦OOC检测或提供类型标注。NepOOC是首个同时提供OOC特定焦点、细粒度类型标签(κ=0\.84)、反映真实语码转换模式的真正双语内容,并配对源自实际尼泊尔虚假信息事件的资源。

表I:基准对比。Y=是,N=否。Typol.=类型标签;Multi.=多语言;Low‑Res.=低资源。基准|OOC|Typol\.|Multi\.|Low‑Res\.|规模
---|---|---|---|---|---
NewsCLIPpings[2 (https://arxiv.org/html/2608.19212#bib.bib2)]|Y|N|N|N|71k
COSMOS[3 (https://arxiv.org/html/2608.19212#bib.bib3)]|Y|N|N|N|200k
VERITE[4 (https://arxiv.org/html/2608.19212#bib.bib4)]|Y|N|部分|N|1k
MuMiN[6 (https://arxiv.org/html/2608.19212#bib.bib6)]|N|N|Y|部分|22k
NepOOC(本研究)|Y|Y|Y|Y|1,090
见图注

图1:五种类型中的代表性真实与OOC配对。红框突出显示篡改短语。

## 三、NepOOC数据集

NepOOC体现三项核心设计原则:所有配对源自真实虚假信息实例(生态效度);每个OOC实例携带类型标注(类型学粒度);基准涵盖尼泊尔语、英语和语码转换配文(多语言真实性)。

### 3.1 数据收集与来源

NepOOC包含545组独特的图像-源配对,每组产生一组真实与一组OOC图像-配文对,总计1,090个样本。数据集涵盖尼泊尔数字媒体的广泛领域,包括公共事务、选举、健康危机、自然灾害、基础设施宣称和社会争议。来源分为三类:在尼泊尔运作的事实核查组织、尼泊尔在线新闻门户及被标记为潜在虚假信息的社交媒体存档。对所有来源类型,我们记录了来自同一证据参考的虚假宣称和已验证真实背景,无需事后重标注即可直接推导OOC和真实标签。表II (https://arxiv.org/html/2608.19212#S3.T2)提供来源细分。事实核查组织构成主要来源(86\.1%),反映对专家验证基准真值而非规模的刻意优先考量。我们承认这引入了*来源偏差*,倾向于专业策展内容;参见第九节 (https://arxiv.org/html/2608.19212#S9)。

表II:来源分布(n=545组独特图像)。来源类型|数量|%
---|---|---
事实核查组织|469|86\.1%
社交媒体存档|49|9\.0%
在线新闻门户|27|5\.0%
总计|545|100\.0%

### 3.2 标注流程与标注者间一致性

事实核查来源配对的二元OOC标签由事实核查员在发布判定时确立,构成专家验证的基准真值。对新闻门户和社交媒体存档来源的配对(n=76,占独特来源的14\.0%),两名受训标注员独立确认二元OOC/真实分类;该二元任务的标注者间一致性达Cohen’s κ=0\.81。所有标注员独立为每个OOC实例分配五种类型标签之一(第3.3节),以已发布的事实核查分析为参考。分歧由第三位专家仲裁;存在无法解决的分歧或来源不足的配对被剔除。类型标注者间一致性达Cohen’s κ=0\.84,表明可靠性强。

### 3.3 OOC类型学方案

每个OOC实例均标注以下五种类型之一,反映不同

相似文章

MMOOC:多模态大语言模型上下文外评估的综合基准

Hugging Face Daily Papers

MMOOC 是一个大规模基准,包含超过 41K 个图像-问题对,用于评估多模态大语言模型在拒绝上下文外问题的同时回答上下文偏移问题的能力,结果显示当前模型难以平衡这两种能力。

多模态大语言模型能理解OCT吗?

Hugging Face Daily Papers

本文介绍了OCT-Bench,一个用于评估多模态大语言模型在OCT图像理解能力的全面基准,包含10,076个问题,覆盖感知、认知和推理三个维度的20个细粒度任务。对20个模型的评估表明,当前MLLMs在可靠的OCT理解方面仍有很大差距。

多语言预训练模型在尼泊尔自动语音识别中的比较分析

arXiv cs.CL

本文提出了一个受控基准,比较了六种多语言预训练ASR模型在尼泊尔语音上的表现,发现Whisper-Large-v3-Turbo和IndicWav2Vec表现最佳,而CTC解码器的推理速度最高可提升29倍。该研究为尼泊尔ASR提供了首个标准化的、考虑效率的参考数值。