BharatGather: 面向印度公众活动的虚假信息和假新闻检测的文化感知基准数据集

arXiv cs.CL 论文

摘要

BharatGather是一个专为印度大规模集会设计的二元虚假信息检测的文化感知基准数据集,包含14,646条记录,旨在解决自动化假新闻检测中的社会文化细微差别。

arXiv:2609.02895v1 公告类型:新 摘要:大规模公共活动,如宗教节日、政治集会和文化聚会,越来越容易受到虚假信息快速传播的影响,对公共安全和社会凝聚力构成重大风险。尽管自动化假新闻检测在方法上取得了显著进展,但现有基准数据集往往未能捕捉到印度背景下特有的社会文化细微差别和事件特定动态。本文介绍了BharatGather,这是一个专门为印度大规模集会生态系统中的二元虚假信息分类设计的精心策划、多源数据集。该语料库包含14,646条记录,通过混合流水线构建,包括对知名事实核查平台的系统网络抓取、多媒体转录提取,以及大语言模型(LLM)介导的合成增强,以确保叙述多样性。通过提供一个针对印度事件感知虚假信息独特复杂性的资源,这项工作促进了文化感知检测系统的开发,并为评估其在高风险公共环境中的性能建立了严格的基准。
查看原文
查看缓存全文

缓存时间: 2026/09/04 05:51

# BharatGather:一个面向印度公众活动中错误信息与虚假新闻检测的文化感知基准数据集
来源:https://arxiv.org/html/2609.02895

###### 摘要
大规模公众活动,如宗教节日、政治集会和文化聚会,正日益容易受到错误信息快速传播的影响,这给公共安全与社会凝聚力带来了重大风险。尽管自动化假新闻检测在方法上取得了显著进展,现有基准数据集往往未能捕捉到印度社会背景特有的社会文化细微差别与事件动态。本文介绍了 BharatGather,一个精心策划的、多来源的数据集,专门针对印度大规模聚集活动中的二元错误信息分类任务而设计。该语料库包含 14,646 条记录,通过混合流程构建,该流程涉及对知名事实核查平台的系统化网络爬取、多媒体转录提取以及大型语言模型驱动的合成数据增强,以确保叙事多样性。通过提供一份针对印度事件相关错误信息独特复杂性的资源,本工作促进了文化感知检测系统的发展,并为评估其在高风险公共环境中的性能建立了严格的基准。

## 1 引言
错误信息的数字化传播已成为一项严峻的社会挑战,在高密度公共环境中其影响尤为突出 (Mehta et al., 2021; Agarwal and Alsaeedi, 2020)。在印度的社会政治格局中,从宗教朝圣到政治示威的大规模聚集活动,是社交媒体、广播新闻和视频分享平台上密集信息交换的中心 (Al-Zaman, 2022)。在这些不稳定的信息生态系统中,虚假或误导性言论的快速扩散可能引发恐慌、社群摩擦和危险的群体动态 (Wang, 2025; Das and Ahmed, 2022)。当前自然语言处理领域的研究,借助基于 Transformer 架构的演进,已显著提升了自动化真实性评估的有效性 (Zhang et al., 2022; Khan et al., 2023; Wani et al., 2021)。然而,一个系统性限制仍然存在:大多数现有研究使用的是领域通用或以西方为中心的数据集,缺乏在区域环境中有效部署所需的文化和语言粒度 (Sharma et al., 2019; Das and Ahmed, 2022)。此外,尽管一些研究涉及了印度背景,但它们往往专注于架构框架,而未发布对于事件驱动错误信息进行可复现研究至关重要的底层结构化数据集 (Al-Zaman, 2022)。

为弥补这些不足,我们引入了 BharatGather 数据集 (l3cube-pune/BharatGather),一个专门为印度大规模聚集活动这一特定背景下的二元错误信息检测(分为“真”和“假”标签)而策划的数据集 (Zhang et al., 2022)。我们的贡献整合了多样化的数据获取模式,利用网络爬取的新闻语料库、从多媒体平台提取的转录文本,以及通过大型语言模型进行的受控合成增强,以提高错误信息叙事的多样性 (t’Serstevens et al., 2024; Sharma et al., 2019)。最终的数据集包含 14,646 条记录,每条记录都附有真实性标签和事件感知元数据,以支持系统化的基准测试 (Agarwal and Alsaeedi, 2021)。

这项工作的主要贡献集中在开发和验证这一专业基准上。首先,我们提供了一个以印度具有区域重要性的大规模聚集活动为中心、包含 14,646 条记录的文化感知语料库,填补了当前文献中关于事件特定数据集的明显空白 (Das and Ahmed, 2022)。这是通过一个多层级获取管道实现的,该管道整合了来自五大领先事实核查组织——AltNews、BoomLive、Factly、The Quint 和 NewsMeter——的结构化数据,以及来自 YouTube 的新闻转录文本,以捕捉现代错误信息的多媒体维度 (He et al., 2025; Al-Zaman, 2022)。此外,本研究实施了一种复杂的对抗性叙事生成策略。使用 Qwen3-32B 模型,我们生成了 3,595 个合成变体,旨在让模型接触到超越表面词汇分析的微妙欺骗模式 (t’Serstevens et al., 2024; Sharma et al., 2019)。最后,我们使用 bert-base-uncased 模型建立了二元分类的严格经验基准 (Sharma et al., 2019; Khan et al., 2023)。我们的评估表明,虽然该数据集包含强大的可学习信号,达到了 96.1% 的准确率,但冻结模型与微调模型之间的显著性能差距凸显了领域特定梯度适应对于高保真检测的必要性 (Sharma et al., 2019; Khan et al., 2023)。总而言之,这些贡献为印度高风险、高密度公共环境中自动化错误信息缓解奠定了基础 (Rai et al., 2025)。

## 2 相关工作
关于错误信息检测的研究涵盖了计算、行为和传播等多个视角。基础性工作强调了在线错误信息的社会技术性质以及跨学科干预的必要性 (Fernandez and Alani, 2018)。广泛的综述进一步证实了基于 Transformer 方法的有效性,同时强调了数据质量、上下文偏差和领域迁移方面的持续局限性 (Sharma et al., 2019)。

### 2.1 印度背景下的错误信息
先前的研究表明,印度的错误信息受到独特的文化、政治和宗教动态的影响。基于 NLP 的错误信息匹配系统在印度环境中已证明具有实际可行性,但大规模的事件特定基准仍然稀缺 (Nigam et al., 2021)。对印度 COVID-19 期间错误信息的主题分析报告了围绕健康声明、政治操纵、宗教两极分化和社群框架的重复叙事 (Borgohain et al., 2023; Al-Zaman, 2022)。这些证据支持了构建文化扎根数据集的必要性。

### 2.2 检测与传播建模
除了文本分类,一些研究还建模了错误信息传播中的时间和网络效应。实证研究表明,早期的真实干预可以减少后续错误信息的扩散 (Wang et al., 2022),而基于图的公式则将有影响力的用户识别为关键的放大或缓解因素 (Wang, 2025)。其他方法使用陈述级语义冲突和行为取证来提高错误信息识别性能 (Zhang et al., 2022; Khan et al., 2023)。

### 2.3 基于群体的缓解方法
群体和干预方法提供了互补的缓解途径。最近的综述将群体角色分为标注者、评估者和创造者 (He et al., 2025)。有人提出了合成群体建模来近似代表性的真实性判断 (t’Serstevens et al., 2024)。其他方法包括用于分阶段揭穿者选择的强化学习和用于主动抑制的“预先揭穿”策略 (Xu et al., 2022; Rai et al., 2025)。来自印度的实地实验证据也表明,干预效果因受众群体和政治立场而异 (Badrinathan, 2021)。

### 2.4 危机沟通与信息行为
从危机沟通的角度来看,先前的工作记录了监测和响应工作流程中的操作差距 (Mehta et al., 2021)。信息行为框架对虚假信息在创建、传播和消费阶段进行了建模 (Agarwal and Alsaeedi, 2020, 2021)。平台层面的漏洞以及接触假新闻带来的持续说服效应,进一步促使人们需要及时且对上下文敏感的检测系统 (Mustafaraj and Metaxas, 2017; Toledano et al., 2024)。

## 3 数据集构建
参见图 1:数据集构建概览
### 3.1 数据集范围
该语料库专门设计用于捕捉印度大规模聚集活动生态系统中的错误信息,包括宗教节日、政治集会和区域性文化活动,如大壶节(Kumbh Mela)、象头神节(Ganesh Chaturthi)、杜尔迦女神节(Durga Puja)、农民抗议(Farmers’ Protest)、战车节(Rath Yatra)、萨巴瑞马拉朝圣(Sabarimala Pilgrimage)和马拉地自治大游行(Maratha Kranti Morcha)。它反映了一种不断发展的社会数字范式,在这种范式下,欺骗性叙事常常充当人群动员的**主要催化剂**,而非次生后果。每个实例都锚定于已验证的印度知名事实核查组织的报道,确保了领域特定的相关性,并减少了通用全球数据集固有的噪声。

### 3.2 数据来源
为确保代表性多样性并减少语料库的同质性,数据从三个不同的模态汇聚而成:

**成熟的事实核查平台**。五个著名的印度事实核查组织作为主要的结构化来源:AltNews、BoomLive、Factly、The Quint 和 NewsMeter。这些平台定期发布已验证的声明及相应的事实核查回应,为地面真值标注提供了高完整性的基础。

**YouTube 新闻转录文本**。从 YouTube 上经认证的、可信的印度新闻频道(如 BBC News 和 NDTV)提取转录文本。此模态捕捉了当代新闻消费的多媒体维度,并反映了错误信息在大规模活动期间如何通过视频平台传播。

**合成增强记录**。为增强模型鲁棒性并解决类别分布问题,使用大型语言模型在经过验证的高完整性实例条件下生成受控的合成记录。

### 3.3 数据获取管道
数据收集被构建为一个三级获取和处理管道,每一级在源类型、结构完整性和下游处理逻辑上有所区别。

#### 3.3.1 第一级:网络爬取的结构化数据
核心语料库是通过系统化爬取指定平台构建的。开发了自定义爬虫以适应异构的 HTML 架构,产出了 10,691 条记录。

##### 原生实体提取:
对于 BoomLive、Factly 和 NewsMeter,事实(Fact)和声明(Claim)字段作为离散元数据提供。这 **2,368 条记录** 构成了完整性最高的层级,并作为下游合成增强的唯一基础。在此上下文中,“声明”(Claim)代表在社交媒体上广泛流传的未经证实的断言。“事实”(Fact)代表由专业记者经过严格调查后确立的、客观的、经过验证的真相。

##### LLM 介导的语义提取:
AltNews 和 The Quint 主要提供未经结构化的原始文本字段,没有预分割的事实-声明对。为了将这 **8,323 条记录** 标准化为统一模式,我们使用了 Qwen3-32B 来提取每篇文章中的底层事实和声明。模型被要求识别每篇内容的语义核心,将原始文本浓缩为简洁的、模式兼容的表示。为保持数据完整性并防止常见的递归模型偏差(通常称为模型崩塌),这些通过 LLM 导出的记录被特意排除在合成增强阶段之外,以在训练语料库中保持清晰的来源边界。用于此提取的提示模式见代码清单 1。代码清单 1:LLM 介导的事实-声明提取的提示模式(AltNews & The Quint)。
```json
{
  "role": "system",
  "instruction": "你是一个事实核查助手。给定一篇原始新闻文章,提取 output_schema 中定义的两个字段。",
  "output_schema": {
    "Claim": "文章中需要验证的具体断言。",
    "Fact": "支持或反驳该声明的经过验证的真相。"
  },
  "constraints": [
    "不要添加源文本中不存在的信息。",
    "保持每个字段简洁(1-3 句话)。",
    "逐字保留名称、日期和数值。",
    "只返回包含 'Claim' 和 'Fact' 键的有效 JSON。"
  ],
  "model": "qwen/qwen3-32b",
  "temperature": 0.6,
  "max_tokens": 4096,
  "top_p": 0.95
}
```

##### 平台差异与结构多样性
虽然所有五个平台都作为主要的辟谣来源,但它们呈现信息的数字格式差异显著,因此需要在第一级中详述专门的提取方法:
**结构化布局(BoomLive、Factly、NewsMeter)**:这些网站采用“事实核查卡片”格式。它们明确地将病毒式传播的声明与最终裁定分开,通常使用特定的 HTML 标签,如 `claim-review` 或 `fact-check-summary`。这允许直接原生提取事实-声明对。
**叙事性布局(AltNews、The Quint)**:这些平台通常采用长篇调查新闻风格。错误信息和辟谣证据在文章正文中交织在一起,而非隔离在元数据字段中。因此,需要通过 LLM 介导的提取将这些叙事提炼为我们的标准化模式。

#### 3.3.2 第二级:YouTube 转录文本集成
为捕捉错误信息的视频介导维度,从 YouTube 上经验证的印度新闻频道提取了转录文本。选择标准刻意限制在成熟、可信的新闻机构,以最小化...

相似文章