从重复到识别:虚假信息叙事的归纳发现
摘要
本文引入了一个用于无监督叙事标签生成的三层评估框架,并比较了基于聚类和基于图社区的方法来发现虚假信息叙事,同时发布了经过人工验证的标签以支持分类法的开发。
arXiv:2609.11128v1 公告类型:新
摘要:在虚假信息数据集中,叙事通常被理解为重复出现的解释模式,将文本归类到叙事标签下。近期研究将叙事挖掘形式化为从语料库中归纳推断叙事标签,但其评估仍受限于预定义的分类法,这是一种封闭世界环境,无法捕获参考标签中缺失的叙事。我们引入了一个用于无监督叙事标签生成的三层评估框架:恢复(基于语料库自身的分类法)、挖掘(基于外部标签集)和发现(无预定义标签)。应用此框架,我们在七个虚假信息数据集上比较了基于聚类和基于图社区的流水线,并对其中两个进行了发现的人工验证。这两类方法在自动化指标下是互补的,但在一个包含两个突出主题的语料库中,聚类可能将一个主题减少到生成标签的2%,而基于图的流水线保持平衡。发现验证还揭示了许多单例叙事标签(源自单个声明,占图输出的30-62%),这是聚类无法产生的。标注者确认其中许多是可识别的虚假信息叙事,这表明在开放世界发现中,叙事挖掘所假设的重复可能在语料库之外被识别,而不是在语料库内部。我们发布了Climate Obstruction和PolyNarrative数据集的经过人工验证的叙事候选标签,以支持分类法开发和数据集扩展。
查看缓存全文
缓存时间: 2026/09/11 08:23
# 虚假信息叙事的归纳式发现 来源:https://arxiv.org/html/2609.11128 ## 从重复到识别:虚假信息叙事的归纳式发现 Max Upravitelev 单位:柏林工业大学 单位:德国人工智能研究中心(DFKI) Veronika Solopova 单位:柏林工业大学 单位:德国人工智能研究中心(DFKI) Jing Yang 单位:柏林工业大学 单位:德国人工智能研究中心(DFKI) 单位:BIFOLD – 柏林学习与数据基础研究所 Charlott Jakob 单位:柏林工业大学 单位:德国人工智能研究中心(DFKI) 单位:约翰内斯·古腾堡大学美因茨分校 通信作者:[[email protected]](mailto:[email protected]) Alexandra Tsiakalou 单位:柏林工业大学 单位:德国人工智能研究中心(DFKI) Neda Foroutan 单位:柏林工业大学 单位:德国人工智能研究中心(DFKI) Vera Schmitt 单位:柏林工业大学 单位:德国人工智能研究中心(DFKI) 单位:BIFOLD – 柏林学习与数据基础研究所 单位:可信人工智能欧洲研究中心(CERTAIN) 单位:约翰内斯·古腾堡大学美因茨分校 通信作者:[[email protected]](mailto:[email protected]) ###### 摘要 在虚假信息数据集中,叙事通常被理解为重复出现的解释模式,这些模式将文本归类于特定的叙事标签之下。近期研究将叙事挖掘形式化为从语料库中归纳推断叙事标签,但其评估仍依赖于预定义的分类法,这种封闭世界设定无法捕捉参考标签中缺失的叙事。我们提出了一个用于无监督叙事标签生成的三层评估框架:恢复(基于语料库自身的分类法)、挖掘(基于外部标签集)和发现(无预定义标签)。我们将该框架应用于七个虚假信息数据集,比较基于聚类和基于图社区的流程,并在两个数据集上对发现结果进行人工验证。在自动化指标下,两类流程具有互补性,但在包含两个主要主题的语料库中,聚类可能将其中一个主题压缩至生成标签的2%,而基于图的流程则能保持平衡。发现验证还揭示了许多单例(从单一声明衍生的叙事标签,占图流程输出的30–62%),这是聚类无法产生的。标注者确认许多单例是可识别的虚假信息叙事,这表明在开放世界发现中,叙事挖掘所假设的重复性可能是在语料库之外而非内部被识别的。我们发布了经过人工验证的气候阻碍和PolyNarrative数据集的叙事候选标签,以支持分类法开发和数据集扩展。 ## 1 引言 计算叙事分析日益依赖聚类方法(Hanley等,2024 (https://arxiv.org/html/2609.11128#bib.bib9);Gerard等,2026 (https://arxiv.org/html/2609.11128#bib.bib7);Ash等,2024 (https://arxiv.org/html/2609.11128#bib.bib1))。对聚类的依赖符合虚假信息叙事挖掘研究中普遍存在的重复性假设(Sosnowski等,2025 (https://arxiv.org/html/2609.11128#bib.bib27)),即叙事是通过分组频繁出现的声明中重复的文本模式推断出来的。与此同时,基于图的研究将叙事表示为行动者或事件及其关系的网络(Tangherlini等,2020 (https://arxiv.org/html/2609.11128#bib.bib29);Keith Norambuena 和 Mitra,2021 (https://arxiv.org/html/2609.11128#bib.bib13))。由领域专家手动开发的虚假信息叙事分类法呼应了这两种方法,为跨单个文本实例的重复模式提供了层次结构。虽然它们为自动虚假信息叙事检测提供了宝贵的基础,但设计上无法穷尽所有可能。叙事会随着时间演变,新的变体不断出现,这推动了更新,例如CARDS分类法的近期修订(Coan等,2021 (https://arxiv.org/html/2609.11128#bib.bib2);Coan等,2026 (https://arxiv.org/html/2609.11128#bib.bib3))。人工整理的分类法也受到其作者观点和背景的影响:例如,PolyNarrative(Nikolaidis等,2025 (https://arxiv.org/html/2609.11128#bib.bib17))指出,西方机构的代表性更强,反映了其分析师的背景。 图1:提出的三层评估框架:叙事恢复、叙事挖掘和叙事发现。LL:流程生成的标签。Rown:语料库自身的分类法。Rref:独立的参考分类法。发现没有参考集,评分依据是第3.1.2节(https://arxiv.org/html/2609.11128#S3.SS1.SSS2)中标注的“是/其他/无”比率。归纳式叙事挖掘可以通过直接从语料库推断叙事标签来帮助解决这些差距。然而,评估仍然受限于预定义的分类法(例如,DiNaM的评估基于Sosnowski等,2024 (https://arxiv.org/html/2609.11128#bib.bib26))。即使参考分类法来自独立数据集,评估也仅限于该标签空间中已存在的叙事。缺失的是评估相对于参考分类法而言新颖的叙事的方法:这些叙事可能不存在于现有分类法中,但仍然是新标签的有效候选。本文解决了这一差距:叙事*发现*,通过无监督方法从语料库*生成*叙事标签,而不是用分类器将文本分配给固定的标签集。我们还评估了两个封闭世界设定(叙事恢复作为健全性检查,以及叙事挖掘),因为它们支持自动化评估,而开放世界发现则无法实现。我们的研究围绕以下研究问题展开: - • RQ1 基于聚类和基于图的方法产生的叙事标签集有多大不同?除了封闭世界评估指标能捕捉的差异外,它们的输出还有何不同? - • RQ2 为叙事挖掘建立的语料库内重复性假设是否适用于叙事发现? - • RQ3 能否利用叙事挖掘自动识别新颖的叙事候选,以扩展现有的虚假信息叙事分类法? 我们的主要贡献是一个统一的评估框架,用于无监督虚假信息叙事标签生成,涵盖封闭世界和开放世界设定。它包括三个层次(如图1(https://arxiv.org/html/2609.11128#S1.F1)所示):恢复(基于语料库自身的分类法作为健全性检查)、挖掘(基于独立的参考分类法)和发现(无分类法参考,通过人工标注者验证)。挖掘层将Sosnowski等(2025)(https://arxiv.org/html/2609.11128#bib.bib27)的跨语料库评估推广到除事实核查文章外的任意语料库,而恢复和发现则将叙事挖掘扩展到此前未被形式化的场景。我们将该框架应用于基于聚类和基于图的归纳流程,这是叙事相关工作中普遍存在的两类聚合方法。在涵盖多种语言和主题的七个数据集中,两类流程在自动化指标下具有互补性,但也出现了一些结构性差异。首先,使用聚类流程在默认参数下生成标签可能会抑制两个主要语料库主题中的一个,而基于图的流程则在参数扫描中保持了两个主题的平衡。其次,发现了许多单例候选(从单一声明衍生的标签),聚类无法产生这些标签,但人工标注者将其验证为虚假信息叙事。我们还发现,LLM作为评判者与人工验证者表现不同,强调了人在回路中评估的必要性。虽然重复性假设在挖掘设定中对虚假信息叙事具有定义性意义,但我们认为研究结果指向了重复在叙事发现中的不同作用:标注者似乎是从他们已有的知识中识别单例候选,而不是从当前语料库的模式中识别。为支持未来的分类法维护,我们发布了[111](https://github.com/XplaiNLP/narrative-discovery)经过人工验证的气候阻碍和PolyNarrative数据集的叙事候选标签。 ## 2 相关工作与预备知识 尽管在叙事学和计算方法方面进行了广泛研究,但“什么构成叙事”并没有普遍适用的定义Piper等(2021)(https://arxiv.org/html/2609.11128#bib.bib20)。在CARDS(Coan等,2021 (https://arxiv.org/html/2609.11128#bib.bib2))、EU DisinfoTest(Sosnowski等,2024 (https://arxiv.org/html/2609.11128#bib.bib26))和PolyNarrative(Nikolaidis等,2025 (https://arxiv.org/html/2609.11128#bib.bib17))等虚假信息数据集中,叙事通常被理解为核心信息。遵循CARDS的定义,我们将这样的核心信息称为*超级主张*:一种规范化的声明性断言,读者可以同意或不同意,并且足够概括,可以将多个单独的文本实例归于其下。这是我们计算生成输出是否为叙事标签(而非单个声明实例)的标准。近年来,许多叙事相关的方法建立在聚类机制之上:Hanley等(2024)(https://arxiv.org/html/2609.11128#bib.bib9)对来自不可靠新闻网站的段落级嵌入进行聚类以识别和追踪叙事,Gerard等(2026)(https://arxiv.org/html/2609.11128#bib.bib7)将聚类纳入跨平台叙事预测,而Relatio(Ash等,2024 (https://arxiv.org/html/2609.11128#bib.bib1))对语义角色标注(SRL)元组的实体进行聚类,以识别政治话语中它们之间重复出现的关系。另一条并行的工作将叙事表示为行动者、事件及其关系的网络图,包括行动元网络(Tangherlini等,2020 (https://arxiv.org/html/2609.11128#bib.bib29))和基于AMR的叙事信号图(Pournaki和Willaert,2025 (https://arxiv.org/html/2609.11128#bib.bib22))。这两类方法都出现在叙事挖掘中,相应的分组由LLM总结并生成叙事标签:声明-聚类流程(Sosnowski等,2025 (https://arxiv.org/html/2609.11128#bib.bib27))和基于图的社区总结(Upravitelev等,2026 (https://arxiv.org/html/2609.11128#bib.bib31)),后者改编自NodeRAG(Xu等,2025 (https://arxiv.org/html/2609.11128#bib.bib33))。两者都根据预先存在的参考叙事来评估其输出。叙事发现可以与机器学习中的一个更广泛模式相关联:从无标签数据中进行类别发现。广义类别发现(Vaze等,2022 (https://arxiv.org/html/2609.11128#bib.bib32))和开放世界分类(Fei和Liu,2016 (https://arxiv.org/html/2609.11128#bib.bib5))解决了从封闭世界向开放世界设定的过渡,但两者都依赖于已标记的已知类别,并根据真实标签来评估它们对新类别的处理能力。第二个要求在叙事发现中无法满足,因为感兴趣的候选是任何现有分类法都未涵盖且无法预先确定的。主题建模不需要标记类别。BERTopic(Grootendorst,2022 (https://arxiv.org/html/2609.11128#bib.bib8))和基于LLM的变体如TopicGPT(Pham等,2024 (https://arxiv.org/html/2609.11128#bib.bib19))直接从无标签文本中归纳出类别,但这些类别命名的是主题领域而非核心信息:例如标签“气候”,而叙事数据集需要像“气候解决方案不会奏效”这样的完整句子。 ## 3 方法论 我们在此全文中使用“叙事标签”(NL)指代流程生成的任何标签,“叙事候选”指代经人工验证标记为可用于扩展分类法的NL。附录A(https://arxiv.org/html/2609.11128#A1)收集了术语表。 ### 3.1 评估框架 我们的评估策略沿着封闭世界到开放世界的轴线组织对归纳式虚假信息叙事挖掘流程的评估。三个层次在概念上相关但相互独立。它们不是顺序流程。每个层次回答关于流程能力的不同问题。各层次的提出基于一个假设:在一个层次上的成功并不预示在另一个层次上的成功:一个流程可能很好地恢复源分类法,但在挖掘上失败,或者产生强大的挖掘结果但没有发现新的东西。 1. **叙事恢复**:相同语料库,其自身分类法。此层次是健全性检查:流程能否从数据集自身的语料库推断出该数据集的分类法标签?我们提出将现有的叙事分类数据集重新用于此评估。 *失败模式*:流程无法重现源分类法。 2. **叙事挖掘**:相同语料库,不同的参考分类法。流程的标签能否与独立开发的分类法匹配?这将Sosnowski等(2025)(https://arxiv.org/html/2609.11128#bib.bib27)推广到除事实核查语料库外的任意包含虚假信息的语料库。 *失败模式*:流程在基于语料库自身分类法时得分良好,但在基于同一领域的独立分类法时表现不佳。 3. **叙事发现**:任何语料库,无参考分类法。流程能否识别任何现有分类法都未涵盖的叙事候选? *失败模式*:标注者认为提出的候选不连贯或已被涵盖,或者流程从未提出标注者会接受的候选。 我们认为归纳式叙事评估需要所有三个层次:封闭世界层次(恢复和挖掘)衡量生成的标签与现有分类法的契合程度,但无法评估参考标签空间之外产生的新颖叙事候选。发现层次补充了它们:标注者直接判断生成的标签本身,因此不需要参考集来评分。 #### 3.1.1 封闭世界指标 每个流程产生$n$个NL $L=\{l_1,...,l_n\}$,针对参考分类法$R=\{r_1,...,r_m\}$进行评分。使用harrier-oss-v1-0.6b(Microsoft,2026 (https://arxiv.org/html/2609.11128#bib.bib16))(因其模型系列在多语言MTEB v2(Enevoldsen等,2025 (https://arxiv.org/html/2609.11128#bib.bib4))排行榜[222](https://huggingface.co/spaces/mteb/leaderboard)上排名第一,访问于2026年4月)对两者进行嵌入,得到余弦相似度$S_{ij}=\cos(r_i,l_j)$,其中$i \in [m]$索引参考标签,$j \in [n]$索引NL,距离$D_{ij}=1-S_{ij}$。全文保持此约定。 ##### 匈牙利相似度(↑)。 $L$和$R$之间最佳一对一排列的平均余弦相似度:对于大小为$k=\min(m,n)$的排列$\pi$(即$k$对$(i,j)$的集合,其中每个$r_i$和每个$l_j$最多出现一次),取$\pi^{\star}=\arg\max_{\pi}\sum_{(i,j)\in\pi} S_{ij}$(通过匈牙利算法(Kuhn,1955 (https://arxiv.org/html/2609.11128#bib.bib14))计算),并报告$\mathrm{Hungarian}(L,R)=\frac{1}{k}\sum_{(i,j)\in\pi^{\star}} S_{ij}$。
相似文章
基于LLM的操纵性政治叙事检测
一种结合基于提示的过滤和无监督聚类的计算框架,用于从社交媒体帖子中识别操纵性政治叙事聚类,无需预定义类别。
基于图的俄乌Telegram频道间虚假信息叙事扩散检测
本文提出了一种结合弱监督与传播图分析的图基框架,用于检测和分析Telegram生态系统中的虚假信息叙事,重点关注俄罗斯和乌克兰的频道。
社交媒体政治话语中竞争叙事的自动识别
本文提出了一种无监督框架,用于识别和刻画社交媒体政治话语中的竞争叙事,重点关注德国政治家的推文,并使用自然语言处理技术分析不同的观点。
MMMMM:用于研究多语言多模态虚假信息机制的统一分类体系
本文提出了一种统一分类体系,用于研究社交媒体上的多语言多模态虚假信息,利用大规模数据集和基于视觉语言模型的自动标注,以揭示检测和缓解的见解。
解释是否必要且充分?调优LLM用于可解释的虚假信息检测
本文提出了一种专门用于可解释虚假信息检测的LLM微调流水线,并介绍了一种数据合成方法LonsRex,用于生成必要且充分的解释,解决了仅基于标签正确性进行简单过滤的局限性。