社交媒体政治话语中竞争叙事的自动识别
摘要
本文提出了一种无监督框架,用于识别和刻画社交媒体政治话语中的竞争叙事,重点关注德国政治家的推文,并使用自然语言处理技术分析不同的观点。
arXiv:2609.11202v1 Announce Type: new
摘要:社交媒体平台已成为塑造政治话语的核心,作为叙事形成和演化的场所,影响公众舆论。识别和分析这些叙事,特别是当它们在不同政治意识形态间竞争时,对于理解现代政治传播的动态至关重要。本文提出了一种无监督框架,用于识别和刻画社交媒体政治话语中的竞争叙事,重点关注德国政治家的推文。该框架采用多阶段流水线,整合自然语言处理技术,如主题建模、事件检测和事件链接。通过将数据组织成连贯的故事并揭示用户社区的不同视角,系统能够检测关键的竞争叙事,突出围绕热门政治话题的不同框架和冲突。两个关于两极分化政治问题的案例研究证明了该方法的有效性,展示了其发现和分析不同观点的能力。研究结果有助于更广泛地理解叙事在数字公共领域内的传播,并为政策制定者、社交媒体平台和对监测政治话语感兴趣的研究者提供见解。
查看缓存全文
缓存时间: 2026/09/11 08:25
# 社交媒体政治话语中竞争性叙事的自动识别 来源:https://arxiv.org/html/2609.11202 \*1 ###### 摘要 社交媒体平台已成为塑造政治话语的核心,作为叙事形成与演变的舞台,深刻影响着公众舆论。识别和分析这些叙事,尤其是不同政治意识形态间相互竞争的叙事,对于理解现代政治传播的动态至关重要。本文提出一个无监督框架,用于识别和刻画社交媒体政治话语中的竞争性叙事,重点分析德国政治人物的推文。该框架采用多阶段处理流程,整合了主题建模、事件检测和事件关联等自然语言处理技术。通过将数据组织成连贯的故事并揭示用户群体的不同视角,系统能够检测关键的竞争性叙事,突出围绕热门政治话题的分歧框架和冲突。针对两起两极分化政治议题的案例研究验证了该方法的有效性,展示了其揭示和分析不同观点的能力。研究结果有助于更广泛地理解叙事在数字公共领域的传播方式,并为政策制定者、社交媒体平台以及关注政治话语监测的研究者提供了见解。 ###### 关键词 叙事框架,竞争性叙事,社交媒体,故事生成,政治意识形态 ††版权年份:2025††版权:本文版权归属作者。允许在知识共享署名4.0国际许可协议(CC BY 4.0)下使用。††会议地点:收录于:R. Campos, A. Jorge, A. Jatowt, S. Bhatia, M. Litvak(编):《Text2Story’25研讨会论文集》,意大利卢卡,2025年4月10日††邮箱:[email protected]††地址:莱布尼茨大学汉诺威L3S研究中心,德国汉诺威††邮箱:[email protected]††通讯作者。## 1引言 社交媒体已成为政治话语的核心舞台,塑造着公众舆论。像X(原Twitter)这样的平台是政治人物直接与民众沟通的关键渠道Gilardi et al. (2022) (https://arxiv.org/html/2609.11202#bib.bib32)。社交媒体允许政治人物构思并直接传播能与追随者及政治基础产生共鸣的叙事Silva and Proksch (2022) (https://arxiv.org/html/2609.11202#bib.bib33)。这些叙事——对事件和问题的结构化解读——常常与其他群体的叙事相互竞争,反映出在紧迫社会议题上不同的政治意识形态和视角Jing and Ahn (2021) (https://arxiv.org/html/2609.11202#bib.bib9)。例如,在涉及健康危机Jing and Ahn (2021) (https://arxiv.org/html/2609.11202#bib.bib9)或气候变化Ross and Rivers (2019) (https://arxiv.org/html/2609.11202#bib.bib34)的事件中,一些群体强调科学视角,而另一些则侧重于基于信仰的解读Reiter-Haas et al. (2024b) (https://arxiv.org/html/2609.11202#bib.bib10)。理解这些竞争性叙事如何产生、演变和传播,对于把握当代政治传播的动态以及应对极化、错误信息和舆论塑造等社会挑战至关重要。 我们的工作有助于推进计算叙事框架分析Reiter-Haas et al. (2024a) (https://arxiv.org/html/2609.11202#bib.bib5)。具体而言,本文旨在解决自动识别和分析Twitter上德国政治人物政治话语中竞争性叙事的挑战。为此,我们提出一个基于自然语言处理(NLP)和聚类技术的新型框架。通过聚焦社交媒体语境下的政治叙事,我们切入了一个自然两极分化的环境,其中的框架在多篇文档(例如推文)中形成,并可能涉及多个来源的(潜在)协作。这种分析有助于洞察政治行为者如何塑造网络辩论,以及相互竞争的观点如何影响社会对政治事件的理解。 该研究领域为促进应对社会挑战的循证方法带来了希望。例如,通过接触多元观点来提升媒体素养和批判性思维,可以使个体更批判性地评估信息、识别偏见并做出明智决定Axelrod et al. (2021) (https://arxiv.org/html/2609.11202#bib.bib35)。此外,理解竞争性叙事可以通过强调共同价值观和差异来促进有建设性的对话,从而实现协作解决问题。竞争性叙事的自动提取和分析可以推动打击错误信息、提升公众理解力,并支持对媒体内容进行更批判性的参与。 ## 2背景与相关工作 叙事研究在文学研究、心理学和社会学等多个学科有着悠久的历史。叙事通常被定义为对一系列关联事件的表征Mishler (1995) (https://arxiv.org/html/2609.11202#bib.bib11),常常融合现实与虚构以影响选择Page (2013) (https://arxiv.org/html/2609.11202#bib.bib12);Jones and McBeth (2010) (https://arxiv.org/html/2609.11202#bib.bib27)。它们作为相互关联的故事系统运作,其中可能包含相互竞争的情节线Page (2013) (https://arxiv.org/html/2609.11202#bib.bib12)。已提出各种叙事分析模型,各自侧重于不同方面Mishler (1995) (https://arxiv.org/html/2609.11202#bib.bib11)。例如,模型可以关注时间顺序、文本连贯性或叙事的社会功能。关注文本连贯性的模型研究叙事如何被构建和组织,以形成一个连贯且易于理解的故事。相反,基于指称和时间顺序的模型分析实际事件及其顺序,而不仅仅是其文本表征Mishler (1995) (https://arxiv.org/html/2609.11202#bib.bib11)。最后,关注社会功能的模型研究叙事如何在社会情境中被用于说服、娱乐或告知目标受众Mishler (1995) (https://arxiv.org/html/2609.11202#bib.bib11)。这些理论工作为理解叙事以及开发实用的分析计算方法奠定了基础。我们的方法结合了多种模型,以自动识别在时间和语义上连贯的叙事,同时考虑其社会功能,特别是在社交媒体上的政治行为者之间。 计算叙事理解的一个关键方面是从文本数据中自动提取叙事元素。这包括识别行为者、行动、事件、背景及其之间的关系Keith Norambuena et al. (2023) (https://arxiv.org/html/2609.11202#bib.bib13);Mani (2022) (https://arxiv.org/html/2609.11202#bib.bib14);Metilli et al. (2019) (https://arxiv.org/html/2609.11202#bib.bib15)。例如,研究人员已经开发出识别事件、根据时间和因果关系链接事件,以及在不同领域表示基于事件的叙事结构的方法Keith Norambuena et al. (2023) (https://arxiv.org/html/2609.11202#bib.bib13)。一种有前景的表征方法采用路线图隐喻来可视化叙事中的事件和情节线,从而有助于理解叙事的核心主题Keith Norambuena and Mitra (2021) (https://arxiv.org/html/2609.11202#bib.bib16)。这些算法还有助于根据连贯性和覆盖范围提取事件和情节线Keith Norambuena and Mitra (2021) (https://arxiv.org/html/2609.11202#bib.bib16);Yu et al. (2021) (https://arxiv.org/html/2609.11202#bib.bib1)。此外,语义角色标注和语义图技术可以通过提取故事中不同行为者和行动的详细信息,有效改善对叙事框架的分析Reiter-Haas et al. (2024b) (https://arxiv.org/html/2609.11202#bib.bib10);Metilli et al. (2019) (https://arxiv.org/html/2609.11202#bib.bib15);Otmakhova et al. (2024) (https://arxiv.org/html/2609.11202#bib.bib17)。这些构件至关重要,因为可靠的计算技术使分析师能够将其研究扩展到大量的叙事数据,从而更深入地理解叙事结构及其影响。 框架理解是塑造读者对叙事感知的另一个关键方面。计算框架分析旨在自动检测框架装置,并理解它们如何被用来影响解读Reiter-Haas et al. (2024a) (https://arxiv.org/html/2609.11202#bib.bib5)。先前的研究已经认识到特定的语言模式和修辞技巧标志着框架,如词语选择、隐喻和证据的呈现Liu et al. (2019) (https://arxiv.org/html/2609.11202#bib.bib28);Otmakhova et al. (2024) (https://arxiv.org/html/2609.11202#bib.bib17)。框架也可以通过情感分析来研究,其中确定对不同行为者和事件表达的情感基调,揭示了叙事中引发的情绪和态度Gitari et al. (2015) (https://arxiv.org/html/2609.11202#bib.bib19);Pitropakis et al. (2020) (https://arxiv.org/html/2609.11202#bib.bib18)。分析特定框架如何与叙事中的各种行为者和概念相关联,有助于揭示潜在的偏见和视角Hamborg et al. (2019b) (https://arxiv.org/html/2609.11202#bib.bib20);Wildemann et al. (2023) (https://arxiv.org/html/2609.11202#bib.bib36)。计算框架分析已证明能有效区分不同来源的框架,例如阴谋论与主流媒体的框架,并揭示媒体偏见Hamborg et al. (2019b) (https://arxiv.org/html/2609.11202#bib.bib20);Reiter-Haas et al. (2024a) (https://arxiv.org/html/2609.11202#bib.bib5)。然而,在跨叙事链中一致地捕捉框架信息仍然存在挑战Mendelsohn et al. (2021) (https://arxiv.org/html/2609.11202#bib.bib22)。我们采用一种计算叙事框架方法,该方法基于叙事结构(例如,特定来源对事件的纳入/排除)来考察框架。然而,更多内容驱动的框架分析方法(例如,情感分析)可以补充我们的方法论,提供额外的见解。 最后,研究竞争性叙事对于理解事件的不同视角和解读如何产生和传播至关重要。这有助于监测社区兴趣、反击宣传攻势以及建模(错误)信息的传播Hamborg et al. (2019a) (https://arxiv.org/html/2609.11202#bib.bib21);Reiter-Haas et al. (2024a) (https://arxiv.org/html/2609.11202#bib.bib5)。该领域的计算方法任务侧重于识别和追踪竞争性叙事随时间的演变,并理解驱动其动态的因素Bandeli et al. (2020) (https://arxiv.org/html/2609.11202#bib.bib23);Schmid et al. (2017) (https://arxiv.org/html/2609.11202#bib.bib24)。为此,所提出的方法应能根据行为者、行动、框架装置和传递的整体信息的差异来区分不同的叙事。然后,可以通过分析语言使用、情感、框架装置以及不同行为者和行动随时间的突出程度的变化来追踪竞争性叙事。研究外部事件、文化转变以及其他叙事如何影响竞争性叙事的产生和传播,使我们能够理解其驱动因素。 ## 3数据集 在本研究中,我们关注Twitter/X上德国政治人物政治话语中的叙事。在收集相应推文之前,必须首先识别相关的政治人物及其Twitter账户。为此,我们利用了结构化数据库Wikidata,该数据库提供政治人物所属政党及其公民身份国家的信息。 我们通过将`occupation`属性与`politician`匹配来筛选Wikidata实体。随后,利用`country of citizenship`筛选德国政治人物。他们的政党隶属关系由`member of political party`属性提供。然而,该属性可能列出多个政党,因为政治人物可能在不同时期更换政党。在某些情况下,当前政党通过限定符标记。否则,我们考虑列出的第一个政党,忽略任何带有结束日期的隶属关系。使用上述过滤器从Wikidata提取Twitter用户名,共得到1,324个账户,属于1,300名政治人物。 使用Twitter API,我们收集了这些政治人物从2022年1月1日至2023年6月24日的所有推文。最终数据集包含来自786个账户的189,850条推文,不包括转推、回复和引用。为了展示,我们使用NLLB模型team et al. (2022) (https://arxiv.org/html/2609.11202#bib.bib29)将推文翻译成英文。除此之外,所有分析均在原始内容(即原始语言)上进行。 ## 4方法论 参见插图图1:竞争性叙事提取流程:在主题的故事内分离用户观点。我们将叙事操作化为在语义和时序上连贯的故事,由对事件和问题的结构化解读表示,为政治传播提供意义和背景。从社交媒体帖子开始,我们旨在识别这些故事以及不同用户群体在其中的竞争性叙事。鉴于单条推文的简短性和有限范围,我们采用语料库层面的方法来识别叙事,而非试图从单个推文中提取。 我们的方法由一个多阶段流程(见图1 (https://arxiv.org/html/2609.11202#S4.F1))组成。在识别数据中的通用主题后,我们检测构成故事基本构件的事件。事件被链接成连贯的故事,从中我们提取不同的观点,我们称之为竞争性叙事。 请注意,在叙事提取过程中,我们忽略了推文作者的政治隶属关系,因为这些信息是我们数据集独有的,可能在其他情境下不可用。然而,它将用于评估,以评估我们方法识别竞争性叙事的有效性。 我们公开发布了数据处理流程的完整源代码111https://github.com/fjen/competing-narratives,以促进开放科学并确保可重复性。 ### 4.1主题建模 鉴于数据集中主题的多样性,第一步是识别各个主题并去除噪声。训练一个无监督主题模型,根据语义相似性对文档进行分组。这里,我们选择基于嵌入的方法,因为它比LDA等传统主题模型更能应对推文的简短和噪声特性。具体来说,我们依赖模块化的BERTopic框架Grootendorst (2022) (https://arxiv.org/html/2609.11202#bib.bib2),该框架本质上根据语义嵌入对文档进行聚类,并为每个主题生成文本表示。值得注意的是,我们使用带有`paraphrase-multilingual-MiniLM`模型的Sentence-BERT。
相似文章
基于LLM的操纵性政治叙事检测
一种结合基于提示的过滤和无监督聚类的计算框架,用于从社交媒体帖子中识别操纵性政治叙事聚类,无需预定义类别。
跨领域的德国政治传播中的论证比较与建模
本文介绍了一个包含17k句子的语料库,该语料库对COVID-19期间三个德国政治领域的论证段落进行了标注,并开展了一项自动识别此类段落的试点研究,发现边界难以确定,且模型存在确认偏差。
从重复到识别:虚假信息叙事的归纳发现
本文引入了一个用于无监督叙事标签生成的三层评估框架,并比较了基于聚类和基于图社区的方法来发现虚假信息叙事,同时发布了经过人工验证的标签以支持分类法的开发。
德国政治文本意识形态预测
本文提出一种基于Transformer的模型,可将德语文本的政治倾向映射到从左到右的连续频谱上,在包含德国联邦议院全体会议记录、Wahl-O-Mat、报纸和推文等多个语料库上实现了高准确率。
德语政治文本的意识形态预测
该论文提出了一种基于Transformer的模型,用于在连续的左-右光谱上预测德语政治文本的政治意识形态。研究比较了13个模型,发现DeBERTa-large和Gemma2-2B在不同任务上表现最佳。