斯拉夫语言劝说技巧语料库

arXiv cs.CL 论文

摘要

一个针对保加利亚语、波兰语和俄语的劝说技巧新注释语料库,涵盖议会辩论和社交媒体,包含25种细粒度技巧及用于检测和分类的基线模型。

arXiv:2607.10715v1 公告类型:新 摘要:劝说技巧是用于在各类媒体中影响公众舆论的强大修辞手法。我们提出了一个新的劝说技巧语料库,重点聚焦斯拉夫语言。该语料库包含保加利亚语、波兰语和俄语的文档,在粗粒度文本跨度层级和细粒度句子层级标注了劝说技巧。这些技巧源自一个包含25种细粒度劝说技巧的分类体系,归为六大类修辞劝说策略。语料库包含来自222个文档的约7500个文本跨度,涵盖国内和国际层面激烈辩论的话题。我们描述了语料库的创建过程,提供了详细的统计数据,并考察了话题与劝说技巧之间的相关性。我们使用基于机器学习和生成式AI的经典模型,为文本跨度层级和句子层级的劝说技巧检测与分类提供基线和基准结果。
查看原文
查看缓存全文

缓存时间: 2026/07/14 04:22

# 斯拉夫语言劝说技巧语料库
来源:https://arxiv.org/html/2607.10715

###### 摘要

劝说技巧是广泛用于影响公众舆论的强大修辞手段。我们提出了一个新的劝说技巧语料库,重点关注斯拉夫语言。该语料库包含保加利亚语、波兰语和俄语的文档,在粗粒度文本片段层面和细粒度句子层面都标注了劝说技巧。这些技巧来自一个包含25种细粒度劝说技巧的分类体系,归入六大修辞劝说策略类别。该语料库包含来自222篇文档的大约7,500个文本片段,涵盖了国内外激烈辩论的话题。我们描述了语料库的创建过程,提供了详细统计数据,并考察了话题与劝说技巧之间的相关性。我们使用经典的基于机器学习和基于生成式人工智能的模型,为文本片段层面和句子层面的劝说技巧检测与分类提供基线和基准结果。

关键词:劝说技巧、文本分类、语言资源、斯拉夫语言、机器学习

\NAT@set@cites

# 斯拉夫语言劝说技巧语料库

Jakub Piskorski⋆,Dimitar Iliyanov Dimitrov†,Marina Ernst‡,
Jacek Haneczok♢,Michał Marcińczuk♠,Arkadiusz Modzelewski§,
Roman Yangarber♡

⋆波兰科学院计算机科学研究所,波兰
†索非亚大学“圣克莱门特·奥赫里德斯基”,保加利亚
‡科布伦茨大学,德国
♢Visa Technology Europe
♠CodeNLP
§帕多瓦大学,意大利
♡赫尔辛基大学,芬兰

[email protected][email protected][email protected][email protected][email protected][email protected][email protected]

摘要内容

## 1. 引言

劝说在政治辩论中至关重要,影响政策结果,并广泛应用于各种场合,包括社交媒体影响者,以影响公众舆论。劝说技巧作为心理机制运行,旨在引导读者的信念和行为,例如投票。许多技巧基于构建论点时的有缺陷或不当推理,而另一些技巧则故意触发情绪反应——例如诉诸爱国主义——以在事实支持缺失或薄弱时获得认同。在本文中,我们提出了一个用斯拉夫语言标注了劝说技巧的新语料库。它包含保加利亚语和波兰语的议会辩论文本,以及俄语的社交媒体文本,使用包含25种细粒度劝说技巧的分类体系进行了标注。该语料库包含来自222篇文档的大约7,500个标注了劝说技巧的文本片段。该语料库涵盖了国际层面(例如,乌克兰-俄罗斯战争)和国家层面(例如,堕胎立法)高度争议的话题。

创建该语料库的主要动机是促进和激发关于斯拉夫语言中劝说技巧检测和文本分类的研究。我们旨在涵盖议会辩论和社交媒体领域,而在斯拉夫语言劝说技巧方面,这些领域几乎没有或完全没有资源。我们的贡献可概括如下:

- • 我们发布了一个新的劝说技巧语料库,在三种斯拉夫语言——保加利亚语、波兰语和俄语——的文本片段和句子层面进行了标注,涵盖两种文本体裁:议会辩论和社交媒体帖子,
- • 我们提供了该语料库的特征,包括统计数据、话题以及标签之间的相关性,
- • 我们发布并评估了经典机器学习和基于生成式人工智能的基线模型,用于文本片段和句子层面的劝说技巧检测与分类。

需要强调的是,劝说技巧的文本片段标注可能涵盖单个词、句子的一部分、整个句子,甚至跨越多个句子的更大文本块。句子级标注是通过将文本片段标注映射到句子获得的。

本文组织如下。第2节(https://arxiv.org/html/2607.10715#S2)涵盖了相关工作。第3节(https://arxiv.org/html/2607.10715#S3)描述了语料库的创建。第4节(https://arxiv.org/html/2607.10715#S4)提供了话题与劝说技巧之间相关性的见解。第5节(https://arxiv.org/html/2607.10715#S5)介绍了用于劝说技巧检测和分类的基线模型。第6节(https://arxiv.org/html/2607.10715#S6)总结了工作并展望了未来方向。

## 2. 相关工作

Habernal等人(2017(https://arxiv.org/html/2607.10715#bib.bib1),2018(https://arxiv.org/html/2607.10715#bib.bib5))报告了关于五种逻辑谬误自动检测的研究。Da San Martino等人(2019b(https://arxiv.org/html/2607.10715#bib.bib3))提出了一个英文新闻文章语料库,使用更细粒度的18种劝说技巧分类体系在文本片段和句子层面进行了标注,并报告了自动化检测方法的实验。该语料库用于NLP4IF-2019细粒度宣传检测共享任务(Da San Martino等人,2019a(https://arxiv.org/html/2607.10715#bib.bib9))和SemEval-2020任务11:新闻文章中的劝说技巧检测(Da San Martino等人,2020(https://arxiv.org/html/2607.10715#bib.bib11)),重点是在文本片段和文档级别检测劝说技巧,初始分类体系包含18种技巧,针对英文新闻文章。Piskorski等人(2023c(https://arxiv.org/html/2607.10715#bib.bib16))引入了一个扩展的分类体系,包含23种劝说技巧,分为6个不同类别,以及一个包含6种语言(包括斯拉夫语言的波兰语和俄语)的1.7K篇新闻文章语料库,使用该分类体系在文本片段层面进行了标注。Modzelewski等人(2025(https://arxiv.org/html/2607.10715#bib.bib2))展示了该分类体系的实用性和适用性,他们通过劝说增强链式思维方法将其用于增强虚假信息检测。该语料库还用于SemEval-2023任务3:多语言环境下在线新闻中的类别、框架和劝说技巧检测(Piskorski等人,2023b(https://arxiv.org/html/2607.10715#bib.bib12))。CLEF 2024任务3:劝说技巧(Piskorski等人,2024(https://arxiv.org/html/2607.10715#bib.bib23))是SemEval-2023任务3的后续,新增了五种语言的新闻文章,即阿拉伯语、保加利亚语、英语、葡萄牙语和斯洛文尼亚语(又增加了两种斯拉夫语言),并在文本片段层面评估了劝说检测与分类。

最近,有研究报告了在其他文本体裁中检测和分类劝说技巧的工作,例如,共享任务DIPROMATS 2023:世界大国外交官和当局消息中宣传技巧的自动检测与特征描述(Moral等人,2023(https://arxiv.org/html/2607.10715#bib.bib27))和DIPROMATS 2024:世界大国外交官和当局消息中宣传技巧的检测、特征描述与追踪(Moral等人,2024(https://arxiv.org/html/2607.10715#bib.bib28)),其结果发布了一个包含约21,000条由中国、俄罗斯、美国和欧盟当局发布的英文和西班牙文推文的数据集。

在议会辩论和社交媒体中检测和分类劝说技巧是SlavicNLP 2025共享任务(Piskorski等人,2025(https://arxiv.org/html/2607.10715#bib.bib15))的主题。具体来说,该任务侧重于段落层面的劝说技巧分类,涵盖5种斯拉夫语言(保加利亚语、克罗地亚语、波兰语、俄语和斯洛文尼亚语),并将Piskorski等人(2023c(https://arxiv.org/html/2607.10715#bib.bib16))提出的劝说技巧分类体系调整并扩展至25种技巧。本文中介绍的新数据集使用了相同的分类体系进行标注。Kyslyi等人(2025(https://arxiv.org/html/2607.10715#bib.bib13))报告了关于乌克兰社交媒体操控检测与分类的共享任务,引入了一个包含约9,500条乌克兰Telegram(俄语和乌克兰语)帖子的新数据集,并使用前述SemEval任务中使用的劝说分类体系的一个子集进行了标注。此外,Modzelewski等人(2024(https://arxiv.org/html/2607.10715#bib.bib4))提出了一个包含11种操控技术的分类体系,并发布了一个基于该分类体系标注的波兰语虚假信息数据集。最后,Alzahrani等人(2024(https://arxiv.org/html/2607.10715#bib.bib14))提出了一项关于阿拉伯语社交媒体中劝说技巧检测与分类的研究。

另一条研究路线侧重于检测多模态内容中的劝说技巧。例如,迷因中劝说技巧的检测是以下共享任务的主题:SemEval-2021任务6:文本和图像中的劝说技巧检测(Dimitrov等人,2021(https://arxiv.org/html/2607.10715#bib.bib10))和SemEval-2024任务4:迷因中劝说技巧的多语言检测(Dimitrov等人,2024(https://arxiv.org/html/2607.10715#bib.bib26))。这些任务扩展了SemEval-2020的分类体系,以检测视觉内容中的劝说技巧,共计22种技巧(20种多模态技巧和2种纯视觉技巧)。除英语外,第二个任务还涵盖了两种斯拉夫语言:保加利亚语和马其顿语。

准确分析劝说技巧对于文本理解任务至关重要;例如,在信息抽取中(Piskorski and Yangarber,2013(https://arxiv.org/html/2607.10715#bib.bib49);Huttunen等人,2002(https://arxiv.org/html/2607.10715#bib.bib54)),劝说技巧引入了内容中事实维度与修辞维度之间复杂的相互作用:内容是传达对事件的客观报道,还是试图影响读者对事件的感知。仅依赖事件检测方法不足以确保可靠性和可信度(Atkinson等人,2011(https://arxiv.org/html/2607.10715#bib.bib52);Yangarber,2006(https://arxiv.org/html/2607.10715#bib.bib53))。随着劝说性内容在线上的日益普及,我们准确检测并分析其所有方面的能力变得更加重要。

据我们所知,我们提出的语料库是第一个针对保加利亚语和波兰语、涵盖议会辩论领域文本片段和句子层面标注的语料库,也是第一个针对俄语社交媒体、以细粒度劝说技巧标注的语料库。这构成了Piskorski等人(2025(https://arxiv.org/html/2607.10715#bib.bib15))所述共享任务所用语料库的一部分,该任务侧重于斯拉夫语言中段落层面的劝说技巧检测与分类。

## 3. 语料库创建

### 3.1. 分类体系

为了标注语料库中的文本,我们使用了SlavicNLP 2025共享任务关于劝说技巧的两层分类体系(Piskorski等人,2023c(https://arxiv.org/html/2607.10715#bib.bib16))。顶层是6种粗粒度的劝说策略:
*攻击声誉*、*论证*、*简化*、*分散注意力*、*呼吁*和*操纵性措辞*——详细描述如下。

**攻击声誉**:论证将焦点从讨论的话题转移到参与者身上——他们的人格、经历、行为等——以质疑或削弱其可信度。论证的目标可以是个人群体、组织或活动。

**论证**:论证由两部分组成:一个声明和一个解释或诉求,后者用于证明或支持该声明。

**简化**:论证过度简化问题,通常涉及原因、后果或选择的存在。

**分散注意力**:论证将注意力从主要话题上移开,以分散读者的注意力。

**呼吁**:文本不是一个论证,而是鼓励以特定方式行动或思考。

**操纵性措辞**:文本本身不是论证,但使用特定语言,其中包含非中立、令人困惑、夸大、有倾向性等的词语或短语,以影响读者的情感。

这六种策略,细分为25种细粒度劝说技巧(见图1(https://arxiv.org/html/2607.10715#S3.F1)),在附录A(https://arxiv.org/html/2607.10715#A1)中通过示例进行了详细定义。

**攻击声誉**
- 辱骂或贴标签
- 关联犯罪
- 制造怀疑
- 诉诸虚伪
- 质疑声誉

**论证**
- 挥舞旗帜,诉诸爱国主义
- 诉诸权威
- 诉诸流行
- 诉诸恐惧、偏见
- 诉诸价值观

**分散注意力**
- 稻草人谬误
- 你也一样
- 红鲱鱼
- 诉诸怜悯

**简化**
- 因果过度简化
- 虚假两难或别无选择
- 后果过度简化
- 虚假等同

**呼吁**
- 口号
- 结束对话
- 诉诸时间

**操纵性措辞**
- 有倾向性语言
- 含糊其辞、故意模糊、混淆
- 夸大或缩小
- 重复

图1:两层说服技巧分类体系。

### 3.2. 文档采集

为了创建语料库,我们收集了三种语言(保加利亚语、波兰语和俄语)的文档,涵盖各种争议性话题。对于保加利亚语和波兰语,我们使用各自议会会议的笔录。对于俄语,我们使用社交媒体帖子,特别是来自Telegram平台的、关注社区频道的帖子。保加利亚议会辩论涵盖的话题包括:外交政策(重点关注对乌克兰的军事援助)、加入欧元区和申根区,以及国家主权关切。国内政治话语(优先事项、诚信、身份认同)与国际事务(例如,持续冲突)交织在一起。波兰辩论涵盖的话题包括高度争议的堕胎立法、国家安全与国防政策、波兰在欧盟内的角色、反对仇恨言论和歧视的立法、社会经济事务——疫苗接种、森林管理、大规模裁员、心理健康意识等。俄语文档主要聚焦于乌克兰-俄罗斯战争,例如,普京-特朗普谈判、俄罗斯与西方的对立、虚假信息、人口挑战(如移民、融合)、在此背景下对国家政策的批评,以及冲突地区的民众抵抗。

所有文档都使用广泛的公共话语话题进行了多重标注:乌克兰-俄罗斯战争、国防、以色列-哈马斯冲突、移民、人口统计、堕胎、欧盟、申根、外部事务、气候变化、仇恨言论、历史、其他。

### 3.3. 标注过程

标注过程包括五个步骤:

1. 1. 对于每种语言,组建一个至少包括两名标注员、一名策展人和一名语言协调员的团队,所有团队成员均为母语者,并具有语言标注经验,包括虚假信息和操纵性内容的标注经验;
2. 2. 我们向所有团队提供了详细的标注指南(Piskorski等人,2023a(https://arxiv.org/html/2607.10715#bib.bib7)),并组织了包含标注培训的现场会议;
3. 3. 每篇文档由两名标注员独立标注;组织了临时会议讨论困难和模糊的案例;
4. 4. 每种语言的策展人验证标注是否符合指南,并根据需要进行修正;
5. 5. 定期会

相似文章

跨领域的德国政治传播中的论证比较与建模

arXiv cs.CL

本文介绍了一个包含17k句子的语料库,该语料库对COVID-19期间三个德国政治领域的论证段落进行了标注,并开展了一项自动识别此类段落的试点研究,发现边界难以确定,且模型存在确认偏差。

俄罗斯国内外政策演讲的关联多模态数据

arXiv cs.CL

本文介绍了一个俄罗斯政府官方演讲的关联多模态数据集,包含文本、图像、元数据和主题标注,旨在支持社会科学研究和政治领域的大语言模型应用。