MUCnoHARM@GermEval Shared Task 2026: 基于检索的上下文内学习用于诽谤罪,及其不足之处

arXiv cs.CL 论文

摘要

本文评估了基于检索的上下文内学习方法,用于检测德国社交媒体帖子中与犯罪相关的仇恨言论,发现少样本提示优于零样本,但检索方法仅提供边际增益,模型更适合用于分诊而非自主审核。

arXiv:2609.09791v1 公告类型:新 摘要:随着仇恨言论在网上无处不在,自动检测至关重要,尤其是在涉及与犯罪相关的社交媒体帖子时。我们研究了多种基于检索的上下文内学习(RetICL)策略,用于检测德国刑法典第185-187条下的诽谤罪(即GermEval 2026子任务4的主题)。少样本提示优于零样本,但检索方法仅比随机示例提供边际增益,甚至落后于优化的静态示例集。提供具体的法律知识有所帮助,但模型选择超过所有其他系统选择。模型过度预测犯罪相关性,同时仍遗漏26-57%的犯罪相关帖子,使其更适合用于分诊而非自主审核。
查看原文
查看缓存全文

缓存时间: 2026/09/10 08:15

# MUCnoHARM@GermEval 共享任务2026:基于检索的上下文学习用于诽谤罪检测及其局限性

来源:https://arxiv.org/html/2609.09791

**作者**:Kristin Gnadt  
**所属机构**:  
- 安全领域信息技术中央办公室(ZITiS),德国慕尼黑  
- 慕尼黑大学统计系,德国慕尼黑  

**作者**:Maximilian Meidinger  
**所属机构**:安全领域信息技术中央办公室(ZITiS),德国慕尼黑  

**作者**:Matthias Aßenmacher  
**所属机构**:  
- 慕尼黑大学统计系,德国慕尼黑  
- 慕尼黑机器学习中心(MCML),德国  

**通讯作者**:[[email protected]](mailto:[email protected])

---

#### 摘要  
随着仇恨言论在网络上无处不在,自动检测变得至关重要,尤其是在涉及刑法相关的社交媒体帖子时。我们研究了多种基于检索的上下文学习(RetICL)策略,用于检测违反《德国刑法典》§§ 185–187条(GermEval 2026子任务4的主题)的诽谤罪行。少样本提示优于零样本,但基于检索的方法相比随机示例仅带来微小的收益,甚至落后于经过优化的静态示例集。提供具体的法律知识有所帮助,但模型选择的影响超过了其他所有系统选择。模型会过度预测刑法相关性,同时仍然遗漏26–57%的刑法相关帖子,这使得它们更适合用于初步筛选而非自主审核。

---

## 1 引言  
仇恨言论检测已成为大型语言模型(LLM)文本分类的一个具有重要社会影响的应用领域。仇恨言论在网络上高度普遍:2025年第一季度,德国34%的互联网用户报告遭遇过此类内容(德国联邦统计局,2025)。潜在有害内容的数量已远超人工审核的能力,使得自动检测成为平台和政策制定者共同关注的关键问题(欧盟基本权利署,2023)。大型语言模型(LLMs)在解决自动仇恨言论检测的核心语义挑战方面展现出强大能力,使其成为该任务的自然选择。迄今为止,大多数研究集中在英语数据集和环境,尽管越来越多的研究开始关注其他语言(包括德语)的仇恨言论检测。

然而,检测**刑法相关**的仇恨言论引入了更深层次的复杂性:模型必须对(特定国家)法律中编码的具体阈值和区分敏感,而现有系统仅部分满足这一要求。GermEval 2026共享任务**“社交媒体有害内容检测”**的子任务4(DEF)正是这一挑战的具体实例:根据《德国刑法典》§§ 185–187条对帖子进行分类,以确定其是否构成诽谤罪行。

**图1**:RetICL框架。嵌入的训练样本组成知识库,从中检索少样本示例,这些示例与任务描述(*条件设置*)和帖子一起提供给模型。

---

#### 贡献  
在本研究中,我们测试了不同的提示策略来检测诽谤罪行。我们的RetICL框架由两个主要组成部分构成(图1):  
1. 提供给模型的关于§§ 185–187 StGB的法律信息(**条件设置**);  
2. 用于少样本示例的检索机制(**嵌入与检索**)。

第一个组成部分基于Ludwig等人(2025)的工作,他们使用不同抽象层次的提示——以不同层级的法律知识对模型进行“条件设置”——来检测帖子是否涉及§ 130 StGB(煽动仇恨罪)。第二个组成部分测试了为少样本提示选择示例的不同策略,并将这些策略与零样本提示进行比较。

第2节将我们的两个组成部分置于先前关于法律条件设置和RetICL的研究背景中。第3节详细说明了我们比较的条件设置模式和检索策略,第4节描述了实验设置。第5节报告了具体法律知识和少样本提示有所帮助,但检索策略几乎没有影响的结果,全部讨论见第6节。

---

## 2 背景与相关工作  

### 2.1 诽谤罪行  
本任务核心的《德国刑法典》条款是§§ 185–187中的三项诽谤罪行,它们均保护个人名誉权,主要区别在于贬损陈述是意见还是事实主张,以及其指向对象。  
- § 185 **侮辱罪**(Beleidigung)  
- § 186 **诽谤罪**(Üble Nachrede)  
- § 187 **故意诽谤罪**(Verleumdung)  

数据集(GermEval 2026,子任务4)采用Zufall等人(2019)的决策方案进行标注。该方案直接源自德国演绎民事法传统中的法定规范,将§§ 185–187的法律评估操作化为一系列基于帖子文本的六个二元(是/否)决策。这些决策涵盖:帖子是否针对有效的名誉权持有人、是否具有贬损性、是事实主张还是价值判断,以及如何权衡言论自由与名誉权(§ 193 StGB)。完整方案见附录A。由于该方案将复杂的法律判断分解为可独立检查的子决策,它能产生可靠的标注——Zufall等人(2019)报告称,经过指导的非专业人士应用该方案时,与专家参考相比具有合理的可靠性。此外,该方案为提示提供了自然的分级法律知识来源,我们的*条件设置*环境利用了这一点。

### 2.2 法律条件设置  
任务呈现给LLM的方式强烈影响其性能。即使意义保持不变的提示更改也可能显著改变性能。除了这些表面选择,提示的*内容*——它向模型提供哪些任务相关知识——本身就是一个设计决策。这在法律等专业领域尤为相关,因为通用提示技术虽有帮助,但需要仔细调整。这引发了应在提示中放置*多少*以及*何种类型*的法律知识的问题。

Ludwig等人(2025)通过在不同抽象层次的法律知识上对LLM进行“条件设置”,解决了涉及§ 130 StGB(煽动仇恨罪)的仇恨言论检测问题。他们的提示范围从法条标题(依赖模型内部化的知识)到逐字或简化的法条文本,最后到将罪行明确分解为其组成的子任务。这种分解遵循了AlKhamissi等人(2022)发现对少样本仇恨言论检测有效的基于子任务的框架。

遵循这些方法,我们改变了提供给模型的法律知识,从仅陈述相关条款编号和标题,到将任务分解为Zufall等人(2019)标注方案的子任务。与直觉相反,Ludwig等人(2025)发现,基于更抽象知识进行条件设置的模型优于获得更具体法律信息的模型。LLM提示方法与法律专家之间仍存在显著的性能差距,且模型几乎无法匹敌应用该标注方案的非专业人士。相反,von Cossel(2026)发现,通过神经符号方法结合逻辑脚手架,将子任务分解用于检测§ 130 StGB罪行,优于复杂度较低的提示方法。

### 2.3 基于检索的上下文学习  
LLM可以通过上下文学习(ICL)执行分类,即在提示中以少量输入-输出示例进行条件设置,而无需更新模型参数。然而,ICL对这些示例的选择、数量、排序和格式高度敏感。因此,应用于每个输入的固定、手动整理或随机采样的集合是最优的,这推动了RetICL¹的发展,其中示例从标记池中按查询检索。

¹ 文献中,RetICL也被称为动态少样本提示、增强型RAG的LLM、(选择性)示例检索以及用于ICL的主动学习。

检索通常由相似性目标引导,最常见的是使用稀疏词项匹配检索器(如BM25)或通过余弦相似性评分的密集句子嵌入检索器来选择top-k示例。Margatina等人(2023)表明,基于相似性的检索始终优于基于不确定性、多样性和随机性的选择,而零样本提示在文本分类任务中表现最差。Miller等人(2025)发现RetICL在七个开源权重LLM用于临床笔记章节分类时表现最佳,其F1宏观分数显著高于零样本和静态少样本;他们指出,静态少样本有时不比零样本更好,较小模型受益更多,且更多示例并不单调地提高性能。

这些方法越来越多地应用于仇恨言论检测相关的滥用语言和内容审核任务。对于隐式仇恨言论,Kim和Lee(2025)优先选择共享目标群体的示例,然后才回退到BM25相似性,减少了LLM对有毒表面术语的过度敏感性。相关工作利用检索来发现新兴的“狗哨”——用于规避自动检测机制的编码语言。然而,并非所有证据都是积极的:Liu和Shi(2024)发现动态示例选择不如他们的提示优化框架可靠。

RetICL是一种强大但依赖于任务的策略,然而零样本、静态和RetICL的相对行为在**刑法相关**的仇恨言论中仍未得到检验——在这类任务中,分类依赖于精确的法律阈值而非一般的毒性概念。我们通过系统地测试共享任务中用于检测诽谤罪行的检索机制和提示策略来填补这一空白。

---

## 3 材料与方法  

#### 数据集  
DEF任务基于一个德语推文语料库,每个推文根据第2.1节描述的Zufall等人(2019)的标注方案进行标注,并带有一个二元标签,指示该帖子是否违反§§ 185–187 StGB。已标注部分包含3,263条推文,我们在其上报告交叉验证结果;另有577条未标注推文构成竞赛测试集,仅用于共享任务提交。在训练数据集中,约13%的样本被标记为正例(刑法相关)。此外,一位作者按照Zufall等人(2019)的解释,对797条训练推文子集在方案的每个单独决策步骤级别进行了标注。虽然组织者数据仅提供最终标签,但这些辅助标注记录了每个步骤的结果;当将分类任务分解为单独步骤(*显式*条件设置)时,它们被用作少样本检索的示例池。

#### 模型  
评估了四个指令调优模型,涵盖不同系列、参数规模和开放度:Gemma-4 26B (gemma-4-26B-A4B-it)、Gemma-4 E4B (gemma-4-E4B-it)、Qwen3.5 9B (Qwen3.5-9B) 和 EuroLLM 22B (EuroLLM-22B-Instruct-2512)。所有模型均从HuggingFace Hub加载,并使用Transformers库运行。

#### 条件设置  
第一个组成部分改变了提供给模型的法律信息,遵循Ludwig等人(2025)的方法。每种*条件设置*模式对应不同的任务描述。  
- *标题*设置仅说明相关StGB条款的编号和标题。  
- *描述*设置额外提供根据标注方案构成诽谤罪行的描述。  
- *隐式*设置内联呈现方案的全部六个决策步骤,使模型在单次推理调用中遍历完整的决策树。  
- *显式*设置则将任务分解为六个独立的推理调用步骤:每个步骤单独分类,最终标签由步骤结果序列推导得出。每个步骤作为独立提示运行,仅包含该步骤的指令、其示例和帖子。

所有提示以及有关聊天模板和少样本集成的附加信息见附录B。

#### 示例选择  
第二个组成部分控制如何选择少样本示例。在*零样本*配置(k=0)中,不包含任何示例。在

相似文章