多阶段训练用于检测印度语言中的辱骂评论

arXiv cs.CL 论文

摘要

本文提出了一种多阶段训练流程,利用基于语言的预处理和模型集成来检测印度语言中的辱骂评论,旨在最小化误报,同时保护言论自由。

arXiv:2605.22380v1 公告类型:新 摘要:近年来,社交媒体已成为越来越受欢迎的交流工具。人们用它来分享想法、交换信息和讨论观点。鉴于其普及性和广泛覆盖,社交媒体必须保持安全空间。社交媒体上生成的内容可能具有辱骂性,检测此类内容变得日益重要。本文使用基于语言的预处理和多个模型的集成,分析它们在辱骂评论检测中的性能。通过大量实验,我们提出了一种最小化误报率(将非辱骂标记为辱骂)的流程,以便这些系统能够在检测辱骂评论的同时不损害言论自由。
查看原文
查看缓存全文

缓存时间: 2026/05/22 08:46

# 面向印度语言的辱骂性评论检测的多阶段训练
来源:https://arxiv.org/abs/2605.22380
查看 PDF (https://arxiv.org/pdf/2605.22380)

> 摘要:近年来,社交媒体已成为日益流行的沟通工具。人们用它来分享想法、交流信息和探讨观点。鉴于其普及性和广泛影响力,社交媒体必须保持为一个安全的空间。社交媒体上生成的内容可能具有辱骂性,检测这类内容变得越来越重要。在本文中,我们使用基于语言的预处理以及多个模型的集成方法,分析它们在辱骂性评论检测上的性能。通过大量实验,我们提出了一套流水线,旨在最小化误报率(将非辱骂性内容标记为辱骂性),从而使这些系统在检测辱骂性评论的同时,不损害言论自由。

## 提交历史

来自:Pranshu Rastogi [查看邮件 (https://arxiv.org/show-email/a923246b/2605.22380)] **\[v1\]** 2026年5月21日星期四 12:09:53 UTC (486 KB)

相似文章

基于双阈值难例挖掘的跨平台中文攻击性评论检测

arXiv cs.CL

本文提出了一种用于跨平台中文攻击性评论检测的双阈值难例挖掘策略,以解决因领域偏移导致的性能下降问题。该方法在COLD数据集上微调RoBERTa模型,并利用极少数标记数据将其适应于四个中文社交媒体平台。

多语言语言模型中有毒内容检测与缓解策略综述

arXiv cs.CL

本综述综合了关于多语言大语言模型中有毒内容检测与去毒化研究,梳理了威胁模型、任务形式、检测方法和缓解策略,同时指出了持续存在的挑战,如语言覆盖不均衡以及危害定义的文化依赖性。