多阶段训练用于检测印度语言中的辱骂评论
摘要
本文提出了一种多阶段训练流程,利用基于语言的预处理和模型集成来检测印度语言中的辱骂评论,旨在最小化误报,同时保护言论自由。
arXiv:2605.22380v1 公告类型:新
摘要:近年来,社交媒体已成为越来越受欢迎的交流工具。人们用它来分享想法、交换信息和讨论观点。鉴于其普及性和广泛覆盖,社交媒体必须保持安全空间。社交媒体上生成的内容可能具有辱骂性,检测此类内容变得日益重要。本文使用基于语言的预处理和多个模型的集成,分析它们在辱骂评论检测中的性能。通过大量实验,我们提出了一种最小化误报率(将非辱骂标记为辱骂)的流程,以便这些系统能够在检测辱骂评论的同时不损害言论自由。
查看缓存全文
缓存时间: 2026/05/22 08:46
# 面向印度语言的辱骂性评论检测的多阶段训练 来源:https://arxiv.org/abs/2605.22380 查看 PDF (https://arxiv.org/pdf/2605.22380) > 摘要:近年来,社交媒体已成为日益流行的沟通工具。人们用它来分享想法、交流信息和探讨观点。鉴于其普及性和广泛影响力,社交媒体必须保持为一个安全的空间。社交媒体上生成的内容可能具有辱骂性,检测这类内容变得越来越重要。在本文中,我们使用基于语言的预处理以及多个模型的集成方法,分析它们在辱骂性评论检测上的性能。通过大量实验,我们提出了一套流水线,旨在最小化误报率(将非辱骂性内容标记为辱骂性),从而使这些系统在检测辱骂性评论的同时,不损害言论自由。 ## 提交历史 来自:Pranshu Rastogi [查看邮件 (https://arxiv.org/show-email/a923246b/2605.22380)] **\[v1\]** 2026年5月21日星期四 12:09:53 UTC (486 KB)
相似文章
基于双阈值难例挖掘的跨平台中文攻击性评论检测
本文提出了一种用于跨平台中文攻击性评论检测的双阈值难例挖掘策略,以解决因领域偏移导致的性能下降问题。该方法在COLD数据集上微调RoBERTa模型,并利用极少数标记数据将其适应于四个中文社交媒体平台。
Inspect India Evals:面向印度语言文化语境的大语言模型开放评估框架
介绍Inspect India Evals,一个用于在印度语言文化语境中评估大语言模型的开源框架,包含六项基准测试,涵盖多语言能力、偏见、安全性和文化知识。对五个模型的测试显示,Sarvam-M 24B和Gemma 2 27B表现领先。
谁与何?利用语言特征和标注者特征分析标注差异
本文对四个有害语言检测数据集进行了大规模分析,考察标注者特征与语言特征如何相互作用以影响标注差异。文章强调了交叉性效应的影响,并警示不要将不同数据集的发现简单泛化。
IndicTalk:面向印度语言的基于角色的大规模多语言对话语料库
IndicTalk 是一个大规模多语言对话语料库,涵盖9种印度语言,包含代码混合对话,通过自动化流水线生成,结合新闻基础(news grounding)和角色条件(persona conditioning),旨在推动面向代表性不足语言的对话AI发展。
多语言语言模型中有毒内容检测与缓解策略综述
本综述综合了关于多语言大语言模型中有毒内容检测与去毒化研究,梳理了威胁模型、任务形式、检测方法和缓解策略,同时指出了持续存在的挑战,如语言覆盖不均衡以及危害定义的文化依赖性。