针对资源匮乏语言仇恨言论检测的LLM高效适应:罗马乌尔都语的比较研究

arXiv cs.AI 论文

摘要

本文评估了大语言模型在罗马乌尔都语(一种资源匮乏语言)中的仇恨言论检测能力,证明使用LoRA的参数高效微调相比零样本推理显著提升了分类性能。

arXiv:2608.18142v1 公告类型:新 摘要:在资源匮乏语言(LRLs)中检测仇恨言论具有挑战性,原因包括标注数据的缺失、语言结构的非正式性以及标准化语法的缺乏。罗马乌尔都语就是一个很好的例子,它被南亚人在社交媒体上广泛使用,具有高度变异性,且缺乏上下文一致的拼写。本文的目标是对大语言模型(LLMs)在罗马乌尔都文字中进行仇恨言论检测(HSD)的全面评估,并使用称为低秩适应(LoRA)的参数高效微调(PEFT)方法对这些模型进行微调。为了评估零样本推理,我们在不同的Transformer模型上对其进行了基准测试,包括Mistral、LLaMA、Falcon和多语言BERT。实验在PURUTT(用于毒性评论和音译的并行乌尔都语和罗马乌尔都语语料库)数据集上进行,该数据集包含超过72,000条标注评论。结果表明,零样本模型的表现中等(F1 = 0.56),但更新一小部分模型可训练参数可以显著提高分类性能(F1 > 0.93)。我们的结果显示,PEFT在提供卓越性能的同时,还具有出色的计算效率,使其非常适合低资源语言处理任务。
查看原文
查看缓存全文

缓存时间: 2026/08/20 10:00

# 面向低资源语言仇恨言论检测的大语言模型高效适配研究:罗马乌尔都语对比分析  
来源:https://arxiv.org/abs/2608.18142  
查看PDF(https://arxiv.org/pdf/2608.18142)

> 摘要:低资源语言(LRLs)的仇恨言论检测面临多重挑战,包括标注数据缺失、语言结构非标准化以及语法体系不完善。罗马乌尔都语作为典型代表,在南亚社交媒体中广泛使用,其拼写变体繁多且缺乏语境一致性,更凸显了该任务的复杂性。本文旨在全面评估大语言模型(LLMs)在罗马乌尔都语仇恨言论检测(HSD)中的应用效能,并采用参数高效微调(PEFT)技术中的低秩适应(LoRA)方法对模型进行优化。研究通过零样本推理与多种Transformer模型(包括Mistral、LLaMA、Falcon及多语言BERT)的PEFT方法进行对比评估,实验基于包含超7.2万条标注评论的PURUTT数据集(平行乌尔都语与罗马乌尔都语毒性评论及音译语料库)。结果表明,零样本模型表现中等(F1值=0.56),而通过微调少量模型可训练参数可使分类性能显著提升(F1值>0.93)。研究证实,PEFT技术在保持卓越计算效率的同时实现了优异性能,为低资源语言处理任务提供了高效解决方案。

## 投稿历史记录  
来源:Toneema Zubair \[查看邮箱(https://arxiv.org/show-email/f0678e4b/2608.18142)\] **\[v1\]** 2026年8月6日(周四)11:28:19 UTC(1,417 KB)

相似文章

大语言模型在低资源语言人文学科研究中的机遇与挑战

arXiv cs.CL

本文系统评估了大语言模型在低资源语言研究中的应用,分析了在语言变异、历史文献、文化表达和文学分析等方面的机遇与挑战。研究强调了跨学科合作和定制化模型开发,以保护语言和文化遗产,同时解决数据可获取性、模型适应性和文化敏感性问题。

UrduMMLU:乌尔都语理解的大规模多任务基准测试

arXiv cs.CL

UrduMMLU是一个新基准测试,包含来自本土教育材料的26,431道多项选择题,涵盖26个学科,用于评估大语言模型在乌尔都语理解上的表现。对30个大语言模型的评估显示,Gemini-3.5-Flash表现最佳,而开源模型和区域特定学科仍构成重大挑战。