针对资源匮乏语言仇恨言论检测的LLM高效适应:罗马乌尔都语的比较研究
摘要
本文评估了大语言模型在罗马乌尔都语(一种资源匮乏语言)中的仇恨言论检测能力,证明使用LoRA的参数高效微调相比零样本推理显著提升了分类性能。
arXiv:2608.18142v1 公告类型:新
摘要:在资源匮乏语言(LRLs)中检测仇恨言论具有挑战性,原因包括标注数据的缺失、语言结构的非正式性以及标准化语法的缺乏。罗马乌尔都语就是一个很好的例子,它被南亚人在社交媒体上广泛使用,具有高度变异性,且缺乏上下文一致的拼写。本文的目标是对大语言模型(LLMs)在罗马乌尔都文字中进行仇恨言论检测(HSD)的全面评估,并使用称为低秩适应(LoRA)的参数高效微调(PEFT)方法对这些模型进行微调。为了评估零样本推理,我们在不同的Transformer模型上对其进行了基准测试,包括Mistral、LLaMA、Falcon和多语言BERT。实验在PURUTT(用于毒性评论和音译的并行乌尔都语和罗马乌尔都语语料库)数据集上进行,该数据集包含超过72,000条标注评论。结果表明,零样本模型的表现中等(F1 = 0.56),但更新一小部分模型可训练参数可以显著提高分类性能(F1 > 0.93)。我们的结果显示,PEFT在提供卓越性能的同时,还具有出色的计算效率,使其非常适合低资源语言处理任务。
查看缓存全文
缓存时间: 2026/08/20 10:00
# 面向低资源语言仇恨言论检测的大语言模型高效适配研究:罗马乌尔都语对比分析 来源:https://arxiv.org/abs/2608.18142 查看PDF(https://arxiv.org/pdf/2608.18142) > 摘要:低资源语言(LRLs)的仇恨言论检测面临多重挑战,包括标注数据缺失、语言结构非标准化以及语法体系不完善。罗马乌尔都语作为典型代表,在南亚社交媒体中广泛使用,其拼写变体繁多且缺乏语境一致性,更凸显了该任务的复杂性。本文旨在全面评估大语言模型(LLMs)在罗马乌尔都语仇恨言论检测(HSD)中的应用效能,并采用参数高效微调(PEFT)技术中的低秩适应(LoRA)方法对模型进行优化。研究通过零样本推理与多种Transformer模型(包括Mistral、LLaMA、Falcon及多语言BERT)的PEFT方法进行对比评估,实验基于包含超7.2万条标注评论的PURUTT数据集(平行乌尔都语与罗马乌尔都语毒性评论及音译语料库)。结果表明,零样本模型表现中等(F1值=0.56),而通过微调少量模型可训练参数可使分类性能显著提升(F1值>0.93)。研究证实,PEFT技术在保持卓越计算效率的同时实现了优异性能,为低资源语言处理任务提供了高效解决方案。 ## 投稿历史记录 来源:Toneema Zubair \[查看邮箱(https://arxiv.org/show-email/f0678e4b/2608.18142)\] **\[v1\]** 2026年8月6日(周四)11:28:19 UTC(1,417 KB)
相似文章
实际环境中的多语言多模态大语言模型:面向低资源语言的构建
本教程论文概述了如何为低资源语言构建多语言多模态大语言模型,涵盖数据创建、模型对齐、微调和评估,重点提供实用方案和动手资源。
大语言模型在低资源语言人文学科研究中的机遇与挑战
本文系统评估了大语言模型在低资源语言研究中的应用,分析了在语言变异、历史文献、文化表达和文学分析等方面的机遇与挑战。研究强调了跨学科合作和定制化模型开发,以保护语言和文化遗产,同时解决数据可获取性、模型适应性和文化敏感性问题。
通过注意力头重加权实现大语言模型的数据高效适配
介绍了一种数据高效方法——注意力头重加权(AHR),通过为每个注意力头学习单个标量来适配大语言模型至文本分类任务,大幅减少可训练参数,同时在有限数据场景下优于LoRA。
UrduMMLU:乌尔都语理解的大规模多任务基准测试
UrduMMLU是一个新基准测试,包含来自本土教育材料的26,431道多项选择题,涵盖26个学科,用于评估大语言模型在乌尔都语理解上的表现。对30个大语言模型的评估显示,Gemini-3.5-Flash表现最佳,而开源模型和区域特定学科仍构成重大挑战。
@jbhuang0604: LoRA, low-rank adaptation, is arguably the most popular parameter-efficient fine-tuning method for LLMs. But how does i…
LoRA(低秩适配)是LLM最流行的参数高效微调方法,视频介绍了LoRA及其变体(LoRA+、QLoRA、VeRA、DoRA)的工作原理。