罗马乌尔都语中仇恨言论分类的比较研究:参数高效微调与提示工程
摘要
本文介绍了针对罗马乌尔都语仇恨言论分类的参数高效微调与提示工程技术的比较研究。
arXiv:2608.21408v1 公告类型:新
摘要:由于互联网和社交媒体的广泛普及,有毒和仇恨内容呈指数级增长,造成了严重的困扰和负面社会影响。罗马乌尔都语是一种在巴基斯坦和全球乌尔都语社区中使用的低资源语言,由于其非正式的语法、不一致的句子结构和多种单词拼写变体,带来了额外的挑战。本研究旨在在数据有限的低资源环境中,确定最有效的仇恨言论分类技术。为此,本研究调查并比较了最新方法,包括使用LoRA的参数高效微调(PEFT)、提示调优和提示工程,在各种实验配置下进行。为了实现这一目标,设计了四个实验。第一个实验涉及使用LLMs进行直接推理,无需任何微调,以评估这些模型在零样本设置下对罗马乌尔都语的理解能力,尤其是在数据有限的情况下。第二个实验使用LoRA进行参数高效微调(PEFT),只更新一小部分参数,从而降低计算成本。第三个实验探索了提示调优,使用混合和手动制作的提示,使用相对于整个数据集非常小的训练示例集,使其在计算上也是高效的。最后,第四个实验通过零样本和少样本学习应用提示工程,仅依赖精心设计的指令提示进行分类,无需进一步训练。
查看缓存全文
缓存时间: 2026/08/25 04:14
# 罗马乌尔都语中的仇恨言论分类:参数高效微调与提示工程的比较研究 来源:https://arxiv.org/abs/2608.21408 文献工具 ## 文献与引用工具 文献探索器切换 代码、数据、媒体 ## 与本文关联的代码、数据和媒体 演示 ## 演示 相关论文 ## 推荐与搜索工具 关于arXivLabs ## arXivLabs:与社区协作者共同推进的实验项目 arXivLabs是一个框架,允许协作者直接在我们网站上开发和分享新的arXiv功能。 所有与arXivLabs合作的个人和组织都认同并接纳我们关于开放性、社区、卓越和用户数据隐私的价值观。arXiv致力于践行这些价值观,并仅与遵循这些价值观的合作伙伴开展协作。 有一个能为arXiv社区创造价值的项目构思?**了解更多关于arXivLabs的信息** (https://info.arxiv.org/labs/index.html)。
相似文章
针对资源匮乏语言仇恨言论检测的LLM高效适应:罗马乌尔都语的比较研究
本文评估了大语言模型在罗马乌尔都语(一种资源匮乏语言)中的仇恨言论检测能力,证明使用LoRA的参数高效微调相比零样本推理显著提升了分类性能。
土耳其语和阿拉伯语中的仇恨言论检测:一项综合研究
介绍了针对土耳其语和阿拉伯语的全面仇恨言论数据集,并开发了基于BERT的最先进模型,用于仇恨言论分析,包括分类、强度预测、目标识别和跨度检测。
多语言仇恨言论检测的训练时可解释性:对齐模型推理与人类理据
本文提出了一种用于多语言仇恨言论检测的训练时可解释性框架,通过将模型推理与人类理据对齐,以提高分类性能和可解释性,并在英语和Hinglish数据集上进行了评估。
从专业化到通用化:指令微调大语言模型用于健壮有害内容缓解
本文研究了通过指令微调通用大语言模型来实现健壮的有害内容缓解,特别是仇恨言论检测,使用了一个包含36个数据集的统一语料库,取得了最先进的性能,并增强了跨领域和跨语言的泛化能力。
UrduMMLU:乌尔都语理解的大规模多任务基准测试
UrduMMLU是一个新基准测试,包含来自本土教育材料的26,431道多项选择题,涵盖26个学科,用于评估大语言模型在乌尔都语理解上的表现。对30个大语言模型的评估显示,Gemini-3.5-Flash表现最佳,而开源模型和区域特定学科仍构成重大挑战。