罗马乌尔都语中仇恨言论分类的比较研究:参数高效微调与提示工程

arXiv cs.AI 论文

摘要

本文介绍了针对罗马乌尔都语仇恨言论分类的参数高效微调与提示工程技术的比较研究。

arXiv:2608.21408v1 公告类型:新 摘要:由于互联网和社交媒体的广泛普及,有毒和仇恨内容呈指数级增长,造成了严重的困扰和负面社会影响。罗马乌尔都语是一种在巴基斯坦和全球乌尔都语社区中使用的低资源语言,由于其非正式的语法、不一致的句子结构和多种单词拼写变体,带来了额外的挑战。本研究旨在在数据有限的低资源环境中,确定最有效的仇恨言论分类技术。为此,本研究调查并比较了最新方法,包括使用LoRA的参数高效微调(PEFT)、提示调优和提示工程,在各种实验配置下进行。为了实现这一目标,设计了四个实验。第一个实验涉及使用LLMs进行直接推理,无需任何微调,以评估这些模型在零样本设置下对罗马乌尔都语的理解能力,尤其是在数据有限的情况下。第二个实验使用LoRA进行参数高效微调(PEFT),只更新一小部分参数,从而降低计算成本。第三个实验探索了提示调优,使用混合和手动制作的提示,使用相对于整个数据集非常小的训练示例集,使其在计算上也是高效的。最后,第四个实验通过零样本和少样本学习应用提示工程,仅依赖精心设计的指令提示进行分类,无需进一步训练。
查看原文
查看缓存全文

缓存时间: 2026/08/25 04:14

# 罗马乌尔都语中的仇恨言论分类:参数高效微调与提示工程的比较研究
来源:https://arxiv.org/abs/2608.21408
文献工具

## 文献与引用工具

文献探索器切换

代码、数据、媒体

## 与本文关联的代码、数据和媒体

演示

## 演示

相关论文

## 推荐与搜索工具

关于arXivLabs

## arXivLabs:与社区协作者共同推进的实验项目

arXivLabs是一个框架,允许协作者直接在我们网站上开发和分享新的arXiv功能。

所有与arXivLabs合作的个人和组织都认同并接纳我们关于开放性、社区、卓越和用户数据隐私的价值观。arXiv致力于践行这些价值观,并仅与遵循这些价值观的合作伙伴开展协作。

有一个能为arXiv社区创造价值的项目构思?**了解更多关于arXivLabs的信息** (https://info.arxiv.org/labs/index.html)。

相似文章

UrduMMLU:乌尔都语理解的大规模多任务基准测试

arXiv cs.CL

UrduMMLU是一个新基准测试,包含来自本土教育材料的26,431道多项选择题,涵盖26个学科,用于评估大语言模型在乌尔都语理解上的表现。对30个大语言模型的评估显示,Gemini-3.5-Flash表现最佳,而开源模型和区域特定学科仍构成重大挑战。