5-Dialects-BN:揭示转写对孟加拉方言大语言模型的影响

arXiv cs.CL 论文

摘要

本文介绍了5-Dialects-BN,一个针对五种孟加拉方言的手动标注基准数据集,包含对齐的转写和翻译,旨在提升方言感知大语言模型的评估。

arXiv:2609.09964v1 公告类型:新 摘要:大语言模型(LLMs)在自然语言处理(NLP)任务中取得了显著进展,但对于低资源语言和方言多样化的环境,其性能急剧下降。孟加拉语作为世界第六大使用语言,体现了这一差距:现有资源绝大多数针对标准孟加拉语,导致其地区方言缺乏开发或评估方言感知系统所需的基准。我们通过5-Dialects-BN解决了这一差距,这是第一个多标注的孟加拉方言基准,将罗马化转写与方言文本、标准孟加拉语、英语和主观性标签对齐,涵盖五种地区变体。数据集包含6,000个手动标注的条目,跨越五种主要方言:吉大港、巴里萨尔、诺阿卡利、锡尔赫特和朗布尔(吉大港1,900;诺阿卡利1,500;锡尔赫特1,200;巴里萨尔700;朗布尔700),反映了自然的在线可用性。每个条目都有五个对齐的标注:原始方言文本、罗马化转写、英语翻译、标准孟加拉语翻译和主观性标签(主观 vs. 客观)。标注由母语者和本科生语言学学生制作并交叉验证,以确保方言真实性和语义保真度。由此产生的资源支持多种任务,包括方言识别、方言到标准归一化、机器翻译、主观性分类和多语言大语言模型的参数高效微调(例如LoRA)。通过提供标准化、多标注的基准,5-Dialects-BN实现了对大语言模型在方言多样孟加拉语上的原则性评估,并为低资源、方言感知自然语言处理的进一步研究奠定了基础。
查看原文
查看缓存全文

缓存时间: 2026/09/10 08:17

# 5-Dialects-BN:揭示音译对孟加拉方言大语言模型的影响  
来源:https://arxiv.org/html/2609.09964  

**作者与单位**  
- Galib Mahmud|Penta Global Limited  
- Rafid Ahmed|University of Central Florida  
- Mir Sazzat Hossain|Penta Global Limited;Centre for Computational & Data Sciences, Independent University, Bangladesh  
- Md Fahim|Penta Global Large  
- Md Farhad Alam Bhuiyan|Penta Global Limited  

---

### 摘要  
大语言模型(LLMs)在自然语言处理(NLP)任务中取得了显著进展,但在低资源语言和多方言场景下性能急剧下降。孟加拉语作为全球第六大使用语言,凸显了这一差距:现有资源大多针对标准孟加拉语,缺乏开发或评估方言感知系统所需的基准测试。本文提出 **5-Dialects-BN**,首个将罗马音译文本与方言文本、标准孟加拉语、英语及主观性标签对齐的多标注孟加拉方言基准数据集。该数据集包含6,000条人工标注条目,涵盖五大主要方言:吉大港、巴里萨尔、诺阿卡利、锡尔赫特和朗布尔(吉大港1,900条;诺阿卡利1,500条;锡尔赫特1,200条;巴里萨尔700条;朗布尔700条),反映自然在线可用性。每条数据均包含五个对齐标注:原始方言文本、罗马音译、英语翻译、标准孟加拉语翻译及主观性标签(主观/客观)。标注由母语者和语言学本科生共同生成并交叉验证,确保方言真实性与语义保真度。该资源支持方言识别、方言到标准语的规范化、机器翻译、主观性分类及多语言LLMs的参数高效微调(如LoRA)等任务。通过提供标准化多标注基准,**5-Dialects-BN** 实现了对多方言孟加拉语LLMs的系统性评估,为低资源方言感知NLP研究奠定基础。

---

## 1 引言  
大语言模型推动了自然语言处理的快速发展,但这一进展在全球语言中分布不均:低资源和多方言语言社区在训练语料库和评估基准方面仍严重不足。孟加拉语作为2.7亿人口使用的语言,凸显了这一缺口。尽管标准孟加拉语在多项NLP任务中受到关注,但其区域方言(在音系、词汇、形态和句法上与标准语差异显著)仍极度缺乏资源。多标注基准的缺失使得模型错误诊断和方言感知系统的可复现评估变得困难。为应对此挑战,我们引入 **5-Dialects-BN**,一个手工整理验证的基准数据集,包含来自吉大港、巴里萨尔、诺阿卡利、锡尔赫特和朗布尔五大孟加拉方言的6,000条语句。每条数据提供五个对齐字段:原生方言文本、罗马音译、标准孟加拉语翻译、英语翻译及二元主观性标签。我们评估了七个现代LLMs在三项核心任务中的表现:  
(i) 方言到英语的机器翻译,  
(ii) 二元主观性分类,  
(iii) 方言到标准孟加拉语的规范化。  

评估涵盖四种场景:零样本、少样本、思维链(CoT)提示,以及基于开源LLMs的LoRA参数高效微调。评估得出两个主要发现:  
1. **监督弥补资源鸿沟**:使用LoRA在每类方言仅160个样本上微调开源模型,在翻译和主观性分类任务上超越所有闭源模型的零样本/少样本基线(如Mistral-7B达73.6 BLEU,而Gemini 3 Flash零样本仅46.4)。  
2. **音译损害当前LLMs性能**:与早期多语言小模型的研究结果相反,罗马音译输入在所有模型和场景下均持续显著降低当前LLMs性能,原因在于多对一音位信息丢失和子词分词碎片化。  

> **图1**:**5-Dialects-BN** 五大区域方言代表性条目。每条数据包含原生孟加拉文方言文本、罗马音译、音译规范化、二元主观性标签及英语翻译。示例覆盖两类主观性,展示各方言与标准孟加拉语在词汇和音系上的差异。  

### 为何音译是核心字段?  
南亚在线用户主要通过拉丁字母(Banglish)在YouTube、Facebook、Reddit等平台输入孟加拉方言文本。因此,评估模型对罗马音译文本的处理能力对实际部署至关重要。通过将罗马音译作为与原生文字对齐的一阶因子变量,**5-Dialects-BN** 首次实现了对音译惩罚效应的因果分解(见第5节),揭示正字法模糊性如何破坏底层方言区分。  

### 主要贡献:  
- 发布 **5-Dialects-BN**,首个整合罗马音译、方言文本、标准孟加拉语、英语及主观性标签的多标注孟加拉方言基准(6,000条验证条目)。  
- 建立标注者间一致性:主观性标注 Cohen's κ=0.78,标准孟加拉语译文 κ=0.74,英语翻译 ROUGE-L 达0.84。  
- 在三种任务下,对七种LLMs在原生/罗马输入场景的零样本、少样本、CoT提示及LoRA微调进行全面基准测试,提供脚本效应、提示失效模式(示范干扰与格式崩溃)及语言差异的实证因果分析。  

---

## 2 相关工作  

### 孟加拉方言资源  
近年已有针对区域孟加拉方言的并行标注资源发布,包括Vashantor、ONUBAD、Chatgaiyya和ANCHOLIK-NER,覆盖吉大港、锡尔赫特和巴里萨尔的部分方言。与本文最接近的是DIALTSA-BN,其包含600条跨四种方言、带标准孟加拉语翻译和情感标签的语句。**5-Dialects-BN** 在多维度推动该领域进展:(i) 语料量扩大十倍至6,000条;(ii) 新增西北部朗布尔方言;(iii) 每条数据提供五个完全对齐字段;(iv) 在提示与LoRA微调中因子化评估脚本效应;(v) 进行因果分词器与语言错误分析。  

### 孟加拉机器翻译与方言规范化  
标准孟加拉语机器翻译已通过大规模并行基准(如BanglaNMT、Samanantar)及序列到序列架构(如BanglaT5、IndicBART、IndicTrans2)取得进展。但这些模型几乎仅训练于正式标准孟加拉语,无法泛化到口语化区域方言。本文的方言到标准语规范化基准类似于阿拉伯方言和瑞士德语的区域到标准语映射任务。  

### 音译与脚本效应研究  
BanglaTLit研究逆音译并表明音译适应编码器可提升噪声社交媒体文本分类性能,BanTH探索罗马化孟加拉语仇恨言论检测。有研究指出微调Transformer在音译孟加拉语、印地语和阿拉伯语上仅略优于传统TF-IDF基线。早期多语言模型从音译中获益的发现,与本文在现代LLMs上发现的相反趋势形成对比,后者在第5节系统分解。  

### 情感文本与评估目标  
SentNoB证实标准孟加拉语情感模型在噪声用户生成内容上性能严重下降。**5-Dialects-BN** 评估方言到英语翻译以利用英语作为正字法稳定的评分目标,并使用字符级(chrF++)和神经(COMET)指标评估方言到标准孟加拉语规范化,避免表面正字法偏差。  

---

## 3 5-Dialects-BN数据集  
本数据集通过四阶段流程构建:(i) 公共在线资源数据采集,(ii) 母语者真实性与边界验证,(iii) 受训语言学标注员的工具辅助多标注,(iv) 标注者间一致性验证。  

### 数据采集与方言边界验证  
方言语句采集自公共在线平台:区域媒体YouTube评论线程、区域Facebook社群、Reddit讨论及区域新闻报道。为确保清晰的方言边界与单标签完整性,候选语句经各目标方言母语者依据指南G1筛选:仅当包含≥1个方言诊断特征(词汇、形态或音系)时接受;模糊项或区域连续统边界案例(如吉大港-诺阿卡利过渡区)提交专家组裁定。母语验证平均拒绝34%采集候选。高度语码混用项被过滤,自然词汇借用则保留(11-5%语句含≥1个孟加拉文英语借词)。  

### 标注工具与质量控制  
生产标注通过定制网页工具进行,由15名语言学本科生标注员(每方言3名母语/熟练者)执行。标注员通过集成Avro输入编辑器输入或验证原生文字,校验标准孟加拉语翻译,编辑或批准英语翻译草案,并分配二元主观性标签。为减轻疲劳,英语翻译草案由Gemini模型基于人工验证的标准孟加拉语生成,标注员主动修改了41%的模型草案(朗布尔31%至锡尔赫特52%)。独立对照样本(100条无AI草案的翻译)证实预填充未引入风格锚定偏差。  

### 数据集构成与统计  
每条数据包含五个对齐字段:(1) 原生孟加拉文方言文本,(2) 罗马音译,(3) 标准孟加拉语翻译,(4) 英语翻译,(5) 二元主观性标签。数据集含6,000条验证条目,覆盖吉大港(1,900)、诺阿卡利(1,500)、锡尔赫特(1,200)、巴里萨尔(700)和朗布尔(700),自然反映在线可用性。  

| 统计量       | 数值(词元) |
|--------------|--------------|
| 最小长度     | 3            |
| 最大长度     | 40           |
| 平均长度     | 11.2         |
| 中位长度     | 9            |
> **表1**:语句长度统计,反映源材料的对话语域。  

### 主观性定义  
采用二元主观性分类(主观/客观)而非细粒度情感极性或情绪,因主观性边界在不同方言中高度一致(κ=0.78),而情感极性受方言特异性情感词汇化影响显著。  

### 标注者间一致性  
为验证数据集可靠性,分层抽样1,500条(每方言300条)由第二方言专家独立标注,分歧由第三高级语言学家裁定。分类一致性:主观性 Cohen's κ=0.78,标准孟加拉语译文接受度 κ=0.74,英语翻译批准度 κ=0.71。自由形式英语翻译的...

相似文章

孟加拉地区方言的多方言神经机器翻译系统

arXiv cs.CL

本文提出了一个统一的用于12种孟加拉地区方言的多方言神经机器翻译系统,引入了迄今最大的多方言平行语料库,并通过使用DoRA微调的BanglaT5模型取得了最先进的BLEU分数。

当英语改写本地知识:大语言模型中的全球叙事主导

arXiv cs.CL

本文介绍了CulturalNB(一个孟加拉文化问答对数据集),并评估了九种大语言模型的跨语言文化偏见。研究结果表明,英文提示会增加全球叙事替代并减少本地视角,揭示了大语言模型中的文化失败是立足点和优先级问题,而不仅仅是知识缺失。