表面礼貌,实际错误:用于修复多语言孟加拉语生成中敬语失误的精选数据集
摘要
本文介绍BLADE,一个文化对齐的指令微调数据集,包含4,196个交互对,用于修复多语言孟加拉语生成中的敬语失误和语用差距。在此数据集上微调DeepSeek-8B和LLaMA-3.2-3B等模型,在结构保真度和敬语对齐方面取得了显著改进。
arXiv:2605.22487v1 公告类型:新
摘要:多语言大语言模型(MLLMs)的最新进展显著提升了跨语言对话能力,但在模拟文化细腻且依赖上下文的交流方面仍存在关键瓶颈。具体而言,现有最先进的模型在处理孟加拉语等低资源场景中的结构变体、区域习语和敬语一致性时,表现出严重的语用差距。为弥补这一局限,我们引入了一个新颖的、文化对齐的指令微调数据集——\textbf{BangLa Application and DialoguE generation - BLADE},以及包含4,196个精心策划的交互对的基准框架。我们利用这一资源,通过4位NormalFloat(NF4)量化框架中的LoRA适配器进行参数高效微调,系统性地微调和评估了领先的开源架构,包括DeepSeek-8B和LLaMA-3.2-3B。我们的实证评估表明,在我们的数据集上微调的模型在结构保真度和敬语对齐方面取得了显著改进,为弥合低资源多语言文本生成中的语用差异提供了严格的基准。代码和数据集:https://github.com/ashuvo25/Bangla_Application_LLM/tree/main
查看缓存全文
缓存时间: 2026/05/22 08:48
# 表面礼貌,实际错误:面向孟加拉语多语言生成中敬语失败的精选数据集
来源:https://arxiv.org/html/2605.22487
Md. Asaduzzaman Shuvo, Mahedi Hasan, Md. Tashin Parvez, Azizul Haque Noman, Md. Shafayet Hossain Ovi,孟加拉国国际大学
邮箱:\{ashuvo221104,mhasan221119\}@bscse.uiu.ac.bd; \{tashinparvez2002,azizulhaquenoman,shafayethossain5463\}@gmail.com
###### 摘要
近期多语言大语言模型(MLLMs)的进展显著提升了跨语言对话能力,但对文化细微差异和上下文相关通信的建模仍是关键瓶颈。具体而言,现有最先进模型在处理孟加拉语等低资源场景中的结构变体、区域习语和敬语一致性时,存在严重的语用鸿沟。为弥补这一不足,我们提出一个新颖的、文化对齐的指令微调数据集——BLADE(孟加拉语应用与对话生成)及基准框架,包含4,196个精心策划的交互对。我们利用该资源系统地对领先的开源架构(包括DeepSeek-8B和LLaMA-3.2-3B)进行微调和评估,采用基于LoRA适配器的参数高效微调,并结合4-bit NormalFloat (NF4)量化框架。我们的实证评估表明,在该数据集上微调的模型在结构保真度和敬语对齐方面取得了显著提升,为弥合低资源多语言文本生成中的语用差异提供了严格的基准。
代码和数据集:https://github.com/ashuvo25/Bangla_Application_LLM/tree/main
\[ BoldFont = TeXGyreTermesX-Bold.otf, ItalicFont = TeXGyreTermesX-Italic.otf, BoldItalicFont = TeXGyreTermesX-BoldItalic.otf \]
# 表面礼貌,实际错误:面向孟加拉语多语言生成中敬语失败的精选数据集
Md. Asaduzzaman Shuvo, Mahedi Hasan, Md. Tashin Parvez, Azizul Haque Noman, Md. Shafayet Hossain Ovi,孟加拉国国际大学
邮箱:\{ashuvo221104,mhasan221119\}@bscse.uiu.ac.bd; \{tashinparvez2002,azizulhaquenoman,shafayethossain5463\}@gmail.com;
## 1 引言
大语言模型(LLMs)已从根本上改变了多语言文本生成(Achiam et al., 2023 (https://arxiv.org/html/2605.22487#bib.bib18); Touvron et al., 2023 (https://arxiv.org/html/2605.22487#bib.bib19)),但对于低资源语言而言,这种进步仍然停留在表面。多语言诅咒(multilingual curse)并非表现为词汇缺口,而是更深的语用鸿沟(pragmatic gap):表面流畅性与实际功能性之间的差距。我们的发现不仅限于孟加拉语——通用多语言预训练未能内化注册感知(register-aware)、格式敏感的规范,这是一个结构性局限,影响任何其制度性写作以语法方式编码社会关系的语言。
孟加拉语作为全球第五大语言,拥有超过2.3亿母语者,使这一失败具体化。当前多语言模型生成的孟加拉语文本在表面指标上看似流畅,但同时在所有实用测试中失败:文档结构错位、敬语注册不一致、文化不匹配的话语标记,导致输出在制度层面不可接受(Mukherjee et al., 2025 (https://arxiv.org/html/2605.22487#bib.bib21); Snigdha and Rahman, 2022 (https://arxiv.org/html/2605.22487#bib.bib22))。
**零样本(有缺陷)** | **BLADE-SFT(正确)**
---|---
মহোদয়, আমি আপনার বিদ্যালয়ের একজন ছাত্র। তুমি কি আমাকে তিন দিনের ছুটি দিতে পারবে? আপনার কাছে বিনীত আবেদন করছি।
(英文:“先生,我是学生…你可以【非正式】给我假吗?我向您【正式】请求。”) | মহোদয়, সম্মানপূর্বক বিনীত নিবেদন এই যে, আমি আপনার বিদ্যালয়ের নবম শ্রেণীর একজন নিয়মিত ছাত্র। আগামী তিন দিনের জন্য আপনার নিকট অগ্রিম ছুটির আবেদন করছি।
(英文:“先生…谨此向您【一致正式】申请三天提前假。”)
表1:零样本基线与DeepSeek-8B BLADE-SFT模型生成文本的对比。零样本基线未能维持社交语境,在专业场景中混用非正式(Tumi)和正式(Apnar)代词,而微调模型则一致使用了学生向校长申请所需的正确正式敬语。
根本原因并非词汇覆盖不足,而是缺乏注册感知监督。孟加拉语通过双层敬语系统将社会关系直接编码进语法中。正式第二人称代词আপনি(Apni: 您)及其相关动词形式在专业、制度和面向长辈的写作中是强制性的。非正式对应词তুমি(Tumi: 你)则保留给同辈、密友和下级。在同一文档中混用这些注册不仅是风格上的尴尬,更标志着社交能力的基本崩溃,使文档在任何正式场合中都无法使用(Snigdha and Rahman, 2022 (https://arxiv.org/html/2605.22487#bib.bib22))。
表1 (https://arxiv.org/html/2605.22487#S1.T1) 具体说明了这一失败。零样本基线模型在收到“给你的校长写一封正式的请假申请”的提示后,产生的输出在同一段落中摇摆于Apni:您和Tumi:你之间——这是任何母语者不会犯、任何机构也不会接受的错误。除了敬语不匹配,零样本模型还表现出反复的结构性失败:遗漏必需的文件组件(日期、主题行、正式称呼)、错误放置结尾语、在正式写作中使用适合口语的话语标记。这些并非边缘案例——我们的实证评估表明,它们在所有测试架构中系统性出现。即使是最强的零样本基线Gemini-2.5-Flash,BLEU得分也仅为7.88,证实了通用预训练未能内化母语者所需的格式敏感和注册感知规范。
为应对这些局限,我们提出BLADE(孟加拉语应用与对话生成),这是一个具有双重作用的专项资源:(i)一个包含4,196个高质量、专家标注的提示-响应对的指令微调数据集,涵盖2,008个独特主题;(ii)一个评估模型遵守孟加拉语结构和文化规范的严格基准。BLADE通过原则性的三级采集流程构建:政府批准的教科书提供典范格式的黄金标准;经过验证的网页门户提供真实世界的使用多样性;作者合成并由母语语言专家交叉验证的示例,则解决了静态来源中代表性不足的复杂敬语对齐场景。
我们的贡献如下:
- •我们提出BLADE,一个公开可用的指令微调数据集,包含4,196个专家标注的提示-响应对,涵盖2,008个独特主题,通过三级流程并经过母语语言专家验证,覆盖孟加拉语的教育、专业和对话生成任务。
- •我们在零样本条件下对五种最先进的多语言LLM进行了语用差距基准测试,系统性地记录了所有测试架构中的语用注册失败和文档结构违规。
- •我们证明了在BLADE上进行针对性SFT在自动指标(BLEU 17.73;chrF 46+)、人类专家评估(所有维度>4.6/5)和LLM-as-judge评分(8.30/10)上均带来一致提升,确立了对于低资源语用生成而言,文化数据特异性优于模型规模。
## 2 相关工作
##### 多语言LLM与低资源差距。
LLM的进步由网络规模语料库和指令数据集(如Common Crawl、Alpaca、Dolly)驱动,多语言覆盖范围则通过HPLT等扩展(de Gibert et al., 2024 (https://arxiv.org/html/2605.22487#bib.bib1))。尽管有这些增益,高资源和低资源语言之间仍存在25–35%的指令遵循准确率差距(Zeng et al., 2025 (https://arxiv.org/html/2605.22487#bib.bib27)),并且在零样本设置下,LLM在极低资源语言上始终未能超过经典基线(Cahyawijaya et al., 2024 (https://arxiv.org/html/2605.22487#bib.bib28))。关键的是,机器翻译的指令数据与本地化等效数据相比,系统性低估了模型能力(Bawden and Yvon, 2023 (https://arxiv.org/html/2605.22487#bib.bib31)),这促使我们选择从人工策划、基于机构来源的孟加拉语资源构建BLADE。
##### 敬语系统与语用能力。
更深层的多语言失败涉及语用能力:生成在社交和制度上恰当而不仅仅符合语法的文本。对于将社会关系语法化到形态学中的语言,注册一致性是功能可用性的必要条件。日语LLM无法将敬语模式泛化到新句法结构中(Sekizawa and Yanaka, 2023 (https://arxiv.org/html/2605.22487#bib.bib32)),即使包括GPT-4o在内的前沿模型在高礼貌的爪哇语注册上表现不佳(Farhansyah et al., 2025 (https://arxiv.org/html/2605.22487#bib.bib29))。阿拉伯语评估也揭示了同样的失败:表面流畅并不意味着文化连贯(Attia et al., 2026 (https://arxiv.org/html/2605.22487#bib.bib33))。
表2:BLADE示例条目及英文翻译,展示典范文档结构。
这些发现确立了孟加拉语的敬语不匹配问题(见表1 (https://arxiv.org/html/2605.22487#S1.T1))是一种跨语言共享的结构性失败,而非孟加拉语特有的异常。
##### 孟加拉语NLP资源。
孟加拉语NLP已从编码器模型(如BanglaBERT (Bhattacharjee et al., 2022 (https://arxiv.org/html/2605.22487#bib.bib2)))发展到原生生成模型(包括TigerLLM (Raihan and Zampieri, 2025 (https://arxiv.org/html/2605.22487#bib.bib3))和TituLLMs (Nahin et al., 2025 (https://arxiv.org/html/2605.22487#bib.bib4))),以及任务特定数据集(用于NER (Paul et al., 2026 (https://arxiv.org/html/2605.22487#bib.bib5); Mhaske et al., 2023 (https://arxiv.org/html/2605.22487#bib.bib8))、字幕生成 (Rahman et al., 2019 (https://arxiv.org/html/2605.22487#bib.bib6))和情感分析 (Islam et al., 2021 (https://arxiv.org/html/2605.22487#bib.bib7)))。然而,所有现有资源均针对分类和提取任务;没有为长形式、格式敏感、注册一致的生成提供监督——这正是BLADE所填补的空白。
##### 数据质量重于规模。
我们的核心实证发现(在BLADE上微调的小型模型优于零样本前沿模型)基于一个更广泛的原则:Zhou et al. (2023 (https://arxiv.org/html/2605.22487#bib.bib26)) 表明,1,000个精心策划的示例足以匹配使用大量RLHF训练的模型,从而确立了数据质量在对齐中的重要性优于数量。这已在低资源多语言环境中得到验证,在形态学和结构层面,小规模高质量SFT数据优于大规模自动构建的语料库 (Iyer et al., 2024 (https://arxiv.org/html/2605.22487#bib.bib30))。BLADE为注册敏感、格式受限的孟加拉语生成提供了该原则的具体证据。
## 3 BLADE数据集
### 3.1 数据集概览
BLADE数据集包含4,196个高质量的提示-响应对,专门为结构化孟加拉语生成构建,平均响应长度超过1,300个token。数据集涵盖2,008个独特主题,分为两种主要任务类型:**应用文写作**和**对话生成**,覆盖教育、专业、行政和对话领域(表3.1 (https://arxiv.org/html/2605.22487#S3.SS1))。
| 应用主题 | 对话主题 |
|----------|----------|
| 通用675 | 通用476 |
| 教育类214 | 非正式170 |
| 行政类169 | 正式141 |
| 专业类163 | |
| **总主题数 2,008** | |
表3:各领域独特主题分布。
BLADE基于现有孟加拉语语料库所缺失的三个核心原则设计:(i)**注册意识**——每个示例强制要求问候语、代词、动词形态和结尾语之间的敬语对齐一致;(ii)**结构保真度**——应用文示例严格遵循孟加拉语制度文档的典范顺序(日期→收件人→主题→称呼→正文→结尾→签名);(iii)**主题多样性**——主题代表孟加拉国学生、专业人士和公民在现实世界中遇到的孟加拉语制度写作。一个示例条目见表2 (https://arxiv.org/html/2605.22487#S2.T2)。
### 3.2 主题选择
主题纳入遵循四个标准:(i)**现实世界普遍性**——在孟加拉国教育和专业语境中,通过教科书和网页门户来源频率验证;(ii)**注册敏感性**——敬语错误会使输出在制度上不可用的任务;(iii)**结构复杂性**——多组件文档而非单一段落;(iv)**在现有预训练语料库中代表性不足**。已在通用网络规模数据(如新闻、维基百科)中充分覆盖的主题被明确降级。最终分布包含1,221个应用主题和787个对话主题(表3.1 (https://arxiv.org/html/2605.22487#S3.SS1))。
### 3.3 数据收集
收集采用三级获取策略,每一级由不同的来源和验证协议管控。完整的标注指南、标注者概况、标注者间一致性统计和质量控制标准见附录A (https://arxiv.org/html/2605.22487#A1)。
##### 第一级:制度教科书(1,972个样本)。
从9本经政府批准的NCTB高中及更高中等教育教科书中提取典范应用文结构,建立机构格式的黄金标准。每条条目在纳入前由两名独立标注者验证结构完整性(所有七个必需文档组件按典范顺序呈现)。
##### 第二级:公共网页门户(1,382个样本)。
从14个经过验证的孟加拉语教育网页门户(表9 (https://arxiv.org/html/2605.22487#A2.T9))中策划真实世界示例。每条条目均经过人工验证,检查结构完整性和敬语一致性标准。大约23%的候选网页条目因注册不一致或结构畸形在此过程中被丢弃。
##### 第三级:作者合成示例(842个样本)。
为应对静态来源中代表性不足的复杂场景——尤其是需要持续敬语一致性的多轮对话——作者目的性地构建了842个示例,并由两位外部母语语言专家(专攻孟加拉语语言学)进行交叉验证。每个第三级示例经过两阶段评审:作者-标注者起草,随后由独立专家裁决。
### 3.4 数据预处理
原始条目使用正则表达式清理,保留孟加拉语Unicode(U+0980–U+09FF),重新格式化为第4.2节 (https://arxiv.org/html/2605.22487#S4.SS2) 描述的指令微调模板,并分割为80%训练集(3,356个示例)、10%验证集(418个示例)和10%测试集(422个示例)。相似文章
当名字不是名字:低资源大语言模型中文化纠缠的孟加拉语同形词的基准数据集与蒸馏推理
本文介绍了一个包含1,516条经专家验证的孟加拉语句子的基准数据集,用于消解文化纠缠的同形词(既是名字又是普通名词的词语)。研究表明,大语言模型存在主导意义偏见,并提出了对比思维链提示和蒸馏方法来减少这种偏见。
当英语改写本地知识:大语言模型中的全球叙事主导
本文介绍了CulturalNB(一个孟加拉文化问答对数据集),并评估了九种大语言模型的跨语言文化偏见。研究结果表明,英文提示会增加全球叙事替代并减少本地视角,揭示了大语言模型中的文化失败是立足点和优先级问题,而不仅仅是知识缺失。
TRACE-BN: 将孟加拉语-英语辅导行为迁移到低于10亿参数的离线语言模型
TRACE-BN 介绍了一个课程引导的数据集,用于结构化的孟加拉语-英语辅导,并展示了如何使用 LoRA 将此行为迁移到低于10亿参数的语言模型中,在资源受限的离线环境中显著提高了辅导质量。
形式对齐而非语义对齐:低资源孟加拉语贬损言语中LLM安全性的理解-遏制解耦
这篇arXiv论文对五种前沿LLM在原生孟加拉语贬损言语上的表现进行了审计,发现安全对齐未能泛化到低资源语言——尽管有高资源对齐,模型仍以高比率理解和生成不安全内容。作者提出了“理解-遏制解耦”概念,并表明推理和人格框架会进一步瓦解安全过滤器。
BenSyc:孟加拉语境下LLM对话谄媚与人类对齐的基准评估
研究人员推出了BenSyc,这是首个在孟加拉社会语境中评估对话谄媚的基准,发现大语言模型难以区分共情支持与验证及升级行为,仅达到约61%的Macro-F1。