TRACE-BN: 将孟加拉语-英语辅导行为迁移到低于10亿参数的离线语言模型
摘要
TRACE-BN 介绍了一个课程引导的数据集,用于结构化的孟加拉语-英语辅导,并展示了如何使用 LoRA 将此行为迁移到低于10亿参数的语言模型中,在资源受限的离线环境中显著提高了辅导质量。
arXiv:2608.15223v1 公告类型:新
摘要:孟加拉语-英语辅导不仅仅是产生正确的翻译:学习者还需要语法差异的解释、对其可能错误的认识以及针对性的练习。我们提出了 TRACE-BN,这是一个课程引导的数据集,包含结构化的辅导轨迹,针对 CEFR A1-A2 水平的孟加拉语母语英语学习者。每个轨迹结合了词汇级别的注释、字面和自然翻译、孟加拉语语法解释、可能的学习者错误以及带有答案的针对性练习问题。这些轨迹由 Gemini 3.5 Flash Lite 作为教师模型从 NCTB 9-10 年级英语课程单元生成,然后经过结构有效性、脚本完整性和语义重复过滤。我们使用 LoRA 和 4 位量化将生成的结构化辅导行为迁移到 Qwen3-0.6B 中,用于资源受限的离线部署。在保留输入上,schema 有效性从 85.4% 提高到 95.8%,而与教师模型参考相比,chrF++ 从 15.28 提高到 34.77,BLEU 从 4.52 提高到 21.03。两名独立法官的字段级评估显示在翻译、语法解释、学习者错误诊断和练习对齐方面均有改进,而人工审计支持监督数据的质量。结果表明,在资源受限的情况下,课程引导的结构化监督可以将多组件辅导行为迁移到低于 10 亿参数的模型中。数据集、模型检查点和代码可在 https://huggingface.co/datasets/RaiyanKhaan/Trace-BN 公开获取。
查看缓存全文
缓存时间: 2026/08/18 10:03
# TRACE-BN:将孟加拉语-英语辅导行为迁移到10亿参数以下的离线语言模型
来源:https://arxiv.org/html/2608.15223
Khan Raiyan Ibne Reza, Sanjana Aktar Maria, Mohammad Tushar Abdullah, Asfee Bhuiyan Leen, and Sumaiya Tabassum Nimi
所属机构:孟加拉国达卡北南大学电气与计算机工程系
邮箱:\{raiyan\.reza, sanjana\.maria, tushar\.abdullah\.232, asfee\.leen\.242, sumaiya\.nimi\}@northsouth\.edu
###### 摘要
孟加拉语-英语辅导不仅需要提供正确的翻译:学习者还需要了解语法差异的解释、意识到可能犯的错误以及进行针对性练习。我们提出了TRACE-BN,这是一个面向孟加拉语学习者的英语辅导结构化追踪数据集,适用于欧洲语言共同参考框架(CEFR)A1-A2级别。每个追踪结合了词汇级别的注释、直译与自然翻译、孟加拉语语法解释、可能的常见学习者错误,以及针对该错误的练习题目和答案。这些追踪由Gemini 3.5 Flash Lite作为教师模型,基于NCTB 9-10年级英语课程单元生成,随后根据结构有效性、文字完整性和语义重复性进行了过滤。我们使用LoRA和4位量化,将生成的结构化辅导行为迁移到Qwen3-0.6B模型上,以适应资源受限的离线部署场景。在保留输入集上,模式有效性从85.4%提升至95.8%;与教师模型参考答案相比,chrF++得分从15.28提升至34.77,BLEU得分从4.52提升至21.03。两名独立评审员的字段级评估显示,在翻译、语法解释、学习者错误诊断和练习匹配度方面均有改善,人工审核也支持了监督数据的质量。结果表明,在上述资源约束条件下,基于课程的结构化监督能够将多组件辅导行为迁移到10亿参数以下的模型中。数据集、模型检查点和代码已在https://huggingface.co/datasets/RaiyanKhaan/Trace-BN公开发布。
###### 索引关键词:
小语言模型、LoRA微调、低资源自然语言处理、孟加拉语-英语辅导、计算机辅助语言学习
## I 引言
一个孟加拉语-英语辅导系统应超越生成目标翻译:它还应解释相关的语法差异、识别学习者的常见错误,并针对相同模式提供练习。大型语言模型能比传统翻译系统更全面地支持这种交互,但现有的孟加拉语专用模型并非围绕结构化辅导交互设计。这种交互需要在单个回复中包含词汇级别注释、直译与自然翻译、孟加拉语语法解释、预测学习者常见错误以及针对性练习。现有的孟加拉语模型如TigerLLM、BanglaLlama和TituLLM提供通用语言能力,而近期的低资源辅导系统则采用规模更大的模型和更广泛的多模态设置[14 (https://arxiv.org/html/2608.15223#bib.bib1),25 (https://arxiv.org/html/2608.15223#bib.bib2),6 (https://arxiv.org/html/2608.15223#bib.bib3),9 (https://arxiv.org/html/2608.15223#bib.bib4),2 (https://arxiv.org/html/2608.15223#bib.bib5)]。
我们通过TRACE-BN解决这个问题,这是一个包含4099个结构化孟加拉语-英语辅导追踪的课程引导数据集。每个追踪包含七个字段:词汇级别注释、直译与自然翻译、孟加拉语语法笔记、常见学习者错误、练习题及其答案。与传统的平行语料库不同,每个TRACE-BN实例编码的是完整的教学序列,而非单一的输入-输出对。面向学习者的脚手架支撑以孟加拉语提供,而目标语言内容则保持英语。该设计借鉴了强调对比解释和结构化练习的第二语言习得研究[4 (https://arxiv.org/html/2608.15223#bib.bib6),20 (https://arxiv.org/html/2608.15223#bib.bib7),3 (https://arxiv.org/html/2608.15223#bib.bib8),7 (https://arxiv.org/html/2608.15223#bib.bib9)]。
接着,我们研究这些追踪是否能将基础辅导行为传授给10亿参数以下的模型。我们使用LoRA对Qwen3-0.6B进行微调,并将其与未调优的基础模型和三个零样本基线进行对比评估。在432个保留样本上,调优后的模型将模式有效性从85.4%提升至95.8%,chrF++得分从15.28提升至34.77,BLEU得分从4.52提升至21.03。两名独立评审员的字段级评估进一步显示,在翻译、语法解释、学习者错误诊断和练习匹配度方面均有持续改善。
我们的贡献包括:
- • TRACE-BN,一个课程引导的双语辅导数据集,包含跨越七个字段的结构化追踪,涵盖翻译、解释、学习者错误建模和练习。
- • 一种结构化辅导任务制定方法,在单个追踪中将翻译与对比语法解释、学习者错误预测和针对性练习相结合,其应用可扩展至本文研究的孟加拉语-英语语言对之外。
- • 一项实证适应研究,表明Qwen3-0.6B能够通过LoRA微调学习生成TRACE-BN结构,并提供了字段级评估和监督数据的人工验证。
## II 相关工作
(图注)图1:TRACE-BN构建与适应流程。基于课程引导的孟加拉语输入用于获取教师生成的辅导追踪,这些追踪经过滤后形成TRACE-BN,并用于通过LoRA适应Qwen3-0.6B。### II-A 孟加拉语自然语言处理与低资源语言辅导
图1 (https://arxiv.org/html/2608.15223#S2.F1)总结了TRACE-BN的构建和适应流程。近期的孟加拉语语言模型,包括TigerLLM、BanglaLlama和TituLLM,针对通用的孟加拉语理解和生成,而KrishokChat则将孟加拉语大语言模型适应到农业咨询这一特定领域[14 (https://arxiv.org/html/2608.15223#bib.bib1),25 (https://arxiv.org/html/2608.15223#bib.bib2),6 (https://arxiv.org/html/2608.15223#bib.bib3),15 (https://arxiv.org/html/2608.15223#bib.bib10)]。这些系统均未将翻译、语法解释、错误预测和练习生成结合在一个辅导交互中。
低资源辅导系统如AfriLangTutor、LEARN、CaptainA和LangLearn支持其他语言的人工智能辅助语言学习,但其规模和范围不同:AfriLangTutor在涵盖十种非洲语言的多轮对话上微调了80亿和120亿参数模型,LEARN通过基于卡通的视觉问答建立口语能力,CaptainA针对发音练习,LangLearn则针对基于抽认卡的词汇训练[2 (https://arxiv.org/html/2608.15223#bib.bib5),19 (https://arxiv.org/html/2608.15223#bib.bib11),11 (https://arxiv.org/html/2608.15223#bib.bib12),26 (https://arxiv.org/html/2608.15223#bib.bib13)]。TRACE-BN则针对一个10亿参数以下的模型,使用一个涵盖翻译、语法解释和错误感知练习的统一模式服务于单一语言对。
另一项可行性研究得出结论:孟加拉语大语言模型是必要的,但该领域仍缺乏构建这些模型所需的高质量预训练和指令微调数据[9 (https://arxiv.org/html/2608.15223#bib.bib4)]。TRACE-BN针对这一缺口的一个下游应用:每个追踪都由教师生成,然后在用于微调之前进行结构有效性、文字完整性和语义重复性的过滤(第III节 (https://arxiv.org/html/2608.15223#S3))。
### II-B 小型模型与结构化生成
KD-LoRA、DistilQwen2.5、LoRA-Gen和PhoneLM各自通过不同的效率策略专门化或部署更小的语言模型[1 (https://arxiv.org/html/2608.15223#bib.bib14),21 (https://arxiv.org/html/2608.15223#bib.bib15),22 (https://arxiv.org/html/2608.15223#bib.bib16),24 (https://arxiv.org/html/2608.15223#bib.bib17)]。TRACE-BN将这一方向应用于针对0.6B目标模型的结构化辅导。
结构化生成引入了另一个可靠性问题:回复可以满足所需模式,却未提供正确或有用的内容。先前的研究已探讨了模式遵循性以及格式约束对语言模型质量的影响[12 (https://arxiv.org/html/2608.15223#bib.bib18),8 (https://arxiv.org/html/2608.15223#bib.bib19),17 (https://arxiv.org/html/2608.15223#bib.bib20),16 (https://arxiv.org/html/2608.15223#bib.bib21),23 (https://arxiv.org/html/2608.15223#bib.bib22)]。因此,我们的评估将结构有效性与翻译质量和教学效果分开衡量。
## III TRACE-BN 数据集构建
(图注)图2:TRACE-BN辅导追踪示例。一个孟加拉语学习者输入被映射为词汇级别注释、直译与自然英语翻译、孟加拉语对比解释、一个常见的学习者错误以及一个附有答案的简短练习。TRACE-BN基于NCTB(国家课程与教科书委员会)为9-10年级制定的英语课程。我们手动选择并审查了课程单元、主题和语法覆盖范围,以定义数据集范围。图2 (https://arxiv.org/html/2608.15223#S3.F2)展示了由此产生的数据集中的一个完整追踪。
对于每个选定的单元,我们指定了目标学习者级别、语法或语言模式以及日常语境。这些规范涵盖了初学者常见的孟加拉语-英语差异,包括疑问句构成、时态和助动词使用、介词、introductory it和there、被动结构和习语表达。
我们使用这些规范来提示Gemini 3.5 Flash Lite作为教师模型。给定课程单元、目标CEFR(欧洲语言共同参考框架)级别和孟加拉语输入句子,我们指示模型生成一个严格有效的JSON追踪,包含图3 (https://arxiv.org/html/2608.15223#S3.F3)所示的七个字段。提示还要求JSON对象之外不能有自由格式文本。
\[教师生成提示模板\] 系统:你是NCTB 9-10年级考试的专家英语导师。输入:单元:\{unit\},CEFR:\{cefr\},孟加拉语:"句子" 任务:返回严格符合以下格式的有效JSON:\{ "word\_gloss": \[\{"bn": "\.\.", "en": "\.\.", "pos": "\.\."\}\], "literal\_translation": "逐字英语", "natural\_translation": "流利的英语目标", "grammar\_notes": \["孟加拉语L1对比笔记", "\.\."\], "common\_mistake": "可能的初学者L1错误", "practice\_question": "针对性测试题", "practice\_answer": "预期正确答案" \} 约束:输出不能包含JSON以外的任何文本。不要使用markdown代码块。
图3:用于Gemini 3.5 Flash Lite追踪生成的教师提示模板。### III-A 课程覆盖范围与语言设计
TRACE-BN包含4099个示例,涵盖15个CEFR A1-A2主题集群和13个NCTB语法单元。主题包括家庭、学校、食物、健康、天气、方向、购物和日常活动。语法覆盖包括被动语态、动词与时态、代词、介词、情态动词、附加疑问句、条件句、句子转换、间接引语以及introductory it和there。
面向学习者的脚手架支撑,包括语法笔记和练习题,以孟加拉语提供,而目标语言字段则保持英语。
### III-B 追踪过滤与最终数据集
我们在训练前应用了三个自动质量过滤器。首先,结构验证要求JSON有效,包含所有七个字段,语法笔记非空,且词汇注释长度在源句长度的0.5倍到2.0倍之间。其次,Unicode文字验证检查孟加拉语源句和目标翻译字段,以防止跨语言切换错误。第三,语义去重使用paraphrase-multilingual-MiniLM-L12-v2模型生成的句子嵌入,并移除同一主题集群内余弦相似度>0.92的近似重复项。
从4450个教师生成的候选中,移除了351个(7.9%):180个因结构错误,45个因文字完整性违规,126个因语义重复。最终数据集包含4099个追踪,孟加拉语源句和英语目标句的平均长度分别为5.5个词和6.6个词。
数据集被划分为3667个训练样本和432个评估样本。划分按主题集群组织,包括保留的领域如天气状况和习语表达,以测试句子级别和主题级别的泛化能力。评估集和训练集之间不存在源句重叠或检测到的词汇泄露。
作为对监督信号的人工验证,三名双语英语/孟加拉语教育者独立评估了从课程中随机抽取的100个TRACE-BN追踪。在五个教学维度的1-5分李克特量表上,监督追踪的平均评分如下:翻译质量4.81±0.58,语法解释4.81±0.62,学习者错误合理性4.79±0.68,练习题匹配度4.44±1.17,整体评价4.71±0.59(95.7%的评分≥4分)。在审核样本中,没有事实或语法错误达到标注者共识。这种人工验证支持了监督数据的质量,而更大规模的双评审员评估则评估了适应后模型学到的行为。表I (https://arxiv.org/html/2608.15223#S3.T1)记录了完整的数据集组成。
(图注)图4:基础模型与TRACE-BN调优后的Qwen3-0.6B在代表性保留孟加拉语输入上的输出质量对比。基础模型产生直译的词汇替换或退化循环,而调优后的模型输出流畅的目标翻译,并附带对比性孟加拉语语法解释。表I:TRACE-BN数据集的关键规格与组成。数据集属性规格/数量语料库规模与划分总结构化辅导追踪数4099训练集(Dtrain)3667(89.5%)保留评估集(Deval)432(10.5%)课程与教学范围目标学习者级别CEFR A1-A2(初学者)NCTB课程语法单元13个单元主题领域集群15个情境域追踪模式与序列长度每个追踪的结构化字段数7个多任务字段平均孟加拉语源句长度5.5词平均英语自然翻译长度6.6词
## IV 模型适应与评估
### IV-A LoRA微调
我们使用LoRA [5 (https://arxiv.org/html/2608.15223#bib.bib24)]和4位量化,通过Unsloth在单张16GB Google Colab T4 GPU上对Qwen3-0.6B [18 (https://arxiv.org/html/2608.15223#bib.bib23)]进行微调。训练输入是孟加拉语句子和目标模式规范;模型被训练生成完整的七字段辅导追踪作为单一回复。LoRA使用秩r=16,缩放因子α=32,零dropout,目标层为q、k、v、o、gate、up、down投影层。训练运行固定3个epoch(621个优化器步),采用余弦学习率调度,峰值为2×10⁻⁴;损失每51步记录一次(图5 (https://arxiv.org/html/2608.15223#S4.F5))。最终检查点在432个样本的划分上进行评估,未进行超参数调优或检查点筛选。
(图注)图5:Qwen3-0.6B在TRACE-BN上训练3个epoch(621步)的损失进程。损失稳步下降并在训练接近完成时趋于稳定。### IV-B 基线模型
我们将调优后的Qwen3-0.6B与其未调优的基础模型以及三个零样本基线进行对比:Gemma-4 E2B(23亿参数)作为更大模型的参考,TigerLLM作为孟加拉语专用模型的参考。相似文章
量化语言模型蒸馏中的潜意识行为迁移比率
本文量化了语言模型蒸馏中潜意识行为迁移的程度,表明即使使用良性训练数据,不良特征也能稳健地从教师模型迁移到学生模型,并且迁移在不同模型族中表现出不同的规模。
CSTutorBench:面向积木编程的小型语言模型辅导能力基准测试
CSTutorBench是一个基准测试,用于评估小型语言模型在积木编程环境中作为辅导员的性能,重点关注教学行为。初步结果显示,模型在较深层的辅导技能(如避免答案泄露)上表现不佳,而提示词修订能提升分数。
分词器移植:缓解边缘高效孟加拉语ASR中的自回归崩溃
本文提出了一种适用于Moonshine等轻量级ASR模型的分词器移植流程,以解决孟加拉语中的自回归崩溃问题。通过将以英语为中心的分词器替换为BanglaBERT的WordPiece词汇表,词元繁殖度从9.16降至1.30,序列长度减少85.8%,在Lipi-Ghor数据集上实现了21.54%的词错误率(WER)。
表面礼貌,实际错误:用于修复多语言孟加拉语生成中敬语失误的精选数据集
本文介绍BLADE,一个文化对齐的指令微调数据集,包含4,196个交互对,用于修复多语言孟加拉语生成中的敬语失误和语用差距。在此数据集上微调DeepSeek-8B和LLaMA-3.2-3B等模型,在结构保真度和敬语对齐方面取得了显著改进。
弥合英语-阿拉伯语医学知识鸿沟:基于因果层选择的定向低秩适配
本文探讨了LLM在阿拉伯语医学任务中表现不佳的原因,通过机制分析表明知识存在于模型内部但未能浮现,随后提出了TLoRA,一种定向低秩适配方法,在医学问答上优于全网络LoRA,并引入了一个新的阿拉伯语临床对话基准。