基于跨语言迁移和LoRA适配器融合的低资源阿拉伯字母语言生物医学机器翻译
摘要
本文对面向低资源阿拉伯字母语言的生物医学机器翻译中的跨语言迁移进行了系统研究,以阿拉伯语和波斯语作为枢轴语言。作者评估了LoRA适配器融合作为一种零数据迁移策略,并表明该策略对于达里语等亲缘关系较近的语言效果出乎意料地好。
arXiv:2607.22300v1 公告类型:新
摘要:我们针对医疗保健领域的跨语言迁移进行了一项系统研究,以解决阿拉伯字母语言生物医学神经机器翻译资源匮乏的问题。我们以阿拉伯语和波斯语作为资源相对丰富的枢轴语言,来改善对\textbf{四种极度低资源}目标语言的翻译:达里语(阿富汗波斯语,波斯语的一种标准变体)、普什图语、索拉尼库尔德语(中央库尔德语,库尔德语的一种主要标准变体)以及乌尔都语(与印地语关系密切)。通过在小型仅解码器大语言模型上进行LoRA微调,我们训练了\textit{领域特定的枢轴适配器},并评估了\textbf{三种迁移策略}:少样本上下文学习、最小监督适应,以及——据我们所知——在该场景下首次使用的零数据LoRA适配器融合。仅用500个句子的监督适应就使达里语达到接近枢轴语言的质量(CHrF++ 41.01),并为乌尔都语带来了有意义的提升(28.88),而适配器融合在零额外成本下,对达里语达到了与监督适应相差3.5个CHrF++以内的效果。普什图语和索拉尼库尔德语仍不足以用于高风险的临床应用,这揭示了当与枢轴语言的结构距离过大时跨语言迁移的局限性。LoRA适配器融合对亲缘关系较近的语言效果出乎意料地好,即使没有目标语言的生物医学数据也是如此。
查看缓存全文
缓存时间: 2026/07/27 07:40
# 面向低资源阿拉伯语系语言的生物医学机器翻译:基于跨语言迁移和LoRA适配器融合 来源:https://arxiv.org/abs/2607.22300 查看PDF (https://arxiv.org/pdf/2607.22300) > **摘要:** 我们提出了一项针对医疗领域的跨语言迁移的系统性研究,以解决阿拉伯语系语言生物医学NMT资源稀缺的问题。我们使用阿拉伯语和波斯语作为高资源枢轴语言,以改进对以下**四种极度低资源**目标语言的翻译:达里语(阿富汗波斯语,波斯语的一种标准化变体)、普什图语、索拉尼库尔德语(中部库尔德语,库尔德语的主要标准化变体)和乌尔都语(与印地语关系密切)。通过在小型仅解码器LLM上进行LoRA微调,我们训练了*领域特定的枢轴适配器*,并评估了**三种迁移策略**:少样本上下文学习、最小监督适应,以及——据我们所知,在此设置中首次——零数据LoRA适配器融合。仅使用500个句子的监督适应即可使达里语达到接近枢轴语言的质量(CHrF++ 41.01),乌尔都语也有显著提升(28.88),而适配器融合在零额外成本下,针对达里语达到的CHrF++与监督适应相差不到3.5。普什图语和索拉尼库尔德语在临床高风险部署中仍显不足,这暴露了当目标语言与枢轴语言结构距离过远时跨语言迁移的局限性。LoRA适配器融合对于关系密切的语言效果出奇地好,即使在缺乏目标语言生物医学数据时也是如此。 ## 提交历史 来自:Lifeng Han 博士 [查看邮件](https://arxiv.org/show-email/24a5de31/2607.22300) **\[v1\]** 2026年7月24日星期五 13:44:50 UTC(89 KB)
相似文章
弥合英语-阿拉伯语医学知识鸿沟:基于因果层选择的定向低秩适配
本文探讨了LLM在阿拉伯语医学任务中表现不佳的原因,通过机制分析表明知识存在于模型内部但未能浮现,随后提出了TLoRA,一种定向低秩适配方法,在医学问答上优于全网络LoRA,并引入了一个新的阿拉伯语临床对话基准。
连接科学遗产:面向可持续知识转移的阿拉伯语-俄语平行语料库与大语言模型基准
本文提出了一个阿拉伯语-俄语科学翻译的基准,包括一个包含27,000个句对的混合平行语料库,以及使用LoRA微调的多语言模型(mT5、NLLB、Qwen)。最佳模型达到了BLEU分数23.15,该工作旨在降低阿拉伯语和俄语研究人员之间科学知识交流的语言障碍。
突厥语族语言机器翻译的跨语言迁移
本文利用mT5和成对迁移矩阵,研究了五种突厥语族语言之间的机器翻译跨语言迁移,发现迁移在紧密相关的语言对之间最强,并且在文字不匹配的设置中,拉丁化有所帮助。
实际环境中的多语言多模态大语言模型:面向低资源语言的构建
本教程论文概述了如何为低资源语言构建多语言多模态大语言模型,涵盖数据创建、模型对齐、微调和评估,重点提供实用方案和动手资源。
哪些语言最适合迁移到瓦尔皮里语?一项基于相似度的低资源语音识别研究
本文研究了低资源自动语音识别(ASR)中跨语言迁移的问题,针对瓦尔皮里语提出了一种结合声学与语言特征的相似度框架,以选择最优源语言。实验表明,像阿萨姆语和印地语这样声学相似的语言能显著降低词错误率和字符错误率。