基于跨语言迁移和LoRA适配器融合的低资源阿拉伯字母语言生物医学机器翻译

arXiv cs.CL 论文

摘要

本文对面向低资源阿拉伯字母语言的生物医学机器翻译中的跨语言迁移进行了系统研究,以阿拉伯语和波斯语作为枢轴语言。作者评估了LoRA适配器融合作为一种零数据迁移策略,并表明该策略对于达里语等亲缘关系较近的语言效果出乎意料地好。

arXiv:2607.22300v1 公告类型:新 摘要:我们针对医疗保健领域的跨语言迁移进行了一项系统研究,以解决阿拉伯字母语言生物医学神经机器翻译资源匮乏的问题。我们以阿拉伯语和波斯语作为资源相对丰富的枢轴语言,来改善对\textbf{四种极度低资源}目标语言的翻译:达里语(阿富汗波斯语,波斯语的一种标准变体)、普什图语、索拉尼库尔德语(中央库尔德语,库尔德语的一种主要标准变体)以及乌尔都语(与印地语关系密切)。通过在小型仅解码器大语言模型上进行LoRA微调,我们训练了\textit{领域特定的枢轴适配器},并评估了\textbf{三种迁移策略}:少样本上下文学习、最小监督适应,以及——据我们所知——在该场景下首次使用的零数据LoRA适配器融合。仅用500个句子的监督适应就使达里语达到接近枢轴语言的质量(CHrF++ 41.01),并为乌尔都语带来了有意义的提升(28.88),而适配器融合在零额外成本下,对达里语达到了与监督适应相差3.5个CHrF++以内的效果。普什图语和索拉尼库尔德语仍不足以用于高风险的临床应用,这揭示了当与枢轴语言的结构距离过大时跨语言迁移的局限性。LoRA适配器融合对亲缘关系较近的语言效果出乎意料地好,即使没有目标语言的生物医学数据也是如此。
查看原文
查看缓存全文

缓存时间: 2026/07/27 07:40

# 面向低资源阿拉伯语系语言的生物医学机器翻译:基于跨语言迁移和LoRA适配器融合

来源:https://arxiv.org/abs/2607.22300  
查看PDF (https://arxiv.org/pdf/2607.22300)

> **摘要:** 我们提出了一项针对医疗领域的跨语言迁移的系统性研究,以解决阿拉伯语系语言生物医学NMT资源稀缺的问题。我们使用阿拉伯语和波斯语作为高资源枢轴语言,以改进对以下**四种极度低资源**目标语言的翻译:达里语(阿富汗波斯语,波斯语的一种标准化变体)、普什图语、索拉尼库尔德语(中部库尔德语,库尔德语的主要标准化变体)和乌尔都语(与印地语关系密切)。通过在小型仅解码器LLM上进行LoRA微调,我们训练了*领域特定的枢轴适配器*,并评估了**三种迁移策略**:少样本上下文学习、最小监督适应,以及——据我们所知,在此设置中首次——零数据LoRA适配器融合。仅使用500个句子的监督适应即可使达里语达到接近枢轴语言的质量(CHrF++ 41.01),乌尔都语也有显著提升(28.88),而适配器融合在零额外成本下,针对达里语达到的CHrF++与监督适应相差不到3.5。普什图语和索拉尼库尔德语在临床高风险部署中仍显不足,这暴露了当目标语言与枢轴语言结构距离过远时跨语言迁移的局限性。LoRA适配器融合对于关系密切的语言效果出奇地好,即使在缺乏目标语言生物医学数据时也是如此。

## 提交历史

来自:Lifeng Han 博士 [查看邮件](https://arxiv.org/show-email/24a5de31/2607.22300) **\[v1\]** 2026年7月24日星期五 13:44:50 UTC(89 KB)

相似文章

突厥语族语言机器翻译的跨语言迁移

arXiv cs.CL

本文利用mT5和成对迁移矩阵,研究了五种突厥语族语言之间的机器翻译跨语言迁移,发现迁移在紧密相关的语言对之间最强,并且在文字不匹配的设置中,拉丁化有所帮助。