我构建了一个从零开始的开源机器翻译管道和平行语料库,用于突尼斯达里加语(阿拉伯字母转写)的早期基线,并正在将其发展为一个精心策划的社区语料库 [P]
摘要
一位18岁的突尼斯学生介绍了一个开源机器翻译管道和平行语料库,用于以阿拉伯字母转写书写的突尼斯达里加语,该管道从零开始构建,使用了小型1560万参数的Transformer,诚实基线BLEU为3.89,并呼吁贡献者以道德方式扩展语料库。
我是一名18岁的独立学生,来自突尼斯。我构建并领导着一个从零开始的开源机器翻译管道和平行语料库,用于突尼斯达里加语。分享以获取反馈。原因:突尼斯达里加语,以Arabizi(拉丁字母+数字如3/7/9/5表示阿拉伯语音位)书写,几乎没有开放的自然语言处理资源。现有的阿拉伯语工具通过现代标准阿拉伯语处理,并错误处理了正字法。据我所知,没有开放的平行语料库或从零开始的基线。我构建的内容(全部开源):
- 支持Arabizi的SentencePiece BPE分词器(将3/7/9/5作为保护符号),共享16k词汇。
- 约1560万参数的编码器-解码器Transformer,从零开始(无预训练语言模型):通过清洗后的摩洛哥达里加语进行迁移学习,然后在手工制作的突尼斯语对上微调。
- 完整的清洗/训练/评估管道。
诚实的结果与局限性:v1 BLEU在小型锁定测试集上为3.89,分数较低,我将坦诚这一点。语料库约553个手工制作的对,因此数据是瓶颈,而非架构。我将3.89视为一个诚实的初始基线,随着语料库的增长将被超越。
我的发展方向:我正在将其扩展为一个更大的、道德收集的达里加语语料库,我精心策划并验证每个收集对是否具有同意文档,每个对都有来源标签。我正在寻找贡献者帮助其增长,每个贡献都会经过审查以保持质量和同意标准。
寻求:技术反馈/批评,以及任何有兴趣贡献数据或合作低资源/方言阿拉伯语机器翻译的人。
链接:
GitHub仓库:https://github.com/Dhiadev-tn/darija-translator
Hugging Face数据集:https://huggingface.co/datasets/Dhiadev-tn/tunisian-darija-english
Hugging Face模型:https://huggingface.co/Dhiadev-tn/darija-translator
相似文章
连接科学遗产:面向可持续知识转移的阿拉伯语-俄语平行语料库与大语言模型基准
本文提出了一个阿拉伯语-俄语科学翻译的基准,包括一个包含27,000个句对的混合平行语料库,以及使用LoRA微调的多语言模型(mT5、NLLB、Qwen)。最佳模型达到了BLEU分数23.15,该工作旨在降低阿拉伯语和俄语研究人员之间科学知识交流的语言障碍。
MultiSynt/MT:跨越36种语言的万亿标记多平行预训练数据
本文介绍了MultiSynt/MT,这是一个通过将英语预训练数据翻译成36种语言而创建的万亿标记多语言平行语料库。实验表明,在此翻译数据上训练的大语言模型在更少的标记下实现了与原生数据相当的性能,但仍存在一些评估盲点和文化差距。
BOUTEF:北非假新闻的多语言语料库——语言作为武器
本文介绍了BOUTEF,一个用于研究阿尔及利亚和突尼斯假新闻的大规模多语言语料库,涵盖阿拉伯方言、Arabizi、法语、英语及语码转换。该语料库包含对语言策略和互动动态的实证分析。
孟加拉地区方言的多方言神经机器翻译系统
本文提出了一个统一的用于12种孟加拉地区方言的多方言神经机器翻译系统,引入了迄今最大的多方言平行语料库,并通过使用DoRA微调的BanglaT5模型取得了最先进的BLEU分数。
基于跨语言迁移和LoRA适配器融合的低资源阿拉伯字母语言生物医学机器翻译
本文对面向低资源阿拉伯字母语言的生物医学机器翻译中的跨语言迁移进行了系统研究,以阿拉伯语和波斯语作为枢轴语言。作者评估了LoRA适配器融合作为一种零数据迁移策略,并表明该策略对于达里语等亲缘关系较近的语言效果出乎意料地好。