我构建了一个从零开始的开源机器翻译管道和平行语料库,用于突尼斯达里加语(阿拉伯字母转写)的早期基线,并正在将其发展为一个精心策划的社区语料库 [P]

Reddit r/MachineLearning 模型

摘要

一位18岁的突尼斯学生介绍了一个开源机器翻译管道和平行语料库,用于以阿拉伯字母转写书写的突尼斯达里加语,该管道从零开始构建,使用了小型1560万参数的Transformer,诚实基线BLEU为3.89,并呼吁贡献者以道德方式扩展语料库。

我是一名18岁的独立学生,来自突尼斯。我构建并领导着一个从零开始的开源机器翻译管道和平行语料库,用于突尼斯达里加语。分享以获取反馈。原因:突尼斯达里加语,以Arabizi(拉丁字母+数字如3/7/9/5表示阿拉伯语音位)书写,几乎没有开放的自然语言处理资源。现有的阿拉伯语工具通过现代标准阿拉伯语处理,并错误处理了正字法。据我所知,没有开放的平行语料库或从零开始的基线。我构建的内容(全部开源): - 支持Arabizi的SentencePiece BPE分词器(将3/7/9/5作为保护符号),共享16k词汇。 - 约1560万参数的编码器-解码器Transformer,从零开始(无预训练语言模型):通过清洗后的摩洛哥达里加语进行迁移学习,然后在手工制作的突尼斯语对上微调。 - 完整的清洗/训练/评估管道。 诚实的结果与局限性:v1 BLEU在小型锁定测试集上为3.89,分数较低,我将坦诚这一点。语料库约553个手工制作的对,因此数据是瓶颈,而非架构。我将3.89视为一个诚实的初始基线,随着语料库的增长将被超越。 我的发展方向:我正在将其扩展为一个更大的、道德收集的达里加语语料库,我精心策划并验证每个收集对是否具有同意文档,每个对都有来源标签。我正在寻找贡献者帮助其增长,每个贡献都会经过审查以保持质量和同意标准。 寻求:技术反馈/批评,以及任何有兴趣贡献数据或合作低资源/方言阿拉伯语机器翻译的人。 链接: GitHub仓库:https://github.com/Dhiadev-tn/darija-translator Hugging Face数据集:https://huggingface.co/datasets/Dhiadev-tn/tunisian-darija-english Hugging Face模型:https://huggingface.co/Dhiadev-tn/darija-translator
查看原文

相似文章

MultiSynt/MT:跨越36种语言的万亿标记多平行预训练数据

arXiv cs.CL

本文介绍了MultiSynt/MT,这是一个通过将英语预训练数据翻译成36种语言而创建的万亿标记多语言平行语料库。实验表明,在此翻译数据上训练的大语言模型在更少的标记下实现了与原生数据相当的性能,但仍存在一些评估盲点和文化差距。

孟加拉地区方言的多方言神经机器翻译系统

arXiv cs.CL

本文提出了一个统一的用于12种孟加拉地区方言的多方言神经机器翻译系统,引入了迄今最大的多方言平行语料库,并通过使用DoRA微调的BanglaT5模型取得了最先进的BLEU分数。