标签
本文研究了词汇规范化中的多语言诅咒,发现同时在多种语言上训练单个模型会导致各语言准确率下降,而当语言以小组形式训练时性能最佳。
本文提出了用于逆转中世纪文本中字符集简化和缩写的神经方法,采用一对一和带状RNN,并通过自监督或平行语料库进行训练,同时介绍了一个用于字母还原的Python库。