标签
本文介绍了BHARATI,一组基于SentencePiece BPE的分词器,在针对古典印度语言的平衡多语语料库上训练而成。子词丰富度分析显示,分词效率显著提升,与基线分词器相比,序列长度最多缩短90%,从而提高了下游语言模型的有效上下文长度。
介绍PaliBench,一个用于巴利语到英语翻译的多参考基准,采用多位学者的独立翻译,并提供一种可复用的方法论,用于为古典语言创建类似的基准测试。