标签
本文研究了在多种自然语言上使用人工语言对LLM进行预训练(预预训练)是否始终能提升token效率,发现其收益高度依赖于实验设置和随机种子,尽管对于使用Llama分词器的小模型,稳定收益在多数语言中出现。
本文提出了一种受LAD启发的预预训练方法,使用一种名为MP-Struct的形式语言,该语言编码了类自然语言结构。研究表明,这种方法提高了token效率,并赋予了模型类似人类的对结构不合理语言的抵抗力,挑战了先前关于有效预预训练语言的假设。