标签
本文首次系统研究了已灭绝的西夏语的分词问题,结合传统词典、无标注文本和预训练字符编码器,尽管资源极端稀缺,仍实现了高性能。
TRACE-BN 介绍了一个课程引导的数据集,用于结构化的孟加拉语-英语辅导,并展示了如何使用 LoRA 将此行为迁移到低于10亿参数的语言模型中,在资源受限的离线环境中显著提高了辅导质量。
介绍了首个面向占语、高棉语和岱侬语的多语种语料库及基准 CKTN,通过一种文字感知的适配方案来解决多语种编码器中的碎片化问题。
本文审计了二十多个非洲自然语言处理语料库家族的许可证来源,识别了兼容性故障,如JW300违规和隐藏的NoDerivs条款,并提供了合法清洁数据集创建的尽职调查清单。
本文利用AfriXNLI基准测试,研究标注数据大小对16种非洲语言自然语言推理性能的影响。结果表明,缩放行为对语言敏感且通常非单调,挑战了常见的单调改进假设,并强调了需要为特定语言创建数据集以及更强的多语言策略。