非洲语言NLI评估的样本量缩放
摘要
本文利用AfriXNLI基准测试,研究标注数据大小对16种非洲语言自然语言推理性能的影响。结果表明,缩放行为对语言敏感且通常非单调,挑战了常见的单调改进假设,并强调了需要为特定语言创建数据集以及更强的多语言策略。
arXiv:2606.03219v1 公告类型:新
摘要:非洲语言的标注数据非常少,目前尚不清楚增加标注数据量是否能可靠地提升下游性能。本研究基于AfriXNLI基准,对16种非洲语言的自然语言推理(NLI)进行了系统的样本量缩放研究。在受控条件下,我们测试了两个约0.6B参数的多语言Transformer模型——在XNLI上微调的XLM-R Large和AfroXLM-R Large——在样本量从50到500个标注示例之间的表现,并对其随机子采样运行的结果取平均。与通常认为的随数据增加而单调递增的信念相反,我们发现缩放行为对语言高度敏感,且通常是非单调的。一些语言在样本量较小时表现出早期饱和或性能下降,并且在低资源情况下方差较大。这些结果表明,仅凭数据量不足以保证非洲NLI的稳定提升,因此需要创建对语言敏感的数据集和更强的多语言建模策略。
查看缓存全文
缓存时间: 2026/06/03 09:37
# 非洲语言自然语言推理评估的样本量缩放 来源:https://arxiv.org/html/2606.03219 Anuj Tiwari¹, Oluwapelumi Ogunremu², Terry Oko-odion³, Jesujuwon Egbewale⁴, Hannah Nwokocha⁵ 诺伊达工程技术学院¹, ML Collective¹,²,³,⁴,⁵ [email protected], [email protected], [email protected], [email protected], [email protected] ###### 摘要 非洲语言的标注数据非常稀少,增加标注数据的数量是否能可靠地提升下游性能尚不明确。本研究基于 AfriXNLI 基准,对 16 种非洲语言的自然语言推理(NLI)进行了系统的样本量缩放研究。在受控条件下,两种参数量约为 0.6B 的多语言 Transformer 模型——在 XNLI 上微调的 XLM-R Large 和 AfroXLM-R Large——在 50 到 500 个标注样本的样本量下进行测试,并平均了随机子采样运行的结果。与通常认为的性能随数据增加而单调提升的观点相反,我们发现了一种强烈依赖语言且通常非单调的缩放行为。部分语言在样本量增加时表现出早期饱和或性能下降,并且在低资源场景下表现出高方差。这些结果表明,数据量不足以保证为非洲 NLI 带来稳定的收益,因此需要创建对语言敏感的数据库,并采用更强的多语言建模策略。 # 非洲语言自然语言推理评估的样本量缩放 Anuj Tiwari¹, Oluwapelumi Ogunremu², Terry Oko-odion³, Jesujuwon Egbewale⁴, Hannah Nwokocha⁵ 诺伊达工程技术学院¹, ML Collective¹,²,³,⁴,⁵ [email protected], [email protected], [email protected], [email protected], [email protected] ## 1 引言 NLP 的最新进展得益于大规模预训练和大量标注数据的获取。然而,这些进展不公平地惠及了高资源语言,许多非洲语言在训练和评估标准中仍未被充分研究。因此,多语言和低资源 NLP 的关键问题是了解模型性能与可用标注数据量之间的关系。机器学习中最广泛使用的假设之一是,随着标注数据越来越多,下游性能会越来越好。虽然这一假设在高资源环境中通常是正确的,但在低资源语言(尤其是具有各种类型和形态特征的非洲语言)中尚未得到仔细研究。实际上,标注成本高昂,在没有明确收益的情况下扩展数据集可能效率低下,甚至适得其反。 本文利用 AfriXNLI 基准,分析了非洲语言模型中自然语言推理(NLI)行为与标注数据量的关系。我们的目标不是提出新模型或数据集,而是在受控实验条件下,实证地表征不同语言和模型下的缩放行为、性能稳定性和方差。具体而言,我们回答以下研究问题: - • RQ1:在 AfriXNLI 中使用非洲语言时,更大的标注数据量是否对 NLI 性能产生积极影响? - • RQ2:缩放行为在不同语言和模型之间如何变化? - • RQ3:在随机子采样下,观察到的趋势在多大程度上是稳定的? 通过回答这些问题,我们希望为非洲 NLP 中的数据集构建和评估实践提供实证建议,并给出低资源语义推理问题中数据缩放的预期要求。 ## 2 相关工作 **多语言和非洲 NLP 基准。** 当前研究通过扩展现有标准和开发新评估工具,为非洲语言 NLP 的发展做出了贡献。AfriXNLI 是 XNLI 基准的人类翻译版本,包含多种非洲语言,允许在低资源条件下统一评估人类自然语言推理(Community, 2024 (https://arxiv.org/html/2606.03219#bib.bib1))。 MasakhaNER 为十种非洲语言提供了大规模命名实体识别系统,该项目证明了社区驱动的数据集构建在非洲 NLP 中的有效性(Adelani 等人, 2021 (https://arxiv.org/html/2606.03219#bib.bib2))。AfroLID 提供了神经语言识别工具包,涵盖非洲 517 种语言,与以往的多语言系统相比大大增加了语言覆盖范围(Adebara 等人, 2022 (https://arxiv.org/html/2606.03219#bib.bib3))。这些共同努力指明了在多语言 NLP 背景下为非洲语言确定评估材料的长期发展方向。 **数据缩放定律与效率。** 在高资源设置下,语言模型表现出可预测的缩放行为。(Kaplan 等人, 2020 (https://arxiv.org/html/2606.03219#bib.bib4))证明语言建模损失随模型大小和数据集大小呈幂律依赖关系降低。(Hoffmann 等人, 2022 (https://arxiv.org/html/2606.03219#bib.bib7))还表明,计算最优训练需要成比例地增加数据量,因为 Chinchilla 模型可以优于在较少数据上训练的更大模型。(Muennighoff 等人, 2023 (https://arxiv.org/html/2606.03219#bib.bib8))然而发现,在数据受限环境中性能提升会迅速减弱,增加计算量或重复数据仅能带来小幅性能提升。这些结果对经典缩放定律能否直接应用于低资源和多语言设置提出了质疑。 **低资源 NLP 中的数据缩放。** (Eiselen 和 Gaustad, 2023 (https://arxiv.org/html/2606.03219#bib.bib9))研究了训练数据量对非洲语言性能的影响,特别关注南非形态多样的语言。他们证明,虽然较小的数据集可以产生有用的模型,但具有复杂连接形态的语言需要更多数据才能达到类似性能。这项工作突出了语言结构在数据效率方面的重要性。然而,他们只测试了基于嵌入的模型和词性标注等问题,并提出了在语义推理问题和当代微调预训练语言模型中数据缩放行为的未解问题。 **非洲语言:数据稀缺与基准测试。** 系统性低代表性(Hussen 等人, 2025 (https://arxiv.org/html/2606.03219#bib.bib10))报告称,如今非洲 2000 多种语言中只有一小部分在当代大型语言模型上进行了训练,非洲语言领域在全球代表性中远远不足 15%。(Adebara 和 Abdul-Mageed, 2022 (https://arxiv.org/html/2606.03219#bib.bib11))将这种稀缺性归因于当前大型语言模型开发对非洲语言的结构性支持不足,并且相对于其全球分布,非洲语言的代表性严重不足。最新的基准项目如 AfroBench(Ojo 等人, 2025 (https://arxiv.org/html/2606.03219#bib.bib12))和 IrokoBench(Adelani 等人, 2025 (https://arxiv.org/html/2606.03219#bib.bib13))将评估扩展到非洲语言和任务类别,如推理和自然语言理解。尽管覆盖范围有所扩大,但这些基准总是显示出非洲语言与高资源语言之间的显著性能差异,并且建模和评估方面仍然存在持续问题。 **多语言表示模型。** 多语言编码器如 mBERT(Devlin 等人, 2019 (https://arxiv.org/html/2606.03219#bib.bib14))和 XLM-R(Conneau 等人, 2020 (https://arxiv.org/html/2606.03219#bib.bib15))基于多语言预训练,通常用作多语言 NLP 的基线。(Conneau 等人, 2020 (https://arxiv.org/html/2606.03219#bib.bib15))证明多语言预训练显著提高了 XLM-R 的跨语言测试性能,尤其是在低资源语言上。尽管这些模型在零样本迁移中表现有效,但它们对单一非洲语言数据增量扩展的响应尚未得到深入研究。我们的研究通过提供非洲语言 NLI 样本量缩放行为的实证检验来补充这些文献。 ## 3 实验设置 ### 3.1 数据集 我们使用 AfriXNLI 基准,该基准包含翻译成多种非洲语言的 NLI 句子对。我们在实验中使用 16 种语言,这些语言涵盖了 AfriXNLI 中呈现的各种语系、文字和类型属性。所有测试均在测试集上进行。为模拟不同的标注数据条件,我们通过随机子采样调整待评估的测试样本数量,但不调整模型参数。 ### 3.2 模型 为了比较预训练策略,我们评估了两种架构相似、参数量约为 0.6B 的多语言 Transformer 模型。第一种模型是在 XNLI 上微调的 XLM-R Large(Davison, 2020 (https://arxiv.org/html/2606.03219#bib.bib5)),这是一个基于 XLM-R 模型(Conneau 等人, 2020 (https://arxiv.org/html/2606.03219#bib.bib15))的强大任务对齐多语言基线。第二种模型 AfroXLM-R Large(Alabi 等人, 2022 (https://arxiv.org/html/2606.03219#bib.bib6))是 XLM-R 的非洲语言版本,在训练时更侧重于基于非洲语言的数据。 通过选择相似规模和架构的模型,我们排除了预训练数据组成和语言覆盖范围的影响,并减小了模型大小的影响。 ### 3.3 评估 对于每个语言-模型对,我们在 50 到 500 个样本的样本量下评估性能。为控制数据选择带来的方差,我们运行多次随机子采样,计算给定样本量下各次运行的平均值和标准差。 我们报告的最常用指标是准确率,但也报告精密度和 F1 分数。这样的评估计划使我们能够区分系统性缩放效应与采样引起的效应。 ## 4 结果 ### 4.1 不同样本量下的评估方差 我们首先分析评估方差随样本量变化的模式。图 1 (https://arxiv.org/html/2606.03219#S4.F1) 以聚合形式报告了所有语言和模型的准确率标准差。方差在低资源样本(50-100 个样本)中最大,并随着样本量的增加急剧下降,平均约 300 个样本后方差趋于稳定。 这种趋势表明,小评估集会产生非常不稳定的性能估计,高度依赖于所分析的具体样本集。随着样本量增加,方差减小,意味着更大的评估集更可能估计出真实的模型性能。 图注:图 1:评估方差(准确率标准差)随样本量变化的函数,聚合了所有语言和模型。方差随样本量增加迅速下降,表明低资源评估条件不稳定。 图 2 (https://arxiv.org/html/2606.03219#S4.F2) 进一步按模型细化了这一效应。XLM-R Large 和 AfroXLM-R Large 都遵循以下定性趋势:样本量较小时方差较大,随后样本量增加时方差急剧上升。尽管不同模型的方差绝对值略有不同,但整体趋势在所有模型中保持一致,表明评估不稳定性并非特定于某种预训练策略。 图注:图 2:按 XLM-R Large 和 AfroXLM-R Large 分别比较评估方差随样本量的变化。两种模型在低资源条件下都表现出高方差,并在更大的评估集下趋于稳定。 ### 4.2 跨语言和模型的全局缩放趋势 随着样本量的增加,方差减小,但准确率不一定单调提升。图 3 (https://arxiv.org/html/2606.03219#S4.F3) 提供了每个语言模型对的缩放斜率热图,指示性能是随着样本量增加而提升、保持不变还是降低。 热图显示语言之间存在显著异质性。有些斜率接近零或略为正,表示增益微弱或早期饱和;还有负斜率,表示随着评估集变大且更具代表性,性能系统性下降。这些模式在两种模型中均存在,表明缩放行为高度依赖语言,而非由模型驱动。 图注:图 3:语言-模型对在准确率上的缩放斜率热图。正斜率表示性能随样本量增加而提升,负斜率表示性能下降。 ### 4.3 依赖语言的缩放行为:约鲁巴语 vs 卢旺达语 为了具体说明这些趋势,我们分析了约鲁巴语和卢旺达语在每个模型下的缩放行为。图 4 (https://arxiv.org/html/2606.03219#S4.F4) 显示了 XLM-R Large 的结果。约鲁巴语表现出明显的小样本乐观现象,在 50 个样本时准确率相对较高,随后随着样本量增加持续下降。这种单调退化表明小评估子集高估了性能,掩盖了在更广泛覆盖下出现的系统性错误。 相反,卢旺达语的性能在约 150 个样本之前略有上升,之后开始下降并趋于稳定。在较大样本量下,方差收敛,表明较小的子集无法再测量其真实性能水平。 图注:图 4:XLM-R Large 下的约鲁巴语和卢旺达语评估缩放行为。约鲁巴语随样本量增加单调退化,卢旺达语最初改善后趋于饱和。 相同的比较在图 5 (https://arxiv.org/html/2606.03219#S4.F5) 中针对 AfroXLM-R Large 进行。定性趋势相似:约鲁巴语同样在样本量增大时准确率下降,而卢旺达语则最初增益后趋于稳定。这些趋势在模型中保持一致,支持了缩放行为更多是语言特定而非模型特定的结论。 图注:图 5:AfroXLM-R Large 下的约鲁巴语和卢旺达语评估缩放行为。语言特定的非单调倾向在模型中普遍存在。 ## 5 讨论 我们的发现质疑了广泛持有的观点,即在非洲语言自然语言推理中,统一增加更多数据总是更好的。在语言中观察到评估准确率的非单调缩放行为,其中除数据量外的其他信息(如标签分布、翻译歧义和评估子集的代表性)发挥着重要作用。 值得注意的是,我们仅针对 AfriXNLI 得出结论,这些结论不一定适用于其
相似文章
神经语言模型的缩放规律
基础性实证研究,展示了语言模型性能与模型规模、数据集大小和计算预算之间的幂律缩放关系,对最优训练资源分配和样本效率有重要启示。
非洲语言税:量化前沿大语言模型中分词非洲语言的成本、延迟和上下文惩罚
本文系统量化了20种非洲语言在11个前沿和开源分词器上的分词惩罚,发现推理成本和延迟最高可达8.9倍,有效上下文窗口仅为英语的11%,突显了子词词汇表中编码的结构性数字鸿沟。
从带标签验证集输出统计预测推理时扩展增益
本文提出了一种方法,利用单次带标签验证集采样中获得的廉价统计量,预测语言模型的最佳N选一推理扩展增益。一个仅有三个核心特征的紧凑预测器与真实增益的斯皮尔曼相关系数ρ=0.90,使得在昂贵的奖励模型评分之前能够筛选配置。
SEA-NLI:以自然语言推理透视东南亚文化理解
介绍了SEA-NLI,一个基于文化的自然语言推理基准,涵盖八个东南亚国家,揭示了LLMs在特定文化知识上的低性能,尤其是在语言和科学/技术方面。结果表明,文化感知提示有所帮助,但思维链提升有限。
从单语到多语:评估Mamba在南非语言中的ASR性能
本文评估了Mamba状态空间模型在七种南非语言上的ASR性能,发现其在资源更少的情况下达到了与Conformer相当的准确率,并探讨了多语训练策略和低资源场景。