用于数据高效语言学习的结构先验

arXiv cs.CL 论文

摘要

本文研究了从非语言数据进行结构迁移以提高语言建模的数据效率,发现虽然它减少了下一个标记预测损失,但并未可靠地增强下游语言性能。

arXiv:2609.11505v1 公告类型:新 摘要:高效语言学习需要减少对大量数据和计算资源依赖的方法。我们研究结构迁移:首先在非语言数据上训练模型,以诱导自然语言的有用先验。这种方法是用于多语言语言模型的权重初始化形式。我们通过下一个标记预测损失、模型中的权重偏移和下游语言基准来评估迁移效果。几种符号数据类型——特别是音乐、概率语法和元胞自动机——比随机初始化产生更低的语言建模损失。这些收益与后续语言训练中较小的权重偏移相吻合,表明结构迁移将模型定位在参数空间中更有利的区域。然而,较低的损失并不一致地转化为更好的下游语言性能,并且从非语言数据的迁移不如额外语言数据高效。我们得出结论,对于下一个标记预测的训练目标,非语言数据可以作为语言数据的部分替代品,但并不能可靠地支持更广泛的语言泛化。
查看原文
查看缓存全文

缓存时间: 2026/09/11 08:31

# 面向数据高效语言学习的结构先验
来源:https://arxiv.org/html/2609.11505  
Yana Veitsman\*Jonas Mayer Martins\*Jonathan Lautenschlager Lisa Beinborn  

###### 摘要  
高效语言学习需要减少对大规模数据和计算资源依赖的方法。我们研究了**结构迁移**:首先在非语言数据上训练模型,以诱导对自然语言有用的先验知识。这种方法可视为一种面向多语言语言建模的权重初始化方式。我们通过下一词元预测损失、模型内的权重偏移以及下游语言学基准任务来评估迁移效果。几种符号数据类型——尤其是音乐、概率语法和元胞自动机——相比随机初始化能获得更低的语言建模损失。这些增益与后续语言训练过程中较小的权重偏移同时出现,表明结构迁移将模型置于参数空间中更有利的区域。然而,较低的损失并不总能转化为更优的下游语言表现,且从非语言数据迁移的效率低于使用额外语言数据。我们的结论是:对于下一词元预测这一训练目标,非语言数据可以作为语言数据的部分替代,但无法可靠地支持更广泛的语言泛化能力。  

††∗ 作者贡献均等。  

## 1 引言  
语言模型的性能随数据量与计算资源的增长而显著提升,但这两类资源本质上都是有限的。无论是对低资源语言建模,还是构建符合认知科学规律的模型,都需要从少量输入中进行学习,这使得数据效率既是一个工程问题,也是一个科学挑战(Hoffmann et al. 2022,[链接](https://arxiv.org/html/2609.11505#bib.bib23))。BabyLM 共享任务通过在低数据条件下评估系统,并鼓励基于认知启发的方法,直接应对了这一约束(Choshen et al. 2026,[链接](https://arxiv.org/html/2609.11505#bib.bib12))。  

人类语言习得是数据高效学习的天然灵感来源。尽管接触的语言输入相对有限,婴儿仍能检测并利用所感知语言中的统计规律(Saffran and Kirkham 2018,[链接](https://arxiv.org/html/2609.11505#bib.bib54))。我们考察是否可能将结构先验引入语言模型,以促进更数据高效的语言学习。因此,我们的目标是理解非语言数据在多大程度上能产生有助于后续语言学习的表征。此类先验可通过**预预训练**注入语言模型:在自然语言预训练之前,增加一个在非语言数据上训练模型的阶段(Papadimitriou and Jurafsky 2020,[链接](https://arxiv.org/html/2609.11505#bib.bib44);Hu et al. 2025,[链接](https://arxiv.org/html/2609.11505#bib.bib24);Lee et al. 2026,[链接](https://arxiv.org/html/2609.11505#bib.bib33))。  

预预训练构成结构迁移的一种形式,模型首先学习预测结构化符号信号,然后在语言训练中重用由此产生的参数状态。先前研究表明,这种方法能改善编码、数学和推理等领域的语言建模收敛性和下游性能(Lee et al. 2026,[链接](https://arxiv.org/html/2609.11505#bib.bib33);Shinnick et al. 2025,[链接](https://arxiv.org/html/2609.11505#bib.bib57))。然而,预预训练诱导的参数变化与目标性能之间的关系仍有待探索。  

在多语言环境中,数据效率尤为重要,因为模型必须在数据量各异的情况下泛化到类型学和分布上多样化的语言。同时,多语言训练引入了单语环境中不存在的挑战,包括来自数据混合的跨语言干扰(Ye et al. 2025,[链接](https://arxiv.org/html/2609.11505#bib.bib72))和冲突的优化信号(Wang et al. 2023,[链接](https://arxiv.org/html/2609.11505#bib.bib66))。因此,多语言环境不仅提供了检验结构迁移在单语或特定任务场景中的增益是否持续的机会,也提供了检验结构迁移是否具有语言特异性的机会。  

#### 方法与贡献  
我们研究结构迁移能否加速多语言语言学习。我们首先在包括概率上下文无关文法、元胞自动机、钢琴音乐和蛋白质序列在内的结构数据上训练 GPT-2 风格模型,然后在多语言 BabyLM 语料库上继续训练(Jumelet et al. 2026a,[链接](https://arxiv.org/html/2609.11505#bib.bib27))。我们从三个维度评估迁移效果:1)自然语言下一词元预测目标的效率;2)模型内部权重偏移;3)在 BabyLM 评估框架下的下游性能(Choshen et al. 2026,[链接](https://arxiv.org/html/2609.11505#bib.bib12))。该设置使我们能够检验某些类型的结构数据是否能产生有益于多语言建模的权重初始化。  

图 1:实验设置示意图。为探究如何将结构训练迁移到语言学习,我们首先在四种符号数据类型之一上训练语言模型:1)概率上下文无关文法;2)元胞自动机;3)钢琴音乐;4)蛋白质序列。示例树可能指句子"Alice paints the cat."。展示的乐段是 Reger(1900,[链接](https://arxiv.org/html/2609.11505#bib.bib50))的开头部分。所示蛋白质是水母的绿色荧光蛋白(GFP),改编自 Uniprot 条目([链接](https://www.uniprot.org/uniprotkb/P42212/feature-viewer))(Boutet et al. 2007,[链接](https://arxiv.org/html/2609.11505#bib.bib7))。随后,我们在包含中文、荷兰语和英文文本的多语言语料库上训练这些模型。  

## 2 相关工作  
小规模语言模型的研究动机既包括实际约束(如数据和计算资源有限),也包括符合认知科学规律的学习场景。该领域的研究表明,模型可以受益于训练过程中引入的结构偏差(Papadimitriou and Jurafsky 2020,[链接](https://arxiv.org/html/2609.11505#bib.bib44);Papadimitriou and Jurafsky 2023,[链接](https://arxiv.org/html/2609.11505#bib.bib45);Hu et al. 2025,[链接](https://arxiv.org/html/2609.11505#bib.bib24);Lee et al. 2026,[链接](https://arxiv.org/html/2609.11505#bib.bib33))。我们从初始化的角度审视此类偏差:预先接触结构数据可以将模型从无知的随机起点推向支持更高效语言学习的参数区域。  

### 2.1 样本高效建模  
BabyLM 挑战赛的往届参赛作品(Choshen et al. 2026,[链接](https://arxiv.org/html/2609.11505#bib.bib12))探索了多种提高样本效率的机制,包括从交互中学习(Charpentier et al. 2025,[链接](https://arxiv.org/html/2609.11505#bib.bib10);Mayer Martins et al. 2025,[链接](https://arxiv.org/html/2609.11505#bib.bib39))、课程学习(Warstadt et al. 2023,[链接](https://arxiv.org/html/2609.11505#bib.bib68);Diehl Martinez et al. 2023,[链接](https://arxiv.org/html/2609.11505#bib.bib16))以及多语言学习环境(Jumelet et al. 2026a,[链接](https://arxiv.org/html/2609.11505#bib.bib27))。这些方法共享在无法扩展额外数据或计算时改善学习的目标。  

#### 多语言建模  
研究模型如何在多样化的语言分布和数据稀缺条件下进行泛化,在多语言环境中尤为重要。一个未解决的问题是:跨语言的性能差异是反映了模型或数据偏差,还是源于特定的语言属性(Mielke et al. 2019,[链接](https://arxiv.org/html/2609.11505#bib.bib40);Poelman et al. 2025,[链接](https://arxiv.org/html/2609.11505#bib.bib47);Shani et al. 2026,[链接](https://arxiv.org/html/2609.11505#bib.bib56))。多语言训练需要对数据混合(Ye et al. 2025,[链接](https://arxiv.org/html/2609.11505#bib.bib72))和跨语言优化(Wang et al. 2023,[链接](https://arxiv.org/html/2609.11505#bib.bib66))进行精心的设计决策。  

一方面研究表明,在语言属性相似的语言之间迁移最为有效(Pires et al. 2019,[链接](https://arxiv.org/html/2609.11505#bib.bib46);K et al. 2020,[链接](https://arxiv.org/html/2609.11505#bib.bib30);Snæbjarnarson et al. 2023,[链接](https://arxiv.org/html/2609.11505#bib.bib60));另一方面的研究则认为,相似性可能不如匹配训练信号的信息复杂度重要(Lee et al. 2026,[链接](https://arxiv.org/html/2609.11505#bib.bib33))。BabyLM 挑战赛提供了一个受控环境,用以检验结构迁移能否支持异构分布的学习。  

### 2.2 权重初始化与归纳偏置  
在神经语言模型中,归纳偏置不仅可以通过架构引入,还可以通过模型参数状态引入。经典的初始化方案使用随机权重,配合精心选择的缩放系数来打破对称性并稳定激活值和梯度(Rumelhart et al. 1986,[链接](https://arxiv.org/html/2609.11505#bib.bib53);Glorot and Bengio 2010,[链接](https://arxiv.org/html/2609.11505#bib.bib19);He et al. 2015,[链接](https://arxiv.org/html/2609.11505#bib.bib20))。虽然这些方案不编码特定任务的结构,但它们塑造了优化的初始条件。  

结构预训练扩展了这一思想:模型不必仅依赖随机初始化,而可以先在一个受控信号上训练,该信号可能诱导出对后续语言学习有用的表征(Papadimitriou and Jurafsky 2023,[链接](https://arxiv.org/html/2609.11505#bib.bib45);Hu et al. 2025,[链接](https://arxiv.org/html/2609.11505#bib.bib24);Lee et al. 2026,[链接](https://arxiv.org/html/2609.11505#bib.bib33))。  

### 2.3 结构迁移  
我们将结构迁移视为一个总称,涵盖了课程学习、迁移学习、元学习和预预训练等紧密相关的概念。在元学习中,跨相关任务的先前训练支持快速适应;在课程学习中,样本按序排列,使简单数据为模型处理更复杂的情况做好准备;在迁移学习中,来自源任务或语言的知识为零样本性能或目标任务微调提供了有用的起点(Wang et al. 2021,[链接](https://arxiv.org/html/2609.11505#bib.bib65);Lee et al. 2022,[链接](https://arxiv.org/html/2609.11505#bib.bib32);Soviany et al. 2022,[链接](https://arxiv.org/html/2609.11505#bib.bib61))。  

在结构数据上的预预训练(Papadimitriou and Jurafsky 2020,[链接](https://arxiv.org/html/2609.11505#bib.bib44);Hu et al. 2025,[链接](https://arxiv.org/html/2609.11505#bib.bib24);Lee et al. 2026,[链接](https://arxiv.org/html/2609.11505#bib.bib33);Jiang et al. 2026,[链接](https://arxiv.org/html/2609.11505#bib.bib26))结合了这些方法的特点。它引入了一个更早的训练阶段,通常在结构化的非语言数据上进行,以诱导出对后续语言训练有用的初始化。因此,相关的问题不仅是结构数据是否可以被学习,更是诱导出的参数状态是否有利于自然语言训练。  

#### 实证发现  
结构数据在熵、分布形状、组合性、层次结构及其他规律性方面可能存在差异,这可能会诱导出不同的偏差。先前研究得出了关于其益处的不一致结论。在抽象语法(如 PCFG)上的训练可以产生功能性的层次表征(Jumelet and Zuidema 2023,[链接](https://arxiv.org/html/2609.11505#bib.bib29);Rohweder et al. 2026,[链接](https://arxiv.org/html/2609.11505#bib.bib51)),但下游任务的可比性并不总是成立:Hu et al.(2025,[链接](https://arxiv.org/html/2609.11505#bib.bib24))报告了在 BLIMP 上有限的增益,而 Lee et al.(2026,[链接](https://arxiv.org/html/2609.11505#bib.bib33))更关注推理基准。结构源数据的哪些特性会与目标语言数据相互作用,以及它们如何影响评估任务的性能,仍然是一个未解的问题。因此,我们考察了一系列具有不同程度抽象性、局部和全局依赖关系的结构数据类型。在我们的设置中,元胞自动机提供基于局部规则的动力学,合成文法贡献层次和组合结构,音乐提供具有长程依赖的序列结构,而蛋白质则提供生物学复杂性。  

## 3 数据  
实验设置包括两个阶段的语言模型训练。阶段 I,我们在一种结构数据类型上从零开始训练模型。阶段 II,我们切换到在目标语料库上训练。  

### 3.1 结构数据  
在阶段 I,我们探索四种结构数据类型:合成文法、元胞自动机、音乐和蛋白质序列。作为基线,我们使用随机数字的无结构序列。  

#### 合成文法  
概率上下文无关文法(PCFG)是一种形式文法,其中非终结符的产生规则对上下文不敏感(Manning and Schütze 2000,[链接](https://arxiv.org/html/2609.11505#bib.bib37))。每个产生规则以一定概率被应用,使得这些合成文法适合随机采样各种各样的合成数据。所创建的 PCFG 通过从 Penn Treebank(Marcus et al. 1993,[链接](https://arxiv.org/html/2609.11505#bib.bib38))合成语法规则来模仿自然语言,详见附录 A([链接](https://arxiv.org/html/2609.11505#A1))。我们测试了两个由相同文法生成的合成数据集,仅在词汇化方面不同:对于 `PCFGZipf`,词元遵循齐普夫分布;对于 `PCFGuni`,词元均匀分布。  

#### 元胞自动机(CA)  
元胞自动机是一排单元格,每个单元格处于离散状态。这一排在时间上演化,基于局部*转换规则* ff 定义了一组更新模式。在每个时间步,每个单元格根据自身及其两个邻居的状态进行更新。元胞自动机是自组织复杂性从简单、确定性规则中涌现的典型例子(von Neumann and Burks 1966,[链接](https://arxiv.org/html/2609.11505#bib.bib64);Gardner 1970,[链接](https://arxiv.org/html/2609.11505#bib.bib18);Wolfram 1983,[链接](https://arxiv.org/html/2609.11505#bib.bib71))。训练目标要求模型从多样化的模式中推断这些规则,使得元胞自动机成为学习功能性能力的有力来源。附录 B([链接](https://arxiv.org/html/2609.11505#A2))提供了可视化和技术细节。  

为了评估结构复杂度的影响,我们生成了两个数据集变体:`CA16`(中等复杂度动力学,`K=16`)和 `CA256`(嘈杂动力学,`K=256`),每个变体由约 1,820 条规则生成,每条规则有多个初始条件。语言模型将这些时空轨迹作为连接的行接收。在训练中,语言模型必须基于不同初始条件生成的若干轨迹来推断转换规则,以成功进行下一词元预测。  

#### 音乐  
音乐是人类产生的高度结构化的非语言信号。我们使用来自 Aria-MIDI 数据集(Bradshaw and Colton 2025,[链接](https://arxiv.org/html/2609.11505#bib.bib8))的钢琴音乐。训练时,语言模型接收音符事件、时序和踏板状态的转录,作为整数的扁平序列,详见附录 C([链接](https://arxiv.org/html/2609.11505#A3))。

相似文章

大语言模型中的语言习得装置

arXiv cs.CL

本文提出了一种受LAD启发的预预训练方法,使用一种名为MP-Struct的形式语言,该语言编码了类自然语言结构。研究表明,这种方法提高了token效率,并赋予了模型类似人类的对结构不合理语言的抵抗力,挑战了先前关于有效预预训练语言的假设。

量化语言模型蒸馏中的潜意识行为迁移比率

arXiv cs.LG

本文量化了语言模型蒸馏中潜意识行为迁移的程度,表明即使使用良性训练数据,不良特征也能稳健地从教师模型迁移到学生模型,并且迁移在不同模型族中表现出不同的规模。

论词汇性在大语言模型中的持续影响

arXiv cs.CL

本文研究了词汇重叠(而非语义内容)如何影响跨层和跨架构的大语言模型表示,并证明即使在为语义相似性训练的模型中,这种词汇效应依然存在,导致下游任务性能下降。

语言模型中跨语言泛化的体外研究

arXiv cs.CL

本文引入了一个使用两种程序生成语言的体外框架,用于研究语言模型中的跨语言泛化,发现分词对可复用子结构的保留能力对于跨语言能力迁移比词汇相似性或数据平衡更为关键。

语言再生:信息局部性对重建影响的探究

arXiv cs.CL

本文研究了在不可能语言(信息局部性被破坏)上预训练的GPT-2模型如何恢复自然英语,显示出对更短依赖长度的偏好以及结构恢复与表层恢复之间的分离。