大语言模型中的语言习得装置
摘要
本文提出了一种受LAD启发的预预训练方法,使用一种名为MP-Struct的形式语言,该语言编码了类自然语言结构。研究表明,这种方法提高了token效率,并赋予了模型类似人类的对结构不合理语言的抵抗力,挑战了先前关于有效预预训练语言的假设。
arXiv:2605.16758v1 公告类型: 新
摘要:大型语言模型(LLMs)的数据效率仍然远低于人类。先前的工作提出在合成语言上进行预预训练(PPT)以缩小这一差距,其中强调高度表达性的形式语言,例如$k$-Shuffle Dyck。受语言习得装置(LAD)假说的启发——该假说认为先天约束会提前将学习者的假设空间限制为类自然语言结构——我们提出了受LAD启发的PPT:在MP-STRUCT上进行预预训练,这是一种形式语言,其字符串通过MERGE、AGREE和MOVE编码层次组合、基于特征的依赖和长距离位移。仅500步的MP-STRUCT PPT在token效率上与强大的形式语言基线相当,同时还赋予了模型类似人类的、对结构不合理语言(如REVERSE)的抵抗力。通过分析简化变体,我们发现MP-STRUCT CORE优于$k$-Shuffle Dyck,尽管它无法在C-RASP(Transformer表达能力的形式界限)中定义,这挑战了先前的假设,即有效的PPT语言必须既具有层次表达性又具有电路理论可学习性。我们表明,功能标志(减少依赖解析歧义)是一个关键驱动因素,这表明有效的PPT设计不仅取决于表达性,还取决于依赖解析的可及性。
查看缓存全文
缓存时间: 2026/05/19 06:35
# 大语言模型中的语言习得机制
来源:https://arxiv.org/html/2605.16758
Masato Mita Taiga Someya Ryo Yoshida Yohei Oseki 东京大学 \{mita, tsomeya, yoshiryo0617, oseki\}@g.ecc.u-tokyo.ac.jp
###### 摘要
大语言模型(LLM)在数据效率上仍然远低于人类。针对合成语言的预预训练(PPT)已被提出以缩小这一差距,先前工作强调高度表达性的形式语言,如 kk-Shuffle Dyck。受*语言习得机制(LAD)*假设的启发——该假设认为先天约束能预先将学习者的假设空间限制为自然语言类结构——我们提出*LAD 启发式 PPT*:对 MP-Struct 进行预预训练,这是一种形式语言,其字符串通过 Merge、Agree 和 Move 操作编码层次组合、基于特征的依赖和长距离移位。仅 500 步的 MP-Struct PPT 在词元效率上与强大的形式语言基线持平,同时还赋予模型对结构上不可信语言(如 Reverse)具有类似人类的抵抗力。通过分析简化变体,我们发现 MP-Struct Core 的表现优于 kk-Shuffle Dyck,尽管它无法在 C-RASP(Transformer 表现力的形式界限)中定义,这挑战了先前关于有效 PPT 语言必须同时具有层次表达性和电路可学习性的假设。我们表明,*功能地标*(可减少依赖消解歧义)是关键驱动因素,这表明有效的 PPT 设计不仅取决于表现力,还取决于依赖消解的可及性。
大语言模型中的语言习得机制
Masato Mita Taiga Someya Ryo Yoshida Yohei Oseki
东京大学
\{mita, tsomeya, yoshiryo0617, oseki\}@g.ecc.u-tokyo.ac.jp
## 1 引言
大语言模型(LLM)展现出与人类相当的一般语言能力;然而,它们的语言习得效率仍然远逊于人类。虽然人类能从有限的文本中习得语言,但 LLM 通常需要数量级更大的数据才能达到强大性能 Warstadt 等 (2023 (https://arxiv.org/html/2605.16758#bib.bib108))。这一差距表明,当前的 LLM 依赖从一个过度宽泛的假设空间中进行学习 Yun 等 (2020 (https://arxiv.org/html/2605.16758#bib.bib9)),这为通过更好的归纳偏置来提升学习效率留下了很大空间。
Hu 等 (2025 (https://arxiv.org/html/2605.16758#bib.bib47)) 最近的工作探索了*预预训练 (PPT)*,即在标准预训练之前,先让模型在合成序列上进行训练,以获取有用的结构偏置。他们表明,像 kk-Shuffle Dyck 这样高度表达性的形式语言,可以通过锻炼模型处理层次依赖的能力来提升词元效率。他们进一步通过*表现力假说*来解释这些结果,该假说认为,赋予有益归纳偏置的形式语言应具有层次结构(在*乔姆斯基层级* Chomsky (1959 (https://arxiv.org/html/2605.16758#bib.bib1)) 意义上,即上下文无关或上下文有关),并且能在 C-RASP Yang 和 Chiang (2024 (https://arxiv.org/html/2605.16758#bib.bib24)) 中定义,后者是 Transformer 电路复杂度的形式度量。
然而,此类形式语言优先考虑抽象的结构复杂性,往往缺乏自然语言特有的关键属性。这引发了一个问题:除了乔姆斯基层级复杂度和电路复杂度之外,自然语言类属性(例如基于固定层次结构的依赖)是否也有助于有效的 PPT?在本文中,我们从互补的角度探讨这个问题。受*语言习得机制 (LAD)* 假设 Chomsky (1965 (https://arxiv.org/html/2605.16758#bib.bib103)) 的启发——该假设认为先天结构约束能限制假设空间并偏向自然语言类结构——我们提问:将此类约束融入合成序列是否能进一步提升学习效率。在此思路指导下,我们设计了 MP-Struct,这是一个从*最简方案 (MP)* 中汲取灵感的合成生成器,它产生的序列中依赖被嵌入固定的层次结构,而非自由交织。
我们在 Pythia-1B Biderman 等 (2023 (https://arxiv.org/html/2605.16758#bib.bib43)) 上评估了 LAD 启发式 PPT。仅 500 步的 MP-Struct PPT 阶段持续地提升了从零开始训练的词元效率,并与基于 kk-Shuffle Dyck 等强形式语言基线的性能相当。此外,由此产生的模型展现出方向不对称的归纳偏置:与 kk-Shuffle Dyck 相比,MP-Struct 对方向反转的序列表现出更强的抵抗力,这与 LAD 启发式设计目标——偏好自然语言类方向结构——一致。
为了更深入地理解这些效应,我们分析了生成器的简化变体。值得注意的是,MP-Struct Core(我们生成器的理想化抽象)在效率上超越了 kk-Shuffle Dyck,尽管它无法在 C-RASP(对未来的掩码 soft attention Transformer 表现力的形式下界)中定义。这一观察无法被表现力假说完全解释,该假说预测有效的 PPT 语言应具有层次结构且能在 C-RASP 中定义。我们的分析指向了一个互补因素:*依赖检索的可及性*。虽然纯粹通过括号层次结构(如 kk-Shuffle Dyck)编码依赖的结构定义了有效依赖,但它们可能留下多个可能的先行语,从而导致更高的检索歧义。相比之下,MP-Struct 和 MP-Struct Core 引入了明确的结构线索——*功能地标*——这使得依赖更易于定位,从而减少了基于注意力模型的有效搜索成本。我们假设这些可及性差异促成了观察到的效率提升。更广泛地说,这表明有效的 PPT 设计可能不仅取决于形式表现力,还取决于结构信息如何组织以支持高效的依赖检索。
## 2 相关工作
### 2.1 LAD/UG 与最简方案
语言习得中的一个长期挑战是解释儿童如何从相对有限且有噪声的输入(常称为*刺激贫乏*) 中收敛到丰富的语法能力 Chomsky (1965 (https://arxiv.org/html/2605.16758#bib.bib103)); Clark 和 Lappin (2011 (https://arxiv.org/html/2605.16758#bib.bib86))。LAD 假设通过提出学习者天生具有普遍语法 (UG)——一套严格限制可能语法假设空间的物种特有约束——来弥补这一缺口。从这个角度看,UG 提供了强大的先天归纳偏置,先验地过滤掉“非人类类”的假设。
在当代生成语法中,*最简方案 (MP)* 通过力求将语言的计算机制最小化为一套少量操作来精炼 LAD/UG 模型 Chomsky (1995 (https://arxiv.org/html/2605.16758#bib.bib2), 2000 (https://arxiv.org/html/2605.16758#bib.bib3), 2001 (https://arxiv.org/html/2605.16758#bib.bib4))。该框架的核心是*Merge*,一种构建层次结构的组合操作。此外,*Move*(移位)和*Agree*(特征赋值)等操作通常被认为在依赖形成和形态句法许可中发挥作用 Chomsky (2000 (https://arxiv.org/html/2605.16758#bib.bib3), 2001 (https://arxiv.org/html/2605.16758#bib.bib4))。
### 2.2 基于合成结构的预预训练
**算法 1** 数据生成过程 (MP-Struct)
记号:\(\mathcal{L}\): 词库,\(V/N/D\): 词汇类别,\(vP\): 动词短语,\(T/C\): 功能核心,\(t\): 语迹,\(iNum/uNum\): 数特征,\(wh \in \{+,-\}\)。
1: **输入**:词库 \(\mathcal{L}\),参数 \(\theta\)
2: **输出**:词元序列 \(S\)
3: **步骤 1:通过 Merge 构建基础结构**
4: 采样词汇项 \(V, D_1, D_2, N_1, N_2 \sim \mathcal{L}\)
5: \(DP_{subj} = \text{Merge}(D_1, N_1)\), \(DP_{obj} = \text{Merge}(D_2, N_2)\)
6: \(V' = \text{Merge}(V, DP_{obj})\); \(vP = \text{Merge}(DP_{subj}, V')\)
7: // 产生带有主语和宾语的层次短语结构
8: **步骤 2:功能结构与 Agree**
9: 为 \(DP_{subj}\) 分配数特征 \(iNum \in \{sg, pl\}\)
10: 创建 \(T[uNum]\) 并与 \(vP\) 合并
11: 通过 \(\text{Agree}(T, DP_{subj})\) 设置 \(uNum \leftarrow iNum\)
12: 形成 \(TP = [TP\; DP_{subj}\; T[uNum]\; vP]\)
13: // 产生结构中编码的主谓一致依赖
14: **步骤 3:Move (依赖编码)**
15: 将 \(DP_{subj}\) 复制到分句起始位置
16: 用语迹替换其原始位置:\(t_{subj}\)
17: 形成 \(TP = [TP\; DP_{subj}\; T\; [vP\; t_{subj}\; [V'\; V\; DP_{obj}]]]\)
18: 采样 \(wh \in \{+,-\}\)
19: 将 \(C[wh]\) 与 \(TP\) 合并
20: **if** \(wh = +\) **then**
21: 在 \(TP\) 中选择一个 \(DP\) 并标记为 \(DP_{wh}\)
22: 将 \(DP_{wh}\) 复制到分句起始位置
23: 用语迹 \(t_{wh}\) 替换其原始位置
24: 形成 \(CP = [CP\; DP_{wh}\; C\; [TP\; ...\; t_{wh}\; ...]]\)
25: **end if**
26: // 产生移位元素与其语迹之间的长距离依赖
27: **步骤 4:线性化**
28: 前序遍历树
29: 输出括号、非终结符标签、特征和语迹
30: 移除词汇终结符 (\(V, N, D\))
31: // 产生不包含词汇内容的编码结构关系的词元序列
基于合成结构的预预训练 (PPT) 已成为语言模型的一种新学习范式。现有研究报告称,在具有层次结构的数据(如 MIDI 音乐、编程语言或特定形式语言)上通过下一词元预测训练模型,可以赋予有用的归纳偏置,从而提升后续自然语言学习的效率 Papadimitriou 和 Jurafsky (2020 (https://arxiv.org/html/2605.16758#bib.bib21)); Ri 和 Tsuruoka (2022 (https://arxiv.org/html/2605.16758#bib.bib25)); Papadimitriou 和 Jurafsky (2023 (https://arxiv.org/html/2605.16758#bib.bib26))。
最近,Hu 等 (2025 (https://arxiv.org/html/2605.16758#bib.bib47)) 通过引入*表现力假说*推进了这一范式,该假说认为,赋予有益归纳偏置的形式语言应具有层次结构——要么是上下文无关,要么是上下文有关——并且能在 C-RASP Yang 和 Chiang (2024 (https://arxiv.org/html/2605.16758#bib.bib24)) 中定义。然而,虽然 Hu 等人的方法成功锻炼了模型的一般计算能力,但它主要关注抽象的结构表现力,而非自然语言特有的属性。例如,kk-Shuffle Dyck 纯粹通过括号匹配规则定义依赖,允许灵活的交叉模式,但缺乏自然语言中通常观察到的不对称、核心驱动的组织。这引发了一个问题:将更多自然语言类的结构属性融入合成序列是否能产生更有效的归纳偏置。
在本文中,我们以 LAD/UG 视角为动机:我们不是推导形式语法,而是将这些操作所假设编码的结构属性——层次组合、基于特征的依赖和长距离移位——操作化为明确的序列级模式,用于 PPT 设置。
## 3 方法
LAD 启发式 PPT 的目标是在标准预训练开始之前,注入一种主动将模型假设空间限制为自然语言类结构的归纳偏置。为此,我们提出 MP-Struct,一个数据生成器,旨在产生*序列化的结构表示*——这些词元序列明确表示了假设底层自然语言的层次和依赖结构。该生成器并非旨在模拟自然语言本身,也不从形式语法推导序列。相反,它将三个结构属性——层次组合 (Merge)、基于特征的一致 (Agree) 和长距离移位 (Move)——操作化为抽象的序列级模式,去掉所有词汇内容。
MP-Struct 根据算法 1 (https://arxiv.org/html/2605.16758#alg1) 按以下步骤生成数据。
#### 步骤 1:通过 Merge 构建基础结构
我们从词库中采样词汇项,并使用 Merge 操作自底向上构建一个 vP。这个过程产生一个递归的层次结构——而非扁平序列——这构成了生成数据的结构骨架。
#### 步骤 2:功能结构与 Agree
我们引入一个带有不可解数特征 (uNum) 的功能核心 T,并为主语 DP 分配一个可解数特征 (iNum)。然后通过与主语的一致操作确定 uNum 的值。这一步在层次结构中编码了基于特征的依赖。
#### 步骤 3:Move (依赖编码)
我们通过将元素复制到更高结构位置并用语迹替换其原始出现来编码长距离依赖。具体来说,主语 DP 被复制到更高位置,形成复制元素与语迹之间的依赖。我们可选地引入一个带有二元 wh 特征的补语化成分 C;当 wh = + 时,选择一个 DP,复制到更高位置,并通过语迹连接到其原始位置。这些操作产生了跨越多个层次层级的结构化依赖。
#### 步骤 4:线性化
我们遍历派生树并输出一个序列,包含结构括号、非终结符标签、特征和语迹,同时省略词汇项。这种设计将结构信息与词汇内容分离:通过移除词汇词元,模型无法依赖表层共现模式,而是被鼓励直接处理层次结构和依赖关系。在预预训练背景下,这旨在鼓励模型独立于词汇语义获取语言动机的归纳偏置,这些偏置可能迁移到后续的自然语言预训练。
## 4 实验
我们测试通过 PPT 引入语言动机的归纳偏置是否能提升后续自然语言学习的效率。
### 4.1 实验设置
#### 模型与训练协议
我们遵循 Hu 等 (2025 (https://arxiv.org/html/2605.16758#bib.bib47)) 的分块学习范式,并使用 Pythia-1B Biderman 等 (2023 (https://arxiv.org/html/2605.16758#bib.bib43)) 作为基础模型。每次运行包括 (i) 可选的 PPT 阶段和 (ii) 自然语言预训练阶段。对于预训练 (PT),我们在 C4 Raffel 等 (2019 (https://arxiv.org/html/2605.16758#bib.bib19)) 上训练 25,000 个优化步骤。对于所有 PPT 条件,我们将合成 PPT 阶段的预算固定为 500 步,然后迁移参数以初始化标准 PT。所有实验均使用三个随机种子进行,并报告种子的均值。训练超参数的详细信息相似文章
大型语言模型能否模仿人类语音进行临床评估?基于LLM的数据增强方法用于认知评分预测
本文提出了一种基于大型语言模型的数据增强框架,利用GPT-5从书面锚点生成合成口语独白,用于从语音中预测认知评分。一种相似性引导的选择策略持续降低了预测误差,特别是对于少数低分参与者。
无语义的语法:教会大语言模型用未见过的语言编程
本文介绍了PyLang,一种在所有预训练语料库中都不存在的编程语言,并表明在其上微调的大语言模型可以学习语法但无法迁移算法推理,导致出现“实现忠实度差距”——模型理解算法但无法用不熟悉的语言表达它们。
理解大型语言模型
本章回顾了当前对大型语言模型的理解,讨论了它们的Transformer架构、类似人类认知的涌现能力,以及关于LLM是真正理解还是仅仅模拟理解的争论。
RLearner-LLM:通过混合直接偏好优化平衡大语言模型的逻辑基础与流畅性
本文介绍了RLearner-LLM,一个使用混合直接偏好优化(Hybrid-DPO)的框架,旨在平衡LLM生成解释的逻辑正确性和流畅性。该框架在多个领域和基础模型上实现了显著的NLI蕴含改进,同时减轻了标准偏好信号中的冗长偏差。
通过幂变换和保号分数聚合实现自适应特征保留的大语言模型结构化剪枝
本文提出了一种针对大语言模型的结构化剪枝方法,解决了在将非结构化剪枝技术适配到结构化剪枝时出现的分布不匹配、符号信息丢失和异常值影响等问题,在Llama-3-8B和Vicuna-v1.5-13B等模型上实现了相当精度,并获得了1.56-1.57倍的加速。