儿童在词汇学习中显示加速回报,语言模型则无

arXiv cs.CL 论文

摘要

研究表明,儿童在词汇学习中表现出加速回报,而语言模型则表现出恒定的比例回报,这解释了人类与AI之间训练效率的数据差距。

arXiv:2608.17120v1 Announce Type: new 摘要: 儿童在生命的头几年学习数百个单词,这个过程开始时缓慢,但很快加速。先前的模型将词汇增长描述为随时间积累的证据。我们在这里表明,这个过程最好被描述为加速积累:儿童从每增加的一个语言经验单位中学到的东西比前一个单位更多。与儿童相反,语言模型——即使是在面向儿童的语音上训练的——并不加速。相反,它们对新数据表现出恒定的比例回报,这与扩展定律一致。儿童使用的训练数据比语言模型少许多数量级;他们对学习输入的日益高效利用是一个可能的解释。
查看原文
查看缓存全文

缓存时间: 2026/08/19 09:49

# 儿童词汇学习存在加速回报现象,语言模型则无  
来源:https://arxiv.org/html/2608.17120  

###### 摘要  
儿童在生命最初几年学习数百个单词的过程,初期进展缓慢但随后迅速加速。过往模型将词汇增长描述为随时间推移的经验积累。本研究表明,该过程的最佳特征化应为*加速累积*:儿童从每单位新增语言经验中学到的内容多于前一单位。与儿童不同的是,语言模型——即使在儿童定向语音上训练——并未加速,而是表现出与缩放定律一致的恒定比例回报。儿童使用的训练数据比语言模型少多个数量级;其日益高效地利用学习输入的能力或可解释这一差异。  

儿童语言在早期发展迅猛*1,2*,而表达性词汇的“爆发”是人类认知发展的标志性成就*3,4*。为此过程提供量化描述是重要的科学目标*5-9*,但直到近期,语言习得研究仅限于人类学习者。然而,语言模型(LMs)展现出日益提升的语言复杂度,使其可成为研究人类语言的模型系统*10,11*。最成功的语言模型与人类学习者存在一个关键差异:其训练所用的数据量远超儿童时期人类学习者所接触的数据。即使是开源模型通常也在万亿词级数据上进行训练*12*,而儿童每月接收的输入词量约为10万至100万词,三岁前累计约3000万至4000万词*13,14*。  

为何模型需要多出数个数量级的训练数据才能获得基本的语言能力?本研究通过比较儿童与语言模型中词汇量随训练数据的变化,探讨这一“数据鸿沟”。词汇量是理想的比较目标,因为儿童产出的总词汇量既是表达能力的重要指标,也与语法发展及早期语言其他方面紧密相关*1,15*。同龄儿童的词汇量差异显著*1*,而相对词汇量可预测后期学业表现*16,17*。采用父母报告表《麦克阿瑟-贝茨沟通发展量表》(CDIs)的大规模纵向词汇数据集,使我们能够描述年幼儿童的词汇增长特征*1,18,19*。  

我们比较了儿童与语言模型中词汇量随输入数据的增长方式。首先构建儿童词汇增长的心理测量模型(“加速累积器”),该模型能较好拟合跨儿童的群体差异。该模型表明,儿童对词汇的证据积累——不仅是观察到的词汇量——在幼儿期呈加速态势。这种加速导致语言经验带来的学习“回报”递增:相同经验在发展后期的作用更大。与儿童相反,语言模型未表现出加速:它们对新增数据呈现恒定比例回报。这一分析揭示了语言模型与儿童的关键差异,并为二者的后续研究指明了新方向。  

## 词汇增长的加速累积模型  
近期模型将儿童词汇增长描述为累积过程*8,9,20,21*。每个独立词形可视为一个“容器”,每次语言输入的词元则为落入对应容器的“水滴”。当容器装满时,该词即被习得*9,20*。累积器模型常用于提取“容器容量”的可解释差异,通常基于词的具体性、句法类别等属性*8,9*。它们也为广泛观察到的“词汇突增”现象提供了分级解释*20,22,23*。  

儿童的*观察词汇量*(按数量计)随年龄超线性增长*1,18*,但此定性模式与多种潜在机制一致*20*。我们构建了一个基于真实单位比例变量的累积器模型:每小时听取的词数(词元)与儿童词汇总量(词形)*9*。这些变量均存在真零点,可进行对数变换,这对捕捉其发展过程中的增长形态至关重要*24,25*。  

该累积器可表述为心理测量学的拉斯克模型*26*,假设每个儿童ii具有学习能力θi\\theta_{i},每个词jj具有难度δj\\delta_{j}。111先前研究侧重于估计单个词的属性*8,9,27*,揭示词难度存在可预测信息,但词间差异仅小部分由词频信息承载。词汇对儿童习得难易的差异源于词义的复杂性与具体性、句法类别与句法语境、语音及其他多因素。本研究中,我们将词难度作为自由参数估计,转而聚焦儿童个体差异。  

儿童ii产出词jj的概率为:  
P⁡\(wi,j=1∣θi,δj\)=exp⁡\(θi−δj\)1\+exp⁡\(θi−δj\)。  

我们将儿童能力描述为:  
θi\(t\)=ξi\+κilog⁡\(t/a0\)\+log⁡\(H\)。  

此表达式包含三项:描述儿童基线学习效率的截距ξi\\xi_{i};描述发育时间t(相对锚点a0\\alpha_{0})累积速率的加速项κilog⁡\(t/a0\)\\kappa_{i}~\log(t/a_{0});以及累积发生的常醒时长常数HH。该模型属于“加速累积器”模型,其中语言累积在发展后期“作用更大”;κ\\kappa是描述发育缩放的关键指数。  

相比之下,κ=1\\kappa=1的累积器表示为:  
θi\(t\)=ξ\+log\(t/a0\)\+log\(H\)。  

此“纯累积器”产生经验的线性回报,而κ>1\\kappa>1则显示加速。在κ=1\\kappa=1时,填充容器的“水滴”大小在发育全程保持恒定;若κ>1\\kappa>1,后期“水滴”则更大。我们假设儿童在累积效率ξi\\xi_{i}与加速率κi\\kappa_{i}上均存在个体差异,构建了纵向增长模型的变体,其中儿童在斜率与截距上各有不同*28*(图1A)。  

该模型与*8*和*9*的公式接近,但尚未被提出(补充文本)。  

## 累积器模型拟合  
CDIs是广泛使用、可靠且有效的方法,可深度考察儿童早期词汇*1,18,19*。我们的分析依赖于个体词级的纵向CDI数据。词汇总分无法估计词难度δ\\delta,横断面数据无法进行模型识别(图S1)。因此,我们使用接受三次及以上纵向测评的儿童的项目级纵向数据分析报告产出能力,其测量年龄范围更广且通常比报告理解能力更可靠*1*。  

我们使用来自Wordbank的五个单语、正常发育儿童纵向数据集(年龄8-36个月;三个为美式英语,另各一个为挪威语和日语,Ntotal=1841\\text{N}_{\text{total}}=1841;见图S2与表S1)*29*。通过贝叶斯推断将加速累积模型(M3)拟合至各数据集。为检验各模型组件的必要性,我们额外拟合三个消融模型:去除加速个体差异(无κi\\kappa_{i};M2)、去除效率个体差异(无ξi\\xi_{i};M1),以及完全去除加速(无κ\\kappa;M0)。  

加速累积模型对儿童增长轨迹拟合最佳(图1B,见表S2),项目级预期对数预测密度显著优于次优模型(所有五个数据集LOO ELPD>760>760)。事实上,M3拟合结果与基于非参数GAMLSS贝塔回归(用于生成CDI量表百分位常模的灵活模型类*19*)的曲线高度吻合(图S3)。  

所有数据集的加速估计值均较高,稳健拒绝纯累积器假设(κ=1\\kappa=1):范围10.6 [10.5, 10.8]至13.3 [13.2, 13.3]。使用更大数据集及跨数据集分层模型时,κ\\kappa估计值基本不变(表S5)。2PL IRT模型拟合更优,但κ\\kappa估计值仍远高于纯累积器,且词级习得年龄估计相似(表S8);CDI量表项目选择对κ\\kappa估计的影响极小(图S4)。线性(而非对数)增长模型拟合未改善(表S7)。  

变异性是早期语言的普遍特征*1,2*。跨儿童加速标准差σb\\sigma_{b}在五个样本中范围为3.2至6.6;拟合的群体分布显示99.5%儿童高于κ=1\\kappa=1的纯累积器值。尽管群体拟合显示显著的斜率差异,典型CDI序列过于稀疏,无法可靠预测个体儿童的加速度(超出群体均值)(图S5及表S3、S4、S9)。然而,当有五个或以上前期CDI数据时,增加群体加速参数在91.9%儿童中改善了个体轨迹预测。  

图1:加速累积模型提供了词汇增长的心理测量模型,描述了跨数据集与语言的儿童词汇学习。(A)潜在能力(θ\\theta)空间的模型预测,以及通过逻辑斯谛项目反应模型投射至产出词汇(CDI)空间的预测。同时绘制了纯累积器(κ=1\\kappa=1,虚线)与加速累积器的预测。更高的效率(ξ\\xi)提升曲线水平,而更高的加速(κ\\kappa)使曲线扇形展开。(B)五个纵向数据集中各儿童的观测轨迹(灰色),以及基于拟合模型逐儿童参数计算的分位数(M2与M3的彩色百分位带;M0与M1的黑色线条,无个体差异)。  

## 加速累积意味着后期习得词汇所需暴露次数更少  
图2:在加速累积模型下,习得一个词所需的暴露次数随年龄增长而减少。图表显示词汇估计累计暴露次数,按三个英语数据集中50%儿童被估计产出该词的年龄绘制。子图展示不同词类,实线与虚线分别表示加速(M3)与纯累积器(M0)模型的简单线性拟合;灰色点显示所有词类中词汇的完整分布。加速累积模型捕捉到语言习得的一个显著事实:习得词汇所需的暴露次数随儿童发展急剧减少。幼儿可能在说出“book”前已听过数千次;几年后学龄前儿童可能在动物园之旅中仅听几次“ibex”便在次日复述。  

为量化此现象,我们基于拟合模型计算每个词的习得年龄(AoA)AA,定义为50%儿童产出该词时的年龄——即儿童能力与词难度平衡点:A⁡\(j\)=a0exp⁡\(\(δj−log⁡H−μξ\)/κ\)。然后基于儿童言语转录稿*30*,我们估计个体儿童的每个词的累计词频。图2展示了加速累积器模型中累计暴露次数与习得年龄的关系。在每个词类内(如名词、动词与功能词),习得前经历的示例数量随发展呈指数下降。222该分析可能低估了效率变化程度,因假设每次词汇暴露信息量等同。实际上,单次暴露的信息量差异显著,有时词汇是被旁听而非直接指向儿童,或缺乏清晰推理的物理语境*21,31*。  

相比之下,拟合的纯累积器预测的下降幅度远小于实际;它无法重现观察到的习得年龄范围,预测许多早期习得词汇直至青春期仍未习得(图S7与表S10)。  

## 语言模型未呈现加速  
图3:语言模型(LMs)的词汇增长未显示加速。(A)儿童(逐儿童,英语与挪威语)与语言模型(逐词)的加速指数κ\\kappa密度分布。(B)儿童与语言模型的加速(kappa)差异。数字显示变异系数及95%置信区间。(C)儿童与语言模型的训练比例回报(损失减少量与超额损失之比)。蓝线为语言模型轨迹;红线为儿童M3拟合模型轨迹。深红色突出显示三个儿童,水平不确定带表示其输入校准的+/- 1标准差。仅逻辑斯谛习得可能因天花板效应产生比例回报增加;其渐近线为1(灰色虚线)。  

语言模型是否表现出与儿童相同的加速特征与变异性?为评估此问题,我们首先在大语言模型的著名“缩放定律”*32*与我们提出的词汇增长模型之间建立联系。神经网络语言模型在数据规模DD上的损失LL为L=E+BDβL=E+\frac{B}{D^{\beta}},其中B\\text{B}与β\\beta为幂律自由参数,E\\text{E}为建模文本的熵*32*。此幂律缩放行为可能源自一组独立学习的“量子”,其自身呈幂律分布*33*;自然语言词汇遵循此类幂律,可能是潜在的量子类型。  

为追踪语言模型中个体词的涌现,我们对训练过程中惊讶度值(个体词的负对数概率)的轨迹拟合S型曲线(参照*34*)。这些S型曲线提供了与儿童拉斯克模型逻辑斯谛曲线的关联。每个词的S型曲线斜率与我们加速参数κ\\kappa单位相同——它捕捉该词证据随训练数据累积的速率。我们在CHILDES档案*10*中训练的GPT-2模型*35*上计算了这些斜率的分布。

相似文章

AI并不比婴儿更聪明——尚未

Wired

一项新的基准测试EgoBabyVLM挑战AI视觉语言模型,要求它们从婴儿头戴摄像头拍摄的视频中学习,结果显示当前的AI模型无法匹敌婴儿的学习效率,并表明类似婴儿的学习架构可能带来更高效的AI。

The Download:儿童超越AI学习,及太空旅行代理

MIT Technology Review

本文突出了儿童在学习上超越AI模型的数据效率差距,探讨了缩小这一差距的研究,并涵盖了太空旅行中的新兴职业,以及其他科技发展,如AI数据中心的反对和人形机器人的记录。

当多反而少:语言模型中位置相关的重复效应

arXiv cs.CL

本文表明,语言模型中的重复效应取决于读取位置:相邻重复会提高目标概率,而移位重复则产生倒U形曲线。这一发现挑战了完形填空式探测中的假设,并在多个模型和语言中得到了验证。