发展性方法揭示神经语言模型的统计学习:Transformer从最抽象的统计模式中泛化
摘要
本文采用发展性方法研究神经语言模型(特别是Transformer)如何从人工语法中学习统计模式,发现它们首先获取全局抽象统计信息,然后学习局部依赖关系,并在早期出现过度泛化。
arXiv:2606.27460v1 公告类型:新
摘要:在本研究中,我们采用发展性方法探究神经语言模型(NLM)的统计学习与心理表征。我们在一系列生成式Transformer模型上使用人工语法进行训练。在训练过程中,我们在多个阶段保存模型状态。通过分析这些模型在发展阶段中内部表征的变化,我们发现NLM在学习初期获取最抽象的全局统计知识,随后学习相对局部的统计依赖关系。这一学习路径从一开始就包含许多过度泛化,这些过度泛化在学习后期逐渐受到约束。基于这一观察,我们提出了一个新的框架来解释NLM的统计学习与语言认知。
查看缓存全文
缓存时间: 2026/06/29 05:22
# 发展性方法揭示神经语言模型的统计学习:Transformer从最抽象的统计模式中泛化 来源:https://arxiv.org/html/2606.27460 王博俊 牛津大学教育系 关于本文的通讯应寄给王博俊,牛津大学教育系。Elizabeth Wonnacott 牛津大学教育系 ## 摘要 在本研究中,我们采用发展性方法来探究神经语言模型(NLM)的统计学习与心理表征。我们在一组合成语法上训练了一系列生成式Transformer模型,并在训练过程中的多个阶段保存模型状态。通过分析这些模型内部表征在发展路径上的变化,我们发现NLM在学习初期最先获取最抽象的全局统计知识,随后才习得相对局部的统计依赖关系。这一学习路径从一开始就包含大量过度泛化,而这些过度泛化会在学习后期逐渐受到约束。基于这一观察,我们提出了一个新的框架来解释NLM的统计学习与语言认知。 ## 1 引言 神经语言模型的认知科学是一个新兴的研究领域。该领域的研究致力于用概念和数学术语为NLM的心理(内部)表征提供描述性理论(Kallens等人,2023;Futrell & Mahowald,2025;Hardy等人,2023;Hofmann等人,2025;Linzen等人,2016;Wei等人,2021)。也就是说,什么样的知识使得NLM能够具备人类水平的语言能力,甚至衍生出推理能力和逻辑。 为了解释NLM的语言认知,许多研究考察了NLM如何将标记(token)组合成有意义的序列,即句法。来自生成语言学传统的研究者广泛探讨了NLM是否具有句法解析树的表征(Ahuja等人,2024;Futrell等人,2019;Hewitt & Manning,2019;Kim & Smolensky,2021;Lakretz等人,2021;Murty等人,2023)。这些研究者假设,使NLM能够生成有意义序列的表征是由词类(POS)范畴及其组合规则构成的。另一派来自功能背景的研究者则假设表征是以语法构式(grammatical constructions)的形式存在的(Li等人,2022;Li & Liu,2025;Weissweiler等人,2023a,2023b)。构式是一种将表面语法形式与意义关联起来的语法图式(Croft & Cruse,2004;Goldberg,1995,2019;Haspelmath,2008;Hilpert,2019;Müller,2017)。例如,双及物构式将双宾语句法结构与“所有权转移”的意义联系起来,如“Mary gave John a book”。于是,语言的心理表征是由大量类似这样的表面语法图式构成的,而不是由非常有限的原子全局句法范畴及其上的转换短语结构规则构成的(Langacker,2009;Tomasello,2003)。 然而,人类语言科学中的这两种理论框架都不足以刻画NLM的语言认知。生成语言学对人类语言认知做出了两个假设。第一,句法和语义是独立的表征和加工系统;第二,人类语言能力受一套先天预设的句法结构(即普遍语法)支配(Chomsky,1995;Haspelmath,2008;Levin & Hovav,1994)。NLM并不具备人脑的这些归纳偏差。没有证据或理由表明神经语言模型应该分别存储句法知识和语义知识,因为统计分布同时反映了句法和语义。普遍语法的先天指导也与NLM的统计学习无关。 对于功能理论,其假设是人类语言是在功能语境中习得的(Goldberg,2019;Langacker,2009;Tomasello,2003)。也就是说,泛化发生在表面句法结构到其语义内容的映射上。这要求语言学习者持续关注语言输入的语义内容,而不是专注于词语的组合规则以形成纯粹的句法范畴。然而这不适用于NLM,它们仅通过追踪输入语料库中的分布统计来获得认知核心。因此,用纯粹的功能理论来解释NLM的统计思维本质上不可行。 因此,解释NLM的语言认知需要探究NLM的基本表征形式,而不是试图用人类认知科学的理论框架来解释NLM。也就是说,NLM的统计知识中应该存在独特的单位和结构,使其具备人类水平的语言能力。这些单位和结构的组织方式,对于习惯于处理人类认知的认知科学家来说可能非常陌生。 与这些关于语言表征的理论框架不同,统计学习研究为NLM的语言认知提供了独特的视角。这一研究方向考察人类学习者如何追踪语言输入中的统计模式,以及如何通过这些学习机制构建全面的语言认知(Smith,1969;Pelucchi等人,2009a;Saffran,2020;Saffran等人,1996;Brown等人,2022;Lany & Saffran,2010,2011;Mintz,2002;Reeder等人,2013,2017;Wonnacott等人,2017;Isbilen & Christiansen,2022;Misyak等人,2009;Perek & Goldberg,2015,2017;Samara等人,2025)。这些研究设计了模仿人类语言中某些统计模式的人工语言。通过让人类学习这些人工语言,研究者获得了大量关于人类如何在语言习得过程中追踪相互交织的统计模式,并将这些模式存储为语言知识一部分的见解。在这一研究线中,许多研究关注语言结构如何仅通过输入中标记的纯分布统计来习得(Smith,1969;Mintz,2002;Reeder等人,2013,2017;Misyak等人,2009;Morgan & Newport,1981;Saffran,2001;Thompson & Newport,2007)。尽管这一研究线在人类认知科学中正在消退,但它们是在探究纯分布统计如何可能导致语言认知方面的先驱。 这也吸纳了人类认知科学的另一洞见:对学习的实证研究是研究语言表征的关键(Perek,2015;Pinker,1989;Romberg & Saffran,2010;Saffran,2020;Tomasello,2003;Wonnacott,2013)。也就是说,心理表征是如何从零开始构建的。其精神在于,所有关于表征形式的理论都会对学习路径做出预测,而所有关于学习的理论也相应地会对表征形式做出假设(Pinker,1989;Tomasello,2003)。鉴于NLM的语言认知是纯粹统计性的,我们预期统计学习方法能够为我们揭示NLM语言表征中的单位和结构(Kallens等人,2023)。这意味着需要实证考察NLM的内部表征在训练过程中如何变化。 在本研究中,我们关注NLM的学习路径。在语言科学史上,曾提出过两种一般性的学习路径。第一种是过度泛化学习路径。在这种学习路径中,学习者首先关注输入中最全局的语法模式。在此过程中,学习者可以根据词语的全局分布行为将其归类为有限的一组原子范畴(Lany & Saffran,2010,2011;Pinker,1989;Jackendoff,1977)。这些全局范畴是后期学习阶段的原子工具。语言中的核心语法结构都源于这些全局范畴的组合规则。但这些全局范畴是高度过度泛化的,无法捕捉语法中的细微差别。这些全局范畴的不同子范畴具有截然不同的语法行为。例如,动词的不同子类出现在非常不同的句法框架中(Boas,2011;Levin,1993,2015;Croft,2015;Levin & Rappaport Hovav,1995,2005;Rappaport Hovav & Levin,1998;Kiparsky,1997)。状态变化动词出现在及物和不及物框架中,而所有权变化动词则出现在与格和双及物句法框架中。即使在这些子范畴内部,分布行为也存在系统性差异。例如,一些状态变化动词只出现在及物或不及物框架中,而另一些动词则在这些句法框架之间交替(Levin,1993,2015;Croft,2015;Levin & Rappaport Hovav,1995,2005;Rappaport Hovav & Levin,1998)。因此,在学习后期,学习者需要关注输入中相对局部的语法模式来约束这些过度泛化。 另一种假设的学习路径是保守学习路径。在这种路径中,学习者在学习早期不愿意做出过度泛化。早期的泛化大多是欠泛化。其精神在于,自然语言中的语法范畴和图式是以层级方式组织的(Croft,2003;Goldberg,2019;Hilpert,2019;Langacker,1987,2009)。局部的语法图式是对具体语言使用的直接泛化,并且是更抽象语法图式的实例;更抽象的语法模式是高阶泛化,它们具有高度能产性,但能产性受到的约束较少。图1给出了英语及物结构的一个例子。 参考图例图1:英语及物图式的继承层级。在发展科学中,一些实证研究观察到儿童学习者在继承层级中采用自下而上的学习策略(Bowerman & Croft,2007;Tomasello,2003,2007)。也就是说,局部的语法图式在发展早期就被习得,而更抽象的语法图式则是在后期通过对较低层级图式进行泛化而习得的。以图1中的英语及物结构为例,词汇性及物图式“kick”会在发展早期习得。这个局部图式指定“kick”之前的成分是踢者,之后的成分是被踢之物。在习得多个高频且结构相似的词汇性及物图式后,可以通过追踪词汇图式之间的结构对齐形成高阶泛化。这个相对抽象的及物图式指定所有及物动作动词之前的成分是施事,之后的成分是受事。在这个抽象层级上,泛化的语法图式中已没有固定的词汇单位,只有词汇范畴。在习得一组该层级的语法图式后,可以进一步泛化形成最抽象的及物图式。在这种学习路径中,学习者习得的是大量不同抽象层级的语法图式集合。较低层级的图式是通向高阶泛化的步骤,也是高阶泛化的实例(Goldberg,2019;Lieven等人,1997;Tomasello,2003)。因此,泛化的范围在学习路径中逐渐扩大。 本研究在此背景下考察NLM的学习。作为纯粹的统计学习模型,NLM仅通过追踪输入中的分布统计来构建其认知核心。因此,我们提出一个问题:NLM是从输入中最局部的依赖关系开始泛化,然后通过扩大泛化范围形成更高层级的泛化,还是从最全局的统计模式开始泛化,然后以约束过度泛化的方式进入更局部的依赖关系?也就是说,NLM是先习得抽象的全局统计知识,还是先习得局部的统计知识?正如最后一节将讨论的那样,这对于推断NLM的基本表征形式至关重要。 ## 2 合成语法 为了探究神经语言模型如何获取不同抽象层级的统计知识,我们设计了一种具有层级嵌套依赖关系的合成语法。该语法包含三个层级的统计规律:全局层级、中间层级和局部层级。这使我们能够在嵌套的继承层级中考察学习路径。 参考图例图2:人工语言的继承层级。参考图例图3:继承层级中的依赖关系。继承层级如图2所示。继承层级中的依赖关系如图3所示。在全局层级上,人工语言包含四个核心范畴:M、N、P和Q。这些范畴纯粹按分布定义。每个范畴的大小标记为k。每个字符串都遵循序列M-N-P-Q。因此,范畴M的标记预测范畴N的标记,后者又预测范畴P的标记,再进一步预测范畴Q的标记。 然后我们拆分全局范畴以形成中间层级范畴。全局范畴N被拆分为两个中间层级子范畴N1和N2;全局范畴P被拆分为P1和P2;全局范畴Q被拆分为Q1和Q2。中间层级的依赖关系是:N1、P1和Q1范畴相互依赖;N2、P2和Q2范畴相互依赖。因此,N1标记只预测P1标记,P1标记只进一步预测Q1标记。N2、P2和Q2同理。因此每个中间层级范畴包含k/2个标记。中间层级的语法图式引入了一组更具体的依赖关系。 然后我们进一步拆分中间层级范畴以形成局部范畴。中间范畴P1被拆分为P11、P12;P2被拆分为P21和P22。同理,Q1被拆分为Q11、Q12;Q2被拆分为Q21和Q22。因此每个局部范畴包含k/4个标记。局部层级的依赖关系也基于索引。P11标记只预测Q11标记;P12标记只预测Q12标记;P21标记只预测Q21标记;P22标记只预测Q22标记。整个继承层级和依赖关系如图2和图3所示。 该合成语法中可能的语法形式如(1)所示。在这个依赖关系层级中只允许这四种语法图式。然后我们为每种可能的语法形式生成所有排列,作为最终数据集。数据集的95%用于训练。 (1) 可能的语法形式 (a): M N1 P11 Q11 (b): M N1 P12 Q12 (c): M N2 P21 Q21 (d): M N2 P22 Q22 最后,为了减少对序列中绝对位置的依赖,添加了一个侧翼范畴U。U标记被插入到每个序列的开头或结尾。这样产生五标记字符串,格式为U-M-N-P-Q或M-N-P-Q-U。U范畴不是核心语法的一部分,与任何其他范畴没有依赖关系。其功能是防止核心范畴总是出现在序列中的固定位置,因为语法
相似文章
当Transformer学习"不可能"语言时,它们学到了什么?
本文研究Transformer语言模型如何学习具有非自然属性的'不可能'语言,发现虽然语法敏感性逐渐下降,但生成能力表现出显著失败,从而提出了未证实语言的链接假说。
语言模型框架是组合性泛化器(49分钟阅读)
这篇博客文章认为,语言模型中更好的泛化应来自'框架'(即接口程序),而非仅仅扩展训练数据。实验表明,递归语言模型框架能够实现远超基础Transformer的长度和领域泛化。
Transformer语言模型中情境建模与心理化的发育轨迹
本文研究了Transformer语言模型在不同训练阶段中情境建模与心理化能力的涌现,发现错误信念任务的表现依赖于模型大小和训练量,在预训练后期才出现,并且在非事实性动词下表现出脆弱性。
基于Transformer的语言模型在垂直领域中的应用:架构、应用与批判性评估
对基于Transformer的语言模型的全面综述,涵盖架构、在医疗、金融、法律等垂直领域的应用,以及对计算成本、对齐和数据来源等权衡因素的批判性评估。
通过无监督学习改进语言理解
OpenAI 提出了一种两阶段方法来改进语言理解:首先在大规模无监督数据集上使用语言建模对 transformer 模型进行预训练,然后在较小的有监督数据集上针对特定任务进行微调。该方法在包括常识推理、语义相似度和阅读理解在内的多种任务上取得了最先进的成果,同时需要的超参数调优工作最少。