作为文化演化的模型崩溃
摘要
本文将LLM中的模型崩溃重新定义为一种文化传播现象,表明迭代学习理论预测了自我训练下组合性的非单调轨迹,并在多种语言和模型上得到证实。
arXiv:2605.23054v1 公告类型:新
摘要:模型崩溃指的是大型语言模型(LLM)在其自身输出上进行训练时出现的渐进退化现象,目前已有统计特征描述,但缺乏语言学层面的解释——即哪些结构会退化、退化的顺序以及原因。我们表明,来自文化演化领域的迭代学习理论填补了这一空白。我们推导出五个可证伪的预测,区分了其中对该理论具有独特判别性的预测与验证性预测,并通过在英语、德语和土耳其语中自我训练LLaMA-2-7B和Mistral-7B(持续10代)进行测试。关键的判别性发现:在无过滤的自我训练下,组合性表现出非单调轨迹(先上升后下降)。这一特征在使用最大规则化种子数据(排除了噪声去除的可能性)时依然存在,并且仅由任务导向的过滤(而非随机过滤)得以维持,这为压缩-通信权衡提供了首个LLM规模的证据。所有预测均得到大效应量的证实(Hedges' $g > 1.6$;$\mathrm{BF}_{10} > 100$),且LLM的正则化梯度与人类行为数据高度吻合($R^2 = 0.94$)。这些结果将模型崩溃重新定义为一种文化传播现象,并为自我训练流程设计提供了具体原则。
查看缓存全文
缓存时间: 2026/05/25 08:58
# 模型崩溃即文化演化 来源:https://arxiv.org/html/2605.23054 Dongxin Guohttps://orcid.org/0009-0000-2388-1072 香港大学 香港,中国 bettyguo@connect\.hku\.hk &Jikun Wuhttps://orcid.org/0000-0002-2327-4157 Stellaris AI Limited 香港,中国 hk950014@connect\.hku\.hk &Siu Ming Yiuhttps://orcid.org/0000-0002-3975-8500 香港大学 香港,中国 smyiu@cs\.hku\.hk ###### 摘要 模型崩溃,即基于自身输出训练的大语言模型逐步退化的现象,已得到统计上的刻画,但缺乏对其*哪些*结构会退化、退化顺序及原因的*语言学*解释。我们表明,文化演化中的迭代学习理论恰好填补了这一空白。我们推导出五个可证伪的预测,区分了其中对理论具有独特判别性的预测与仅具确认性的预测,并通过在英语、德语和土耳其语中对LLaMA-2-7B和Mistral-7B进行10代自训练来检验这些预测。关键判别性发现:在无过滤的自训练下,组合性呈现*非单调*轨迹(先升后降)。即使使用高度规则化的种子数据(排除了噪声消除的解释),该特征依然存在,并且只有任务导向的过滤才能维持组合性,而非随机过滤,从而提供了首个大语言模型规模的压缩-沟通权衡证据。所有预测均得到确认,效应量较大(Hedges’g>1.6;BF10>100),且大语言模型的正则化梯度与人类行为数据高度吻合(R²=0.94)。这些结果将模型崩溃重新诠释为一种文化传播现象,并为自训练流程设计提供了具体原则。 # 模型崩溃即文化演化 ## 1 引言 为什么人类语言的结构会是现在这样?文化演化理论提供了一个令人信服的答案:语言是在被学习和传播的过程中塑造而成的 (Christiansen and Chater,2016 (https://arxiv.org/html/2605.23054#bib.bib36),2015 (https://arxiv.org/html/2605.23054#bib.bib37))。当语言在连续的学习者链中传递时,每一代的归纳偏置都会被放大,逐步消除不可预测的变异并促进可学习结构的形成 (Kirbyet al.,2008 (https://arxiv.org/html/2605.23054#bib.bib64),2014 (https://arxiv.org/html/2605.23054#bib.bib34))。这个过程被形式化为*迭代学习* (Griffiths and Kalish,2007 (https://arxiv.org/html/2605.23054#bib.bib32)),为语言的核心属性提供了数学解释:规律性、组合性和齐普夫频率分布正是从文化传播本身的动力学中涌现的。关键在于,Kirbyet al. (2015 (https://arxiv.org/html/2605.23054#bib.bib35)) 证明组合性同时需要压缩压力(来自学习瓶颈)和沟通压力(来自表达需求);仅靠压缩会产生退化语言。 看似相关的是,基于自身输出训练大语言模型会导致*模型崩溃*:分布尾部消失、多样性降低、输出趋于退化形式 (Shumailovet al.,2024 (https://arxiv.org/html/2605.23054#bib.bib71); Alemohammadet al.,2024 (https://arxiv.org/html/2605.23054#bib.bib4))。这一现象已通过统计估计理论得到刻画 (Dohmatobet al.,2024b (https://arxiv.org/html/2605.23054#bib.bib5),a (https://arxiv.org/html/2605.23054#bib.bib6),2025 (https://arxiv.org/html/2605.23054#bib.bib7)),Guoet al. (2024 (https://arxiv.org/html/2605.23054#bib.bib69)) 从多个维度记录了语言多样性的下降,Seddiket al. (2024 (https://arxiv.org/html/2605.23054#bib.bib43)) 则提供了信息论分析。虽然这些描述准确刻画了崩溃的统计机制,但它们对*哪些*语言属性受影响、影响顺序及原因提供的见解有限。 模型崩溃与文化演化之间的概念联系已在近期几项工作中确立。Renet al. (2024 (https://arxiv.org/html/2605.23054#bib.bib44)) 形式上证明了大语言模型的自我演化实现了贝叶斯迭代学习,并证明了各代之间单调的偏置放大。Shumailovet al. (2024 (https://arxiv.org/html/2605.23054#bib.bib71)) 在*自然*杂志的一封通信中指出,人类语言传播中的压缩-表达性权衡解释了自训练为何会退化。Kouwenhovenet al. (2025b (https://arxiv.org/html/2605.23054#bib.bib72)) 在指称游戏中用大语言模型测试了迭代学习,发现在缺乏足够压缩压力时大语言模型会产生退化词汇,而Galkeet al. (2023 (https://arxiv.org/html/2605.23054#bib.bib74)) 则广泛回顾了语言演化对大语言模型的启示。我们在这些基础上,首次在大语言模型规模下对自然语言进行系统测试,检验*判别性*预测(即那些能够区分迭代学习与一般模型崩溃的预测)。我们从文化演化理论推导出五个预测,并明确区分其判别状态: #### P1:频率依赖的损失顺序(*部分判别性*)。低频变体应比高频变体更早丢失,遵循与人类正则化相匹配的特定对数线性梯度 (Reali and Griffiths,2009 (https://arxiv.org/html/2605.23054#bib.bib65); Morgan and Levy,2016 (https://arxiv.org/html/2605.23054#bib.bib41))。一般崩溃预测尾部损失,但不预测具体的函数形式。 #### P2:单调递增的规律性(*确认性*)。形态模式应在类型学不同的语言中均呈现规则化,反映简单性偏置的放大 (Shahet al.,2020 (https://arxiv.org/html/2605.23054#bib.bib13); Kalliniet al.,2024 (https://arxiv.org/html/2605.23054#bib.bib17))。 #### P3:维度特定的退化速率(*部分判别性*)。语用构式应比句法构式更早丢失,反映大语言模型中的形式-功能分离 (Mahowaldet al.,2023 (https://arxiv.org/html/2605.23054#bib.bib50))。 #### P4:非单调的组合性(*独特判别性*,关键测试)。在没有沟通基础的情况下,组合性应呈现非单调轨迹(先升后降),即使使用高度规则化的种子数据也是如此。只有任务导向的评估才能维持组合性 (Kirbyet al.,2015 (https://arxiv.org/html/2605.23054#bib.bib35))。一般崩溃仅预测单调退化。 #### P5:分布变窄(*确认性*)。齐普夫指数应减小,反映尾部损失 (Piantadosi,2014 (https://arxiv.org/html/2605.23054#bib.bib51))。 我们通过对两个大语言模型进行受控实验来检验所有五个预测,其中包括一个*规则化种子对照组*和一个*三条件过滤实验*,以隔离压缩-沟通机制。形态规律性评估涵盖英语、德语和土耳其语;构式多样性和组合性在英语中用崩溃鲁棒指标进行评估。所有五个预测均得到确认。非单调组合性轨迹(P4)在规则化种子数据中持续存在,并且只有质量导向(而非随机)过滤才能维持该轨迹,提供了首个大语言模型规模的压缩-沟通权衡证据。大语言模型的正则化梯度与 Morgan and Levy (2016 (https://arxiv.org/html/2605.23054#bib.bib41)) 的人类曲线高度吻合。 我们的贡献是:(1) 将 Renet al. (2024 (https://arxiv.org/html/2605.23054#bib.bib44)) 的迭代学习框架显式扩展到自然语言,包含五个可证伪预测并对其判别状态进行分类(§2 (https://arxiv.org/html/2605.23054#S2));(2) 四个语言学基础的指标,经过崩溃鲁棒验证(§3.4 (https://arxiv.org/html/2605.23054#S3.SS4));(3) 系统性实证测试,包括关键对照(规则化种子、三条件过滤),涵盖10代、两个模型和三种语言(§4 (https://arxiv.org/html/2605.23054#S4));以及 (4) 对自训练流程设计的明确启示(§6 (https://arxiv.org/html/2605.23054#S6))和对构式语法的贡献(附录V (https://arxiv.org/html/2605.23054#A22))。 ## 2 理论框架 ### 2.1 迭代学习与压缩-沟通权衡 Griffiths and Kalish (2007 (https://arxiv.org/html/2605.23054#bib.bib32)) 证明了当贝叶斯学习器观察前一个学习器生成的数据并为下一个学习器生成数据时,后验分布的链条会收敛到学习器的先验。Kalish et al. (2007 (https://arxiv.org/html/2605.23054#bib.bib33)) 通过实验确认了这一点:人类参与者在1-4代内收敛到正线性函数,无论种子条件如何,这一结果对我们的规则化种子对照组设计(§3.2 (https://arxiv.org/html/2605.23054#S3.SS2))至关重要。Reali and Griffiths (2009 (https://arxiv.org/html/2605.23054#bib.bib65)) 将其扩展到Beta先验下的频率依赖正则化,Ferdinandet al. (2019 (https://arxiv.org/html/2605.23054#bib.bib2)) 则证明即使在非贝叶斯学习器使用基于梯度优化的情况下,这些动力学也会出现,因为基本机制(不完全学习后不完全再现)是共享的,与推理过程无关。 三个属性对我们的预测至关重要。第一,*瓶颈严重性*:收敛速度取决于传输瓶颈 (Kirbyet al.,2014 (https://arxiv.org/html/2605.23054#bib.bib34))。第二,*压缩-沟通权衡*:Kirbyet al. (2015 (https://arxiv.org/html/2605.23054#bib.bib35)) 证明了没有沟通压力的传输链会产生退化语言,而有沟通压力的传输链则产生在可学习性和表达性之间取得平衡的组合性语言。第三,*维度特定的涌现*:Beckneret al. (2017 (https://arxiv.org/html/2605.23054#bib.bib66)) 发现结构在某些意义维度上比其他维度更先涌现。具体而言,这三个属性对应于我们的预测如下:瓶颈严重性驱动P1和P5(频率依赖尾部损失的速率和形状);压缩-沟通权衡驱动P2和P4(仅靠压缩下的正则化 vs. 需要沟通压力来维持的非单调组合性轨迹);维度特定涌现驱动P3(构式损失的顺序)。这些对应关系背后的细粒度偏置-预测映射详见§2.2 (https://arxiv.org/html/2605.23054#S2.SS2) 和附录S (https://arxiv.org/html/2605.23054#A19)。 ### 2.2 大语言模型自训练即迭代学习 在数据 Dn 上训练的大语言模型 Mn 构成第 n 代。在自训练中,Dn+1 从 Mn 的输出分布中采样。每一代实现一步迭代学习,模型的归纳偏置扮演贝叶斯先验的角色。Renet al. (2024 (https://arxiv.org/html/2605.23054#bib.bib44)) 形式上建立了这种对应关系,证明了如果上下文学习近似于贝叶斯推理,则Griffiths and Kalish (2007 (https://arxiv.org/html/2605.23054#bib.bib32)) 的经典收敛结果适用:迭代自训练单调地放大先验偏置。我们的工作从两个方向扩展了他们的框架。首先,我们刻画了这一过程中涌现的*哪些具体语言现象*(非单调组合性动力学、与人类习得并行的频率依赖正则化、维度特定的构式损失),这些在单调放大模型中是看不见的。其次,我们在自然语言上使用基于权重的学习(微调)进行测试,补充了Ren等人基于上下文学习的实验。 大语言模型偏置与迭代学习先验之间的映射可以比通用的“归纳偏置”刻画更精确。遵循Ferdinandet al. (2019 (https://arxiv.org/html/2605.23054#bib.bib2)) 关于不同偏置类型产生不同演化轨迹的论证,我们识别出四个特定的偏置-预测映射(详见附录S (https://arxiv.org/html/2605.23054#A19)):来自下一词符训练的*频率偏置*驱动P1/P5;*简单性偏置* (Shahet al.,2020 (https://arxiv.org/html/2605.23054#bib.bib13); Kalliniet al.,2024 (https://arxiv.org/html/2605.23054#bib.bib17)) 驱动P2;来自自回归分解的*局部连贯性偏置* (McCoyet al.,2024 (https://arxiv.org/html/2605.23054#bib.bib56)) 驱动P3的维度特定排序;而*缺乏沟通基础的压缩*驱动P4的非单调组合性。我们称我们的框架为*经验驱动的结构对应关系*,而非形式化的数学等价,遵循McCoy and Griffiths (2025 (https://arxiv.org/html/2605.23054#bib.bib76))。关键在于,Ferdinandet al. (2019 (https://arxiv.org/html/2605.23054#bib.bib2)) 显示了定性迭代学习动力学对非贝叶斯学习器具有鲁棒性,而Hudson Kam and Newport (2005 (https://arxiv.org/html/2605.23054#bib.bib39)) 和Hudson Kam and Newport (2009 (https://arxiv.org/html/2605.23054#bib.bib40)) 则展示了人类成人中类似的正则化。 关于*瓶颈宽度*:我们的50,000段落瓶颈比典型人类实验更宽 (Kirbyet al.,2008 (https://arxiv.org/html/2605.23054#bib.bib64)),这会减慢但不会消除偏置放大 (Kirbyet al.,2014 (https://arxiv.org/html/2605.23054#bib.bib34))。我们采用Shumailovet al. (2024 (https://arxiv.org/html/2605.23054#bib.bib71)) 的模型崩溃定义,并注意到Schaefferet al. (2025 (https://arxiv.org/html/2605.23054#bib.bib70)) 识别出了八种不同的定义;我们的预测在涉及分布变窄的定义下均稳健。 ### 2.3 预测与判别状态 五个预测分为三个判别性类别(附录O (https://arxiv.org/html/2605.23054#A15) 中的表10 (https://arxiv.org/html/2605.23054#A15.T10) 给出了完整分类及对照实验结果)。P2和P5源于一般的迭代偏置放大,作为*确认性*测试来验证我们的实验设置——如果P2中规律性持平或下降,或P5中α稳定,则将证伪该框架。P1和P3是*部分判别性的*:P1通过预测与人类正则化曲线相匹配的特定对数线性函数形式 (Morgan and Levy,2016 (https://arxiv.org/html/2605.23054#bib.bib41)) 而超越一般描述——而不仅仅是罕见项丢失(任何采样过程都会如此);P3则预测维度特定的排序(语用先于结构),反映形式-功能分离 (Mahowaldet al.,2023 (https://arxiv.org/html/2605.23054#bib.bib50))。P4是*独特判别性的*测试:一般模型崩溃仅预测单调退化,而压缩-沟通权衡 (Kirbyet al.,2015 (https://arxiv.org/html/2605.23054#bib.bib35)) 独特地预测先升后降——我们通过规则化种子对照来排除噪声消除的替代解释。 ## 3 方法 ### 3.1 自训练流程 我们使用两个基础模型实现迭代学习:LLaMA-2-7B (Touvronet al.,2023 (https://arxiv.org/html/2605.23054#bib.bib19)) 和 Mistral-7B (Jianget al.,2023 (https://arxiv.org/html/2605.23054#bib.bib60)),选择它们是为了可复现性以及因其不同的架构而
相似文章
大语言模型顺序后训练中的表征坍塌
本文研究了大型语言模型在顺序后训练中的表征坍塌现象,表明重复的适应阶段会压缩内部表征,降低可塑性和域外泛化能力。作者提出了轻量级干预措施,在不牺牲行为增益的前提下保留未来的可学习性。
语言模型中连续混合坍塌的动态特性
本文探讨了预训练语言模型在推理过程中未能保留token嵌入连续混合的原因,确定了架构扭曲和动态系统效应为主要失败来源。
适应是双向的:研究人类与语言模型之间的语言趋同
本文研究了在多轮对话中人类与大型语言模型之间的语言适应性,发现LLM过度趋同于用户风格,而人类适应LLM的方式与适应其他人类并无不同。
模型崩溃怎么回事?
对模型崩溃的探讨,这是一种AI模型在合成数据上训练后,其质量和多样性下降的现象。
语言模型难以实现概念整合
本文研究了大型语言模型中的 compartmentalization(概念隔离)现象,即模型未能跨同一概念的不同表示共享统计强度,导致样本效率和模型容量降低。作者在多语言和多格式场景中验证了这一现象,并表明合成平行数据无法完全解决此问题。