寡头几乎无法在多模型生态系统中引导模型崩溃
摘要
本文研究了在多模型生态系统中,当AI生成的文本被回收用于训练数据时发生的模型崩溃。研究发现,市场集中度对崩溃的速度或终点几乎没有影响,这主要受训练数据源的影响。
arXiv:2609.11146v1 公告类型:新
摘要:AI生成的文本正回流到下一代模型的训练语料库中。对其递归训练会导致模型崩溃,近期研究将这一设定扩展到多个模型相互馈送的情况——但市场几乎总是平均分配,而真实的生成式AI是寡头垄断。集中度引发两个担忧:更少、更统一的来源可能加速崩溃,后续模型可能被拖向寡头的输出。我们在受控生态系统中测试了这两点:13个开放的1-4B模型形成3到13个参与者的自然生态系统,加上一个注入的探测器将顶级份额推至90%;每一代,每个模型的输出按市场份额混合到共享池中,每个模型从干净的基权重在该池上重新训练,共五代。然而,在我们测试的范围内,两个担忧都未实现;取而代之的是一个不变性。使分配更不平等几乎不改变崩溃的速度。终点移动更少:份额和身份旋钮仅将五代终点移动了所有分支共同漂移的几个百分比——生态系统几乎崩溃到相同的地方。极端份额与最强注入偏差仍无法保证引导,且其产生的主题转移仅在测量崩溃的标尺上留下微弱痕迹。决定速度的是谁提供池以及这些提供者被带动的容易程度:当所有份额固定时,交换K=3生态系统的成员会将五代漂移改变2.8倍;每个成员易感性的份额加权指数以R^2 = 0.68解释了十九个分支的速度差异;并且用人类文本替换一半的池大致减半漂移而不改变其方向。在测试范围内,集中度既不设定崩溃的终点也不设定节奏;节奏跟随填充池的文本来源。
查看缓存全文
缓存时间: 2026/09/12 08:23
# 寡头在多模型生态系统中几乎无法驾驭模型崩溃 **来源**:https://arxiv.org/html/2609.11146 钟毅 †† 通讯作者。单位:山东大学 邮箱:[zhongy\.han@sdu\.edu\.cn](mailto:) ###### 摘要 人工智能生成的文本正大量回流至下一代模型的训练语料中。已知在此类文本上进行递归训练会导致模型崩溃,近期研究更将场景扩展到多个相互喂养的模型——但几乎总是假设市场份额均等划分,而现实中的生成式人工智能市场实为寡头垄断。市场集中引发两方面担忧:更少且更同质的来源可能加速崩溃,后续模型可能被拖向寡头的输出方向。我们在受控的生态系统中验证了这两点:13个开源1-4B参数模型构成3至13个参与者的自然生态系统,并加入一个注入探测模型使头部市场份额达到90%;每一代,每个模型的输出按市场份额混入共享语料池,所有模型基于干净基础权重在该池上重新训练,如此迭代五代。崩溃本身十分严重:困惑度中位数从97升至699。但在我们测试的范围内,这两种担忧均未出现;相反我们发现了一种不变性:改变分配不平等程度几乎不影响崩溃速度。最终状态的变化更小:份额与身份两个调节旋钮仅使五代漂移的终点移动了几个百分点——约为所有实验组共同漂移量的六分之一(线性距离下)。生态系统崩溃后几乎收敛到同一位置。即使极端份额配合最强注入偏见也无法确保方向控制,且其产生的主题偏移在衡量崩溃的标尺上仅留下微弱痕迹。真正决定崩溃速度的是共享语料池的构成者,以及这些构成者自身被带动的程度:在固定份额下,更换K=3生态系统成员使五代漂移变化2.8倍;成员“易被带动程度”的份额加权指数可解释19组实验中速度差异的R²=0.68;用人类文本替换一半语料池内容可将漂移减半而不改变其方向。在测试范围内,集中度既不决定崩溃终点,也不决定崩溃速度;速度取决于填充语料池的文本来源。 ## 1 引言 人工智能生成的文本正大量回流至互联网。近期爬虫研究发现74.2%的新发布网页已包含AI生成内容(Law, 2025)。无论下一代训练语料如何清洗,都难以避免吸收上一代的输出。在语言和视觉领域,基于合成数据的重复训练会导致模型性能下降已被多次证实,这一现象被称为*模型崩溃*(Shumailov等, 2024; Alemohammad等, 2024)。但现有研究大多聚焦于单一模型消化自身输出的情况。现实中的回流并非单个公司自我循环,而是多个模型相互“吞噬”。多模型研究尚属新兴但结论一致:异构模型在相互训练后会趋向收敛——这一结论在简化环境中得到证明并被观察到(Wang等, 2025; Vu等, 2025)。然而所有现有研究中,每个参与者贡献的数据量完全相同(第2节)。这一假设恰是与现实的脱节点。生成式AI市场呈现寡头垄断:88%的企业API支出流向头部三家提供商,在代码生成领域单一提供商占比达54%(Menlo Ventures,《2025企业生成式AI现状》, 2025年12月)。因此更贴近现实的问题仍未解决:当少数提供商主导共享语料库时,市场结构能否改变生态系统的演进方向——或影响其演进速度?寡头垄断的担忧具体表现为两个预测:一是关于速度——寡头主导的生态系统依赖更少、更同质的来源,这种“近亲繁殖”应会加速崩溃;二是关于方向——后续模型主要消化寡头输出,生态系统可能被拖向单一公司的模式。我们将这两种力量命名为:递归训练导致所有模型质量衰退的*衰减效应*(fade),以及份额差异产生的方向性牵引力*牵引效应*(pull)。本文通过受控生态系统测量这两种力量的真实存在性及其影响规模。 ## 2 相关工作 单一模型环境下,递归训练导致模型性能衰退的现象已被证实:模型反复消化自身输出时,分布尾部先消失,整体质量随后下降(Shumailov等, 2024; Alemohammad等, 2024)。后续研究发现了缓解因素——跨代累积数据而非替换数据(Gerstgrasser等, 2024),固定规模子采样将崩溃转化为缓慢衰退(Kazdan等, 2024),以及人类-合成混合数据分析表明足够比例的真实数据可维持迭代重训练的稳定性(Bertrand等, 2024; Dohmatob等, 2024)。所有这些结论都基于单参与者场景。近期多模型研究发现,相互喂养的异构模型会在输出分布(Wang等, 2025)和共享任务表现(Vu等, 2025)上趋于收敛,但均未探讨收敛点位置及影响因素。最接近本研究的Hodel & West(2025)发现:将固定语料分配给数量可变的自训练模型时,分散配置能提升长期性能,而集中为单一模型会加速衰退。他们改变的是语料在参与者间的分配方式;我们改变的是填充固定规模共享语料池的成员构成。两者结论可能不同:在我们的实验中,速度与参与者数量并非单调关系(图4),且第4.4节表明速度差异源于填充内容而非填充者数量。现有研究均假设份额均等。Vu等(2025)承认了这一局限性:其附录探讨了单一提供商主导在线内容的情景,但将其简化为单模型场景,仅将市场集中视为二元状态。现实中介于两者之间:三家提供商占据88%市场份额的情况尚未被探索。市场结构也已被建模为有向的“谁喂养谁”图结构,其中崩溃与否取决于自然数据能否通过图路径到达模型;份额作为自由参数存在但不进入判断标准(Wu等, 2026)。我们的生态系统始终保持完全连接(第4.3节的人类数据实验组每代注入新的人类文本),因此在固定拓扑结构下,我们探讨份额仍能发挥多大作用。另一经济学文献讨论基础模型市场的集中度(Korinek & Vipra, 2025; Competition and Markets Authority, 2024; Turegeldinova等, 2025),其中同质化体现在价格与市场准入层面;算法同质化文献则关注部署阶段,即多个决策者共享单一模型(Kleinberg & Raghavan, 2021; Bommasani等, 2022);两者均未涉及训练动态。我们将份额从均等分配推至90%单一供给者,将参与者数量从3扩展至13,并向语料池注入0-50%人类数据——问题焦点从“是否收敛”转向“市场结构能在多大程度上改变生态系统演进方向”。 ## 3 实验设置 **生态系统运行流程**(图1A)。模拟生态系统包含K个语言模型。每代执行四个步骤:每个模型独立生成文本;输出按预设市场份额采样并混入共享语料池;每个模型从干净基础权重开始在该池上全参数微调;新训练的模型替换旧模型。此过程迭代五代;只有文本跨代传递,权重从不沿用。实验配置及其产生的生态系统称为一个*实验组*。基于干净基础权重重训练对应语料污染而非单一模型的持续衰减,能清晰隔离数据份额机制。 **两个实验组**。注入探测组——K=3,三个模型被注入强烈且相互对抗的风格偏见——测试在最有利条件下份额能否将生态系统引向寡头方向。自然模拟组——现成开源模型,无注入——展示生态系统在自然条件下的行为。结果部分按此顺序呈现。 **调节变量**。共四个。*份额结构*:自然生态系统比较均等分配与单个28%头部模型;注入探测组额外测试头部份额从45%到90%的变化。*头部身份*:固定份额结构,将28%头部位置分配给不同模型,观察持有者身份是否重要。*参与者数量*K从3到13。*人类数据比例*:在K=13生态系统中,用人类文本替换语料池的0%、25%或50%;25%比例也在K=3、5、8生态系统测试(注入探测组额外测试5%、10%、25%比例;附录C)。 **测量方法**。主要测量指标为几何距离:冻结编码器(DeBERTa)将每代语料池的模型生成文本嵌入为质心,距离计算采用1−cos,按种子计算后取平均值。人类数据实验组中人类文本仅作训练数据,不纳入质心计算。这些距离数值极小,因此论文报告时乘以1000:如0.8表示1−cos=0.0008。距离随角度平方增长,故同路径两点间距并非读数差值。距离比值同样遵循平方关系:当文本表述组间分离度为漂移量的2.6%时,线性距离约为六分之一(慢1.8倍读作1.35倍)。论文所有距离比均采用1−cos约定。结果产生两类量:单组在五代内的移动距离(*漂移量*),以及同代不同组间的分离距离(*组间分离度*)。注入探测组额外通过固定主题分类器跟踪;一组无编码器的退化指标(困惑度等)被用作辅助测量。
相似文章
模型崩溃怎么回事?
对模型崩溃的探讨,这是一种AI模型在合成数据上训练后,其质量和多样性下降的现象。
模型崩塌的有趣之处不在于技术,而在于认识论
本文探讨模型崩塌不是技术缺陷,而是认识论问题:当AI模型的输出成为自身输入时,模型对现实的表征逐渐扁平化为一种自我指涉的平均值,这引发了我们如何区分一个建模世界的模型与一个只建模自身的模型的问题。
亲AI阵营如何反驳'模型崩溃'?
作者质疑,如果AI生成的内容在未来训练数据中占主导地位,AI模型崩溃是否不可避免。
模型崩溃的流行病学:通过双层SIR动态建模合成数据污染
本文提出了一种双层耦合SIR/SIRS框架,用于模拟AI生态系统中的合成数据污染和模型崩溃,表明模型与数据语料库之间的交叉污染会导致超临界动力学,并指出基于检测的过滤是关键干预手段。
模型崩溃与对策综述
本文提供了生成AI中模型崩溃现象的最新概述,并回顾了缓解该问题的对策,强调了挑战和未来的研究机会。