微调解决LLMs中的模式崩溃和过度离散

arXiv cs.AI 论文

摘要

论文证明,通过有监督的微调可以纠正大语言模型中的模式崩溃和过度离散,表明在数据充足时,多样性会收敛到目标分布,并得到了理论界限和实验的支持。

arXiv:2609.16454v1 公告类型:新 摘要:最近,Doshi 和 Hauser (2024)、Bisbee 等人 (2024) 和 Xie 等人 (2026) 的工作提出了一个担忧:大语言模型 (LLMs) 的输出往往多样性不足:它们比它们所代表的人群的响应更频繁地重复或相似,这种现象被称为模式崩溃。在这项工作中,我们表明模式崩溃或其相反现象是否发生取决于所使用的具体模型和数据集。此外,使用足够的有监督微调 (SFT) 数据,LLM 输出的多样性会收敛到微调数据采样的目标分布的多样性。为了量化这种比较,我们测量从同一固定提示独立采样的两个响应重合(碰撞)的概率,或它们在核函数下的期望相似度。我们推导了模型和目标碰撞概率之间期望差距的偏差-方差分解,表明 SFT 本身并不偏向于模式崩溃或其相反:有限样本 SFT 可能使模型处于欠离散或过离散状态,具体取决于模型和数据集。最后,我们证明绝对差距由从目标分布到模型的 KL 散度的平方根所界定。因此,一个在总体交叉熵下足够接近最优的模型不能表现出任意失调的多样性。我们在三个实验中测试了分解和界限:在合成语言上的小型 Transformer 模型、在人类调查上微调的四个 LLMs,以及这些 LLMs 在 CodeNet(一个人类代码解决方案数据集)上的微调。在所有实验中,更多的目标数据将模型多样性推向人类(或合成目标)水平,与我们的理论预测一致。这些结果表明,多样性失调可能源于有限样本误差,并随着 SFT 更好地近似目标分布而减小。
查看原文
查看缓存全文

缓存时间: 2026/09/16 08:59

# 微调解决大语言模型中的模式崩溃与过度离散问题
来源:https://arxiv.org/html/2609.16454
###### 摘要
Doshi 和 Hauser (2024) (https://arxiv.org/html/2609.16454#bib.bib14)、Bisbee 等人 (2024) (https://arxiv.org/html/2609.16454#bib.bib8) 以及 Xie 等人 (2026) (https://arxiv.org/html/2609.16454#bib.bib43) 的近期研究提出了一个担忧:大语言模型(LLMs)的输出往往多样性不足,即它们比其所代表的目标人群的回复更常重复或彼此相似,这种现象被称为模式崩溃。在本文中,我们证明了模式崩溃——或其相反现象——的发生与否取决于所使用的具体模型和数据集。此外,通过足够多的监督微调(SFT)数据,LLM的输出多样性会收敛到其微调数据采样的目标分布。为了量化这种比较,我们测量了在相同固定提示条件下,独立采样的两个回复重合(碰撞)的概率。在一组实验中,我们使用精确的词元序列;在另一组实验中,我们使用其广义版本——在核函数下回复的期望相似度。我们将校准偏差定义为模型与目标之间的碰撞概率差不为零。我们推导出模型与目标碰撞概率期望差的偏差-方差分解,表明SFT本身并不偏向于模式崩溃或其相反现象:有限样本的SFT可能导致模型欠离散或过离散,具体取决于模型和数据集。最后,我们证明绝对偏差的上界是从目标分布到模型分布的Kullback–Leibler(KL)散度的平方根。因此,一个在总体交叉熵下足够接近最优的模型,不可能表现出任意程度的校准偏差。我们在三个实验中验证了该分解和上界:(1)在两种合成的一阶16阶语言中,对每个对数间隔的样本量拟合了100个小型Transformer;(2)使用低秩适应(LoRA),在来自综合社会调查(GSS)、美国国家选举研究(ANES)和世界价值观调查(WVS)的回复上微调了四个LLM;(3)在CodeNet数据集(一个包含编程任务人类解决方案的数据集)上重复实验(2),使用归一化的Zhang-Shasha编辑距离测量程序在规范抽象语法树之间的相似性。我们发现模型和数据集在过度与不足多样性方面存在显著异质性。在所有实验中,更多的目标数据都将模型多样性推向人类(或合成目标)水平,这与我们的理论预测一致。这些结果表明,多样性校准偏差可能源于有限样本误差,并随着SFT更好地近似目标分布而减小。因此,随着目标分布数据样本量的增加,模型多样性会向目标水平收敛。
## 1 引言
大语言模型(LLMs)正越来越多地被用作模拟的调查受访者(Argyle 等人,2023 (https://arxiv.org/html/2609.16454#bib.bib3))、用于创意写作(Chakrabarty 等人,2024 (https://arxiv.org/html/2609.16454#bib.bib9))、作为头脑风暴伙伴(Terwiesch 等人,2024 (https://arxiv.org/html/2609.16454#bib.bib17)),以及其他需要LLM输出忠实反映目标人群多样性的领域。实证研究表明,LLM常常表现出狭窄的输出范围,这种现象被称为模式崩溃:模型的输出比其所代表的人群的样本更常重复或彼此相似。例如,借助人工智能(AI)创作的故事往往彼此相似(Doshi 和 Hauser,2024 (https://arxiv.org/html/2609.16454#bib.bib14));AI辅助的用户可能生成语义区分度更低的想法(Anderson 等人,2024 (https://arxiv.org/html/2609.16454#bib.bib2));而合成的调查受访者可能重现总体模式,同时抑制个体和群体层面的变异(Bisbee 等人,2024 (https://arxiv.org/html/2609.16454#bib.bib8);Wang 等人,2025 (https://arxiv.org/html/2609.16454#bib.bib40);Xie 等人,2026 (https://arxiv.org/html/2609.16454#bib.bib43))。这些发现常被解释为LLM固有低输出多样性的证据(Xie 和 Xie,2025 (https://arxiv.org/html/2609.16454#bib.bib42))。然而,当一个预训练或指令微调的模型在新的数据集上进行微调时,其初始分布正在与一个尚未学习的目标分布进行比较。目前尚不清楚当模型更准确地学习目标分布时,这种多样性不足是否会持续。如果模式崩溃是固有的,增加目标分布的微调数据量未必能消除它;相反,如果模式崩溃和其他分布校准偏差仅反映了有限样本误差,那么随着微调的充分进行,模型多样性应收敛到目标水平。为了区分这一点,我们首先从理论上进行形式化。我们通过碰撞概率来量化LLM的输出多样性——在相同固定提示条件下,独立采样的两个回复重合的概率——或者更一般地,通过它们在核函数下的期望相似度来量化(第3节 (https://arxiv.org/html/2609.16454#S3))。对于下一词元比较,我们固定完整上下文:提示和词元前缀。模型和目标在相同条件和相似度度量下进行比较。它们的碰撞偏差是模型的碰撞概率减去目标的碰撞概率;其中零表示多样性校准,正偏差表示模式崩溃,负偏差表示过度离散。这种形式化使我们能够提出三个主张(图1 (https://arxiv.org/html/2609.16454#S1.F1)):
(1)SFT本身并不固有地导致欠离散或过离散;方向取决于模型和数据集。在独立拟合上平均的碰撞概率差可以分解为非负的方差和平方偏差项(促进集中)和一个符号不定的目标-偏差对齐项(可以抵消前两者)(第3.1节 (https://arxiv.org/html/2609.16454#S3.SS1))。
(2)量级:绝对碰撞偏差的上界是从目标分布到模型分布的Kullback–Leibler(KL)散度的平方根(定理1 (https://arxiv.org/html/2609.16454#Thmtheorem1))。这个上界意味着
(3)极限下的校准:当这个KL散度趋近于零时,碰撞偏差必然趋近于零。在实践中,这导致一个直观的结论:如果更多的目标数据和损失最小化使总体交叉熵接近目标分布本身达到的值,那么模型多样性必然接近目标水平。
图1:大语言模型(LLMs)在给定相同提示时可以产生多样或碰撞的输出。LLM做到这一点的程度可以衡量。高于目标的平均输出相似度被称为模式崩溃。然而,与普遍看法相反,模式崩溃并非必然发生,根据模型和数据集的不同,模型也可能过度多样(模式崩溃的反面)。可以证明微调使模型校准,即它们不会过于不足多样或过度多样。(a.i) 来自同一LLM和提示的独立输出可能碰撞或不同。(a.ii) 本图中用于碰撞的符号表示。(a.iii) 碰撞比率RR的定义。(b) 使用实验1(§4.1 (https://arxiv.org/html/2609.16454#S4.SS1))数据对方程(6 (https://arxiv.org/html/2609.16454#S3.E6))的分解。两个图对应两个不同的模型和数据设置。这些图证明了方程(6 (https://arxiv.org/html/2609.16454#S3.E6))的对齐项可以使模型要么不足多样,要么过度多样。这里$b_h=\mathbb{E}[q_h]-p_h$是在上下文$h$处的偏差,其中$\mathbb{E}$表示在独立拟合上取平均。绘制的曲线对上下文取平均,并从$R=1$开始,每个贡献项除以$C(p_h)$。(c) 绘制了来自实验2-3(§§4.2 (https://arxiv.org/html/2609.16454#S4.SS2)–4.3 (https://arxiv.org/html/2609.16454#S4.SS3))的早停调查适配器和最终CodeNet适配器的中位数碰撞比率R随微调样本量的变化。实验表明额外的微调导致多样性校准。(d) 定理1 (https://arxiv.org/html/2609.16454#Thmtheorem1) 以模型与目标KL散度的平方根为上界。因此,一个在总体交叉熵下足够接近最优的模型,不可能表现出任意程度的校准偏差。为从经验上支持我们的主张,我们设置了三个实验(第4节 (https://arxiv.org/html/2609.16454#S4))。实验1测试主张(1)并检查主张(2)的上界:在两个合成的16阶语言环境中,目标精确可计算,使用生成式预训练Transformer(GPT)架构的模型在100个对数间隔的样本量上进行拟合,产生了正负两种符号的碰撞偏差(第4.1节 (https://arxiv.org/html/2609.16454#S4.SS1),图2 (https://arxiv.org/html/2609.16454#S4.F2)),并且该上界在所有评估的上下文中都成立(附录G (https://arxiv.org/html/2609.16454#A7),图5 (https://arxiv.org/html/2609.16454#A7.F5))。实验2和3从相反的起点测试主张(3)。我们使用低秩适应(LoRA)微调了四个指令微调的LLM(gemma-2-2b-it(Gemma Team, 2024 (https://arxiv.org/html/2609.16454#bib.bib44))、gemma-3-4b-it(Gemma Team, 2025 (https://arxiv.org/html/2609.16454#bib.bib45))、Qwen3.5-2B和Qwen3.5-4B(Qwen Team, 2026 (https://arxiv.org/html/2609.16454#bib.bib46))),在综合社会调查(GSS)(Davern 等人,2025 (https://arxiv.org/html/2609.16454#bib.bib13))、美国国家选举研究(ANES)(American National Election Studies, 2022 (https://arxiv.org/html/2609.16454#bib.bib1))和世界价值观调查(WVS)(Haerpfer 等人,2022 (https://arxiv.org/html/2609.16454#bib.bib19))上进行微调。我们发现,四个基础模型中有三个相对于人类群体欠离散1.6到2.9倍,而在人类回答上进行的SFT为每个模型在每个调查上恢复了群体层面的异质性(第4.2节 (https://arxiv.org/html/2609.16454#S4.SS2),图3 (https://arxiv.org/html/2609.16454#S4.F3))。接下来,我们将相同的方法应用于CodeNet(Puri 等人,2021 (https://arxiv.org/html/2609.16454#bib.bib30)),一个包含编程任务人类解决方案的数据集,我们使用归一化的Zhang-Shasha相似度核(Zhang 和 Shasha, 1989 (https://arxiv.org/html/2609.16454#bib.bib39))来测量解决方案之间的距离。在同一个数据集上,一些基础模型不足多样,而另一些则过度多样(R=0.74-1.64):模式崩溃取决于模型。正如理论所预测的,监督微调从两个方向缩小了差距。
## 2 相关工作
输出模式崩溃的证据。生成式AI可以提升个人故事的评分并增加AI辅助故事之间的相似度(Doshi 和 Hauser,2024 (https://arxiv.org/html/2609.16454#bib.bib14)),而与InstructGPT共同写作会降低论文的内容多样性(Padmakumar 和 He,2024 (https://arxiv.org/html/2609.16454#bib.bib27))。ChatGPT用户比使用另一种创意支持工具的用户产生更丰富、更详细的想法,但这些想法在用户之间的语义区分度较低(Anderson 等人,2024 (https://arxiv.org/html/2609.16454#bib.bib2))。Sourati 等人(2026)(https://arxiv.org/html/2609.16454#bib.bib36) 认为LLMs强化了主导的语言和推理风格,而广泛依赖少数几个模型放大了这种趋同。我们的结果显示,SFT本身并不偏向模式崩溃或其相反方向:校准偏差的方向取决于模型和数据集,微调可以从任一方向将多样性推向目标。LLMs也被用作“硅采样”研究中人类参与者的代理(Argyle 等人,2023 (https://arxiv.org/html/2609.16454#bib.bib3)),但最近的研究表明,合成调查可能匹配总体统计量,却未能捕捉个体变异和回归结构(Bisbee 等人,2024 (https://arxiv.org/html/2609.16454#bib.bib8)),并且可能误表和扁平化身份群体(Wang 等人,2025 (https://arxiv.org/html/2609.16454#bib.bib40))。对15个LLM在七项调查上的基准测试记录了同样的异质性压缩(Xie 等人,2026 (https://arxiv.org/html/2609.16454#bib.bib43))。在模型生成的数据上递归拟合也会删除原始分布尾部的数据点(Shumailov 等人,2024 (https://arxiv.org/html/2609.16454#bib.bib33);Seddik 等人,2024 (https://arxiv.org/html/2609.16454#bib.bib32)),说明生成式重采样多么容易消除罕见模式。偏好优化与多样性。偏好优化已被证明会缩小输出多样性。使用近端策略优化(PPO)的基于人类反馈的强化学习(RLHF)会降低摘要任务的提示内和提示间多样性,通过多种词汇和语义指标评估,尽管同一研究发现指令跟随任务没有显著的多样性差异(Kirk 等人,2024 (https://arxiv.org/html/2609.16454#bib.bib23))。这种收缩发生的阶段因模型谱系而异,有些模型在SFT期间表现出最大降幅,而其他模型则在直接偏好优化(DPO)期间(Karouzos 等人,2026 (https://arxiv.org/html/2609.16454#bib.bib22))。这些影响与偏好数据和标注者异质性相关。标注者倾向于偏爱基础模型赋予较高可能性的回复,即使这些回复在正确性上相匹配;因此,一个完美估计的偏好奖励可以保留对传统回复的典型性偏差(Zhang 等人,2025 (https://arxiv.org/html/2609.16454#bib.bib38))。最后,聚合具有异质标准的标注者隐式实现了Borda计数规则,而不是恢复一个观察者独立的效用(Siththaranjan 等人,2024 (https://arxiv.org/html/2609.16454#bib.bib34)),并且单一标量奖励可能无法代表多峰的群体偏好(Chakraborty 等人,2024 (https://arxiv.org/html/2609.16454#bib.bib10))。对于参考策略$\pi_{\mathrm{ref}}$、群体奖励$r^{\star}$和KL惩罚强度$\beta$,最优策略的形式为$\pi^{\star}(y\mid x)\propto\pi_{\mathrm{ref}}(y\mid x)\exp\!\big(r^{\star}(x,y)/\beta\big)$,而DPO直接在这个隐式奖励类别内拟合策略(Rafailov 等人,2023 (https://arxiv.org/html/2609.16454#bib.bib31))。最后,常见的奖励结构和正则化机制在正向和反向KL散度下都可能产生单峰或集中的最优解,表明仅KL惩罚并不能保持参考分布的多样性(GX-Chen 等人,2026 (https://arxiv.org/html/2609.16454#bib.bib18))。这些群体层面的机制随着偏好数据量的增加而持续存在。相反,我们关注的是围绕群体目标的有限样本失真,为现有文献中的目标诱导偏差$C(\pi^{\star})-C(p)$增加了一个有限样本成分(附录F (https://arxiv.org/html/2609.16454#A6))。因为

相似文章

LLM微调中数据选择的长期影响

arXiv cs.LG

本文研究了多阶段LLM微调中数据选择策略的长期影响,揭示了短视选择会损害未来适应能力。为此,提出了一种长期视角感知选择(LHAS)目标以缓解这些问题。

输出多样性在后训练中的崩溃发生在哪里?

arXiv cs.CL

本文研究了语言模型后训练期间输出多样性崩溃的位置和原因,分析了三个 OLMo 3 训练线(Think、Instruct、RL-Zero)在多个任务和指标上的表现。研究发现多样性崩溃主要由训练数据组成决定,并在训练期间嵌入到模型权重中,仅通过推理时调整无法解决。