迭代指令微调中从合成数据学习避免模型崩溃

arXiv cs.CL 论文

摘要

本文研究了迭代指令微调中使用合成数据时的模型崩溃问题,揭示了崩溃表现为能力极化:强项被强化,弱项则进一步退化。提出了KITE,一个两阶段框架,结合失败引导的数据生成和边界感知的不确定性筛选,确保在多次迭代中稳定提升。

arXiv:2607.17043v1 公告类型:新 摘要:模型崩溃是从合成数据中学习的一个核心挑战:随着后续世代的大语言模型(LLMs)越来越多地使用模型生成的数据进行训练,由于覆盖范围缩小和偏差累积,性能可能会下降。现有工作主要研究如何限制这种退化。然而,在迭代模型进化中,更有意义的目标是确保每个后继模型都比前一个有所改进,这需要以对数据筛选可行的粒度来诊断崩溃。我们在指令微调的合成数据自我改进中研究了这一问题。我们发现,此设置下的崩溃并非简单的均匀性能退化,而可能表现为能力的极化:合成训练强化了已有的强项,同时进一步削弱了弱项。基于这一观察,我们提出了KITE(通过探索进行知识边界指令微调),这是一个两阶段框架,结合了失败引导的数据生成和边界感知的不确定性筛选。在多个数据集和多个开源LLM上的实验表明,KITE比强合成数据基线实现了更稳定的改进。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:44

# 使用合成数据进行迭代指令微调时避免模型崩溃的学习 来源:https://arxiv.org/html/2607.17043 肖南罗¹,黄悦¹,柯汉郭¹,何平²,邹川³,华婷¹,张翔亮¹ ¹圣母大学,²范德堡大学,³宾夕法尼亚大学 ###### 摘要 模型崩溃是从合成数据中学习时面临的核心挑战:随着后几代大型语言模型 \(LLMs\) 在日益增多的模型生成数据上进行训练,其性能可能因覆盖面变窄和累积偏差而下降。现有工作主要研究如何限制这种退化。然而,在迭代式模型进化中,更有意义的目标是确保每一代模型都比前一代有所改进,这需要以对数据整理有指导作用的粒度来诊断崩溃。我们在指令微调的场景下,研究了合成数据自我改进中的这一问题。我们表明,在此设置中,崩溃并非简单的均匀性能退化,而可能表现为能力的极化,即合成训练增强了已有的强项,同时进一步削弱了弱项。基于这一观察,我们提出了 KITE(基于知识边界的探索性指令微调),一个两阶段框架,结合了故障导向的数据生成和边界感知的不确定性整理。在多个数据集和多个开源 LLM 上的实验表明,KITE 相比强大的合成数据基线能实现更稳定的改进。 # 使用合成数据进行迭代指令微调时避免模型崩溃的学习 肖南罗¹,黄悦¹,柯汉郭¹,何平²,邹川³,华婷¹,张翔亮¹††感谢通讯作者。¹圣母大学,²范德堡大学,³宾夕法尼亚大学 ## 1 引言 合成数据已成为大型语言模型 \(LLMs\) 后训练中越来越重要的组成部分 \(Liu et al., 2024 (https://arxiv.org/html/2607.17043#bib.bib8); Schick and Schütze, 2021 (https://arxiv.org/html/2607.17043#bib.bib9); Riabi et al., 2021 (https://arxiv.org/html/2607.17043#bib.bib10); Zhao et al., 2024 (https://arxiv.org/html/2607.17043#bib.bib11); Wei et al., 2024 (https://arxiv.org/html/2607.17043#bib.bib15); Huang et al., 2025a (https://arxiv.org/html/2607.17043#bib.bib16), b (https://arxiv.org/html/2607.17043#bib.bib20); Lee et al., 2024 (https://arxiv.org/html/2607.17043#bib.bib19)\)。然而,对合成数据的日益依赖引入了一个根本性挑战:*模型崩溃* \(Shumailov et al., 2024 (https://arxiv.org/html/2607.17043#bib.bib1); Dohmatob et al., 2024b (https://arxiv.org/html/2607.17043#bib.bib2); Gerstgrasser et al., 2024 (https://arxiv.org/html/2607.17043#bib.bib3); Zhu et al., 2025 (https://arxiv.org/html/2607.17043#bib.bib4); Feng et al., 2025 (https://arxiv.org/html/2607.17043#bib.bib5); Drayson et al., 2025 (https://arxiv.org/html/2607.17043#bib.bib6); Amin et al., 2025 (https://arxiv.org/html/2607.17043#bib.bib7); Kazdan et al., 2025 (https://arxiv.org/html/2607.17043#bib.bib34); Dohmatob et al., 2025 (https://arxiv.org/html/2607.17043#bib.bib35)\)。随着合成数据在后续训练语料库中占据越来越大的比例,新一代的 LLMs 将基于部分反映了前几代模型输出的数据进行优化。这可能会扭曲有效的训练分布,逐渐降低其多样性和对真实世界数据的保真度 \(Shumailov et al., 2024 (https://arxiv.org/html/2607.17043#bib.bib1)\)。模型可能不会保留人类生成语料库的全部丰富性,而是将重点放在从早期合成世代继承的、反复出现的高概率模式上。这种漂移可能会在迭代训练中累积,最终减少对长尾能力的覆盖,并损害在留出任务上的性能。 图注图 1:Llama-3-8B-Instruct 在 GSM8K 上的选择性技能熟练度概况,比较基础模型与在累积合成数据上微调的模型。最近的研究增进了对合成数据下模型崩溃的理解。Shumailov 等人 \(2024 (https://arxiv.org/html/2607.17043#bib.bib1)\) 表明,在模型生成的数据上进行递归训练会诱发一种退化性反馈回路,而 Dohmatob 等人 \(2024b (https://arxiv.org/html/2607.17043#bib.bib2)\) 将这种现象与由长尾支持丢失引起的标度律变化联系起来。Gerstgrasser 等人 \(2024 (https://arxiv.org/html/2607.17043#bib.bib3)\) 进一步表明,将真实数据与累积的合成数据一起保留可以使测试误差保持有界,而 Zhu 等人 \(2025 (https://arxiv.org/html/2607.17043#bib.bib4)\) 提出了 token 级别的编辑作为一种实践方法来合成文本数据同时减少崩溃。尽管有这些进展,但重要的空白仍然存在。首先,现有工作主要关注如何控制崩溃以使退化不是无界的。然而,在迭代式模型进化中,更有意义的目标是确保每一代模型都比前一代有所改进。其次,现有分析通常以聚合级别描述崩溃,例如整体准确率下降或长尾变窄,这对于指导合成数据构建来说过于粗略。例如,崩溃可能源于数据变得过于狭窄和重复(这需要数据多样化),也可能源于模型在特定技能子集上存在弱点(这需要更有针对性的数据构建)。这激发了*以对数据整理有指导作用的粒度来诊断崩溃*的需求。我们研究自我改进机制中的模型崩溃,其中塑造训练分布的*指令*来自模型自身的生成。遵循常见做法,我们仅将一个强大的外部模型用作*验证器*来检查和规范化答案,并且我们以相同的方式将其应用于我们比较的每种方法。这需要同时解决两个挑战:(1) 以对数据整理有指导作用的粒度诊断模型崩溃,以及 (2) 设计支持持续模型改进的合成数据构建策略。为了解决第一个问题,我们实证研究合成数据如何改变进化模型的*技能概况*。以 GSM8K \(Cobbe et al., 2021 (https://arxiv.org/html/2607.17043#bib.bib21)\) 为例,我们应用教育科学中认知评估模型家族中的确定性输入噪点与门模型 \(DINA\) \(De La Torre, 2009 (https://arxiv.org/html/2607.17043#bib.bib22)\) 来估计基础模型和在使用累积合成数据训练的微调模型上的*技能掌握度*。图 1 (https://arxiv.org/html/2607.17043#S1.F1) 可视化了技能概况的一个子集(其他数据集和模型、微调设置以及数据合成程序的完整结果详见于附录 8.2 (https://arxiv.org/html/2607.17043#S8.SS2))。我们从图 1 (https://arxiv.org/html/2607.17043#S1.F1) 观察到,一方面,合成数据改进了之前已经足够强的若干技能,包括数据和货币与金融。另一方面,一些基础模型尚未完全掌握的弱技能在微调模型中变得更弱,例如代数与时间与日程安排。这一结果表明,指令微调中的模型崩溃并非整体性能的均匀退化,而是一种*能力的极化*:合成数据可能进一步强化已有的强项,同时削弱弱势技能。受上述发现的启发,我们通过提出 KITE(基于知识边界的探索性指令微调)来解决第二个问题,这是一个用于迭代式模型进化中合成数据构建的两阶段框架。总体而言,KITE 旨在提供有用的学习信号,使得新添加的合成数据能够改进而非破坏下一代模型。在第一阶段,KITE 通过提取由 DINA 模型指导的模型失败中的弱点概况来构建一个大型候选库,然后使用基于排名的噪声注入生成新数据,这鼓励探索主导的高概率区域之外的空间。在第二阶段,它使用核边界不确定性 \(KBU\)(一种基于似然加权的语义不确定性分数)来整理此候选库,该分数识别靠近模型语义知识边界的数据。在多个推理数据集上的指令微调实验表明,KITE 能够实现稳定且有效的模型进化。总之,我们做出以下关键贡献:1) 我们研究了迭代式合成数据指令微调中的模型崩溃,并表明失败不是均匀退化,而是*能力的极化*;2) 我们提出了 KITE,其两个阶段通过故障导向生成和边界感知的 KBU 整理直接逆转了极化的两个分支,并在多个数据集和多个开源 LLM 上实证表明,与强大的合成数据基线相比,它产生了更稳定的多代改进。 ## 2 相关工作 ### 2.1 模型崩溃 模型崩溃研究的是当后几代模型在受过早期模型输出污染的数据上训练时出现的失败模式。Shumailov 等人 \(2024 (https://arxiv.org/html/2607.17043#bib.bib1)\) 的早期工作表明,在模型生成数据上的递归训练会逐渐扭曲学习到的分布并擦除低概率模式,而 Dohmatob 等人 \(2024b (https://arxiv.org/html/2607.17043#bib.bib2)\) 通过标度律的视角分析了同一现象,认为尾部支持的丢失导致了持续改进的中断,并进一步表明只要合成部分不消失,崩溃就会持续存在 \(Dohmatob et al., 2025 (https://arxiv.org/html/2607.17043#bib.bib35)\)。Gerstgrasser 等人 \(2024 (https://arxiv.org/html/2607.17043#bib.bib3)\) 和 Kazdan 等人 \(2025 (https://arxiv.org/html/2607.17043#bib.bib34)\) 表明,当合成数据与原始真实数据一起累积时,崩溃并非不可避免,此时测试误差可以保持有界。Zhu 等人 \(2025 (https://arxiv.org/html/2607.17043#bib.bib4)\) 提出 token 级别编辑来构建半合成文本。Feng 等人 \(2025 (https://arxiv.org/html/2607.17043#bib.bib5)\) 认为使用合成数据进行扩展需要验证,表明基于验证器的选择可以防止崩溃;Drayson 等人 \(2025 (https://arxiv.org/html/2607.17043#bib.bib6)\) 表明机器生成文本检测可用于减少崩溃;Amin 等人 \(2025 (https://arxiv.org/html/2607.17043#bib.bib7)\) 表明,即使是经过适当整理、表现较弱的模型生成数据也能支持持续的模型改进。然而,大多数现有工作主要从退化控制的角度处理该问题,其目标是保持退化有界。相比之下,我们针对指令微调研究迭代式模型进化,其中的关键挑战是以能够指导数据整理并支持从一代到下一代持续改进的粒度来诊断崩溃。 ### 2.2 用于合成数据的 LLMs 大型语言模型已成为合成数据生成的有力工具 \(Liu et al., 2024 (https://arxiv.org/html/2607.17043#bib.bib8)\),显著扩展了基于传统语言模型的早期方法 \(Schick and Schütze, 2021 (https://arxiv.org/html/2607.17043#bib.bib9)\)。最近的工作利用 LLMs 为多种目的构建合成数据,包括多语言问答 \(Riabi et al., 2021 (https://arxiv.org/html/2607.17043#bib.bib10)\)、对话系统 \(Zhao et al., 2024 (https://arxiv.org/html/2607.17043#bib.bib11)\)、指令微调 \(Xu et al., 2025 (https://arxiv.org/html/2607.17043#bib.bib12); Zhang et al., 2025 (https://arxiv.org/html/2607.17043#bib.bib13); Zhong et al., 2025 (https://arxiv.org/html/2607.17043#bib.bib14)\)、事实性改进 \(Wei et al., 2024 (https://arxiv.org/html/2607.17043#bib.bib15)\)、科学推理 \(Huang et al., 2025a (https://arxiv.org/html/2607.17043#bib.bib16)\) 以及数据集多样化 \(Dai et al., 2025 (https://arxiv.org/html/2607.17043#bib.bib17); Riaz et al., 2025 (https://arxiv.org/html/2607.17043#bib.bib18)\)。最近的框架如 DataGen \(Huang et al., 2025b (https://arxiv.org/html/2607.17043#bib.bib20)\) 和 Janus \(Lee et al., 2024 (https://arxiv.org/html/2607.17043#bib.bib19)\) 进一步突出了 LLMs 为模型训练、评估和对齐生成高质量合成语料库的潜力。然而,这些工作主要将合成数据作为改善下游性能的手段,通常是在数据由更强的外部模型生成并用于单轮训练流程的场景中。这与模型崩溃现象不同,在后者的场景中,后几代模型是在源自自身分布的数据上训练的。我们关注的是自生成数据下的迭代式模型进化。 图注图 2:上图:使用 KITE 合成的迭代式模型进化。下图:KITE 的两个阶段,故障导向的候选库构建和核边界不确定性 \(KBU\) 数据整理。 ## 3 方法论 ### 3.1 符号表示与公式化 令 \(M_t\) 表示在进化步骤 \(t\) 时遵循指令的模型,其输出分布为 \(p_{M_t}(y \mid x)\),其中 \(x\) 是指令,\(y\) 是答案。我们从初始的已验证训练集 \(D_0^\star = \{(x_i, y_i^\star)\}_{i=1}^{n_0}\)(例如,人类数据)开始,并通过*累积*随时间变化的训练数据来模拟现实世界模型进化:在步骤 \(t\),我们的流程在标注预算 \(B\) 下生成一个新的合成整理集 \(D_t = \{x_i\}_{i=1}^B\),然后对其进行标注得到 \(D_t^\star = \{(x_i, y_i^\star)\}_{i=1}^B\),下一个模型在监督微调 \(SFT\) 目标下,基于目前所有已验证数据的并集进行训练。我们强调,每个 \(M_t\) 是通过在 \(D_t^\star\) 上微调一个相同的基础模型获得的,而不是从 \(M_{t-1}\) 继承而来。具体来说,我们首先生成一个大型的合成候选库 \(\mathcal{B}_t = \{x_i\}_{i=1}^N\),其中 \(N \gg B\),然后选择 \(D_t \subseteq \mathcal{B}_t\),满足 \(|D_t| = B\),并应用一个强大的已验证标注器来获取用于训练的 \(D_t^\star\)。我们将我们设定中的*模型崩溃*定义为*留出性能的退化*。我们的目标是设计数据构造算子,该算子生成和整理训练数据,使得模型进化是*自我改进的*。迭代式模型进化和 KITE 框架如图 2 (https://arxiv.org/html/2607.17043#S2.F2) 所示。本节的其余部分将详细说明我们构建 \(\mathcal{B}_t\) 和选择 \(D_t\) 的两阶段流程,使得每个新添加的切片 \(D_t^\star\) 同时满足 (i) 针对当前弱点和 (ii) 在累积训练模式下可靠地改进下一个模型。 ### 3.2 第一阶段:故障导向的候选库构建 在进化步骤 \(t\),我们的第一阶段构建一个大小为 \(N \gg B\) 的大型合成*候选库* \(\mathcal{B}_t\),其作用是 (i) 拓展模型内部高概率模式之外的覆盖范围,以及 (ii) 将生成集中在*当前弱点*上,以便后续的整理能够将验证器预算用于具有真正学习价值的示例。具体来说,我们通过 (1) 利用 DINA 模型从训练失败中提取弱点概况,以及 (2) 通过基于排名的噪声注入采样新的指令,来生成 \(\mathcal{B}_t\)。

相似文章

模型崩溃怎么回事?

Reddit r/LocalLLaMA

对模型崩溃的探讨,这是一种AI模型在合成数据上训练后,其质量和多样性下降的现象。

高效数据合成的一个信息论准则

arXiv cs.LG

本文从信息论角度解释了合成数据何时会改善或降低LLM训练效果,区分了信息开放和信息封闭的生成循环,并通过数据处理不等式解释了模型崩溃的原因。