高效数据合成的一个信息论准则

arXiv cs.LG 论文

摘要

本文从信息论角度解释了合成数据何时会改善或降低LLM训练效果,区分了信息开放和信息封闭的生成循环,并通过数据处理不等式解释了模型崩溃的原因。

arXiv:2605.16379v1 公告类型:新发布 摘要:合成数据对于大型语言模型的训练变得至关重要,但其效果极不稳定。我们提供了对这一不一致性的信息论解释:只有当生成-训练循环是信息开放的时,合成数据才能改善模型,即循环由外部信号(验证器、环境或评分标准)塑造,这些信号注入了超出模型当前分布的任务相关信息。当循环是信息封闭的(依赖模型自身的输出而没有此类信号)时,数据处理不等式确保任务相关信息只会减少,使得模型崩溃成为可预测的结果。在信息开放的流水线中,效率和泛化能力都取决于监督的元层次:粗糙的信号,如二元正确性,将所有可接受的输出视为等价,因此其所教导的行为不绑定于任何特定领域或表面形式,并能在任务和领域间自然泛化。这些观察导致了一个指导性论点:学习倾向于收敛到可用的信息效率最高的信号组件,当该组件是预期目标时加速学习,但当虚假模式恰好更简单时则导致奖励破解。
查看原文
查看缓存全文

缓存时间: 2026/05/19 06:42

# 高效数据合成的信息论准则 来源:https://arxiv.org/html/2605.16379 ###### 摘要 合成数据对大型语言模型的训练至关重要,但其有效性高度不一致。我们从信息论角度解释了这种不一致性:只有当生成-训练循环是信息开放的——即由外部信号(验证器、环境或评分标准)塑造,这些信号注入了超越模型当前分布的任务相关信息时,合成数据才能提升模型性能。当循环是信息闭合的(依赖模型自身输出而无此类信号)时,数据处理不等式确保任务相关信息只会减少,因此模型崩溃是可预测的结果。在信息开放的流水线中,效率与泛化能力均取决于监督的元层级:一个更粗粒度的信号,如二元正确性,将所有可接受的输出视为等价,因此所教导的行为不绑定于任何特定领域或表面形式,并能自然地跨任务和领域泛化。这些观察得出了一个指导性论点:学习优先收敛于训练数据中最信息高效的信号分量;当该分量是预期信号时,这会加速学习;但当某个虚假模式恰好更简单时,则会导致奖励破解。 机器学习, ICML, 合成数据, 信息论, 数据处理不等式

## 1 引言

缩放定律驱动了大语言模型(LLM)的稳步进步,性能随着模型大小、计算量和训练数据的增长而可预测地提升 (Kaplan et al., 2020 (https://arxiv.org/html/2605.16379#bib.bib22))。然而,这一范式建立在一个日益脆弱的前提之上:大量高质量真实世界文本的持续可用性。近期分析表明,此类数据可能正接近实际极限 (Villalobos et al., 2024 (https://arxiv.org/html/2605.16379#bib.bib48))。与此同时,随着LLM被推向长程推理、多步规划和智能体交互,最有效的监督形式越来越依赖于显式约束、反馈和验证——这远远超出了通用文本语料库所能提供的范围。这两种趋势——数据稀缺性与对更丰富监督的需求——使合成数据成为现代训练流水线的核心要素。然而,合成数据仍是一把双刃剑。一方面,生成的监督产生了实质性收益:验证器引导的合成达到了奥林匹克级别的几何水平 (Trinh et al., 2024 (https://arxiv.org/html/2605.16379#bib.bib46)),而基于可验证奖励的强化学习则推动了重大推理突破 (Guo et al., 2025 (https://arxiv.org/html/2605.16379#bib.bib16); Zheng et al., 2024 (https://arxiv.org/html/2605.16379#bib.bib55))。另一方面,迭代式自训练——模型在其自身输出上训练——常常导致分布崩溃和渐进式性能退化 (Shumailov et al., 2024 (https://arxiv.org/html/2605.16379#bib.bib41); Alemohammad et al., 2024 (https://arxiv.org/html/2605.16379#bib.bib2); Gerstgrasser et al., 2024 (https://arxiv.org/html/2605.16379#bib.bib14))。尽管有许多经验性的缓解技术,但对于合成数据何时以及为何有帮助或有害,仍缺乏原则性的解释。这引出了一个具体问题:在什么条件下,合成数据能带来持续改进,又在何时会导致性能下降?

我们通过信息论的视角,以数据处理不等式(DPI)为基础来探讨这个问题。DPI陈述了一个简单而有力的事实:对观测数据的任何计算都无法创造出关于潜在来源的新信息。将其应用于自训练,其含义立即可见。当模型在从其自身分布采样的样本上进行训练,且没有额外的任务相关信号进入循环时,该流水线是信息闭合的:每一轮迭代只能保持或丢失关于真实任务的信息。在实践中,有限的采样和优化误差使得这种丢失成为必然,因此模型对任务的知识会随着迭代而退化。因此,模型崩溃并非异常——而是闭合信息循环的预测结果。

然而,这一DPI论证本身过于悲观:它无法解释为何合成数据常常能取得惊人的成功。问题的关键在于,成功的流水线并非真正的闭合系统。它们融入了外部信号——验证器、评分标准、环境或固定的教师模型——这些信号携带独立于当前模型状态的任务相关信息。一旦我们考虑了这些信号,DPI论证不但没有失效,反而更加精确:悲观的单调性仅在缺少此类信号时成立。当存在外部信号时,相关的信息界限不仅包括训练数据,还包括信号超出数据本身所贡献的部分。问题于是从“合成数据能增加信息吗?”转变为“外部信号携带的任务相关信息超出了模型已知的多少?”持续改进仅在以下条件成立时才是可能的:这个量保持为正——即循环保持信息开放。

给定一个信息开放的流水线,一个自然的后续问题是:它注入信息的效率有多高?我们认为,一个关键决定因素是我们所称的监督信号的元层级——即它区分输出的粒度。低元层级信号指定一个特定目标(例如,单一参考答案);高元层级信号仅指定一个粗粒度属性(例如,“答案是否正确?”)并将所有满足该属性的输出视为可互换。由于高元层级信号将许多表面差异压缩为一个判断,每个监督单位约束了输出空间中一个更大的区域,从而使学习显著更高效。一个自然的推论,也是本文的指导性论点,是学习优先收敛于训练数据中最信息高效的信号分量。这个论点具有两面性:当预期信号是最高效的信号时,它解释了为何高元层级监督能带来快速学习和强大的跨领域泛化能力;而当某个虚假信号恰好比预期信号具有更粗的粒度时,同样的动态会导致奖励破解。

#### 利益冲突披露。作者声明与本文所述工作无任何财务利益冲突。

## 2 合成数据案例研究

我们首先精确界定“合成数据”的含义,并识别出任何理论解释都必须解释的三个反复出现的经验模式。我们在机制意义上使用“合成”:如果监督是由自动化流水线(通常是LLM生成器加工具)产生并用于训练,那么它就是合成的。在此定义下,“合成”并不意味着“虚假”:它仅表示监督来源于自动化过程而非直接的人工标注。在大量文献中,“合成数据”大致与模型生成的文本同义。我们的定义在什么算作监督方面更广泛(不仅包括指令-响应对,还包括偏好、奖励、验证器反馈和保留的轨迹)。具体来说,即使提示(有时也包括最终答案)来自真实数据集,基于可验证奖励的强化学习(RLVR)仍然可以生成中间轨迹,这些轨迹只有在通过可验证检查时才会被保留;那些被保留的轨迹在我们的意义上起着合成监督的作用。有了这一术语,我们总结以下三种反复出现的模式:闭环自训练(失败)、硬验证器(成功I)和软但稳定的参考(成功II)。

#### 失败(闭环自训练)。当训练主要回收模型自身的生成,而没有持久的外部信号时,循环倾向于收缩输出分布:尾部模式被欠采样,错误变得自我强化 (Shumailov et al., 2024 (https://arxiv.org/html/2605.16379#bib.bib41); Alemohammad et al., 2024 (https://arxiv.org/html/2605.16379#bib.bib2))。当合成数据逐步替代真实数据时,这种效应最为强烈,而每一轮混入真实数据则可以缓解崩溃 (Gerstgrasser et al., 2024 (https://arxiv.org/html/2605.16379#bib.bib14))。合成数据占主导的体制还可能通过削弱长尾建模来扭曲缩放行为 (Dohmatob et al., 2024 (https://arxiv.org/html/2605.16379#bib.bib12))。

#### 成功I(硬性可验证信号)。一条高可靠性的路径是“生成并验证”:候选结果通过外部程序(证明检查器、编译器/测试、基准测试框架)进行过滤、排序或奖励,方法包括拒绝采样、最佳N选一或RLVR (Guo et al., 2025 (https://arxiv.org/html/2605.16379#bib.bib16); Duo et al., 2026 (https://arxiv.org/html/2605.16379#bib.bib13))。显著成果是由可检查信号锚定的定性性能飞跃:在数学领域,验证器引导的搜索和蒸馏可以达到奖牌级性能(例如,IMO 2024银牌标准)(Hubert et al., 2025 (https://arxiv.org/html/2605.16379#bib.bib20); AlphaProof and AlphaGeometry teams, 2024 (https://arxiv.org/html/2605.16379#bib.bib3)),而AlphaGeometry风格的约束合成达到了金牌选手级别的几何求解水平 (Trinh et al., 2024 (https://arxiv.org/html/2605.16379#bib.bib46); Chervonyi et al., 2025 (https://arxiv.org/html/2605.16379#bib.bib8))。在形式化证明中,类似的配方在Lean验证下扩展至强大的基准性能 (Ren et al., 2025 (https://arxiv.org/html/2605.16379#bib.bib37); Chen et al., 2025b (https://arxiv.org/html/2605.16379#bib.bib7), a (https://arxiv.org/html/2605.16379#bib.bib6))。在发现循环中,形式化/可执行目标使得FunSearch、LegoNE和AlphaEvolve等系统能够报告由求解器或证明义务认证的算法改进(包括超越先前已知最佳人工设计的保证)(Romera-Paredes et al., 2024 (https://arxiv.org/html/2605.16379#bib.bib38); Li et al., 2025 (https://arxiv.org/html/2605.16379#bib.bib26); Novikov et al., 2025 (https://arxiv.org/html/2605.16379#bib.bib32))。在代码和系统领域,执行提供了验证器:AlphaCode和OpenCodeInterpreter依赖测试/运行时反馈 (Li et al., 2022 (https://arxiv.org/html/2605.16379#bib.bib25); Zheng et al., 2024 (https://arxiv.org/html/2605.16379#bib.bib55)),而智能体流水线在容器化环境中评估工件 (DeepSeek-AI et al., 2025 (https://arxiv.org/html/2605.16379#bib.bib11); Xiaomi LLM-Core Team et al., 2026 (https://arxiv.org/html/2605.16379#bib.bib49))。同一模板支持SAT求解和代码演化中的优化循环 (Sun et al., 2024 (https://arxiv.org/html/2605.16379#bib.bib43), 2025 (https://arxiv.org/html/2605.16379#bib.bib42)),并扩展到具有正确性检查加运行时选择的内核性能工程 (Chen et al., 2025c (https://arxiv.org/html/2605.16379#bib.bib5); Ouyang et al., 2025 (https://arxiv.org/html/2605.16379#bib.bib34))。

#### 成功II(软但稳定的参考)。对于缺乏明确正确性谓词的目标,稳定性来自于固定参考:教师模型、偏好/评分标准约束、宪法或评估工具,这些不会随学生模型自由共变。例如蒸馏和基于偏好的对齐 (Hinton et al., 2015 (https://arxiv.org/html/2605.16379#bib.bib17); Gudibande et al., 2024 (https://arxiv.org/html/2605.16379#bib.bib15); Tunstall et al., 2024 (https://arxiv.org/html/2605.16379#bib.bib47))、带有教师端判断的在线策略蒸馏 (Xiaomi LLM-Core Team et al., 2026 (https://arxiv.org/html/2605.16379#bib.bib49); Agarwal et al., 2024 (https://arxiv.org/html/2605.16379#bib.bib1); Lu, 2025 (https://arxiv.org/html/2605.16379#bib.bib29))、固定原则的自我改进 (Bai et al., 2022 (https://arxiv.org/html/2605.16379#bib.bib4))、分阶段过滤流水线 (Gudibande et al., 2024 (https://arxiv.org/html/2605.16379#bib.bib15)),以及在固定评估器下的迭代搜索 (Yuan et al., 2024 (https://arxiv.org/html/2605.16379#bib.bib51))。

## 3 通过数据处理不等式进行的理论分析

正如案例研究中讨论的,某些合成数据流水线表现得像一个仅回收模型自身分布的闭合系统,而另一些则保持开放,因为它们持续受到不由模型本身决定的信号的塑造。本节利用数据处理不等式(DPI)精确阐述这一区别,然后给出合成数据何时有效的实用准则。我们的目标并非否定DPI,而是澄清建模边界:DPI适用于信息闭合的马尔可夫抽象。只有当实际流水线不是信息闭合时——即当它包含与潜在源$X$相关的额外变量(外部信号、验证器、固定参考、环境),从而不能被吸收到一个单一固定信道中时——合成数据才能有效。

### 3.1 马尔可夫链形式化

设$X$表示我们最终关心的底层结构源(例如,诱导正确性的任务分布),$D$表示用于学习的有限观测(例如,训练数据集),$Z$表示学习到的模型状态(例如,参数)。我们将训练建模为一个(可能是随机化的)过程,它将$D$映射到$Z$。为明确随机性的作用,引入辅助随机变量$R$,它汇集了算法使用的所有内部随机性(初始化、小批量采样、优化器噪声、解码随机性等)。训练过程可写为 $Z = f_{\mathrm{train}}(D, R)$。

信息闭合的假设是,该过程没有关于$X$的额外边信息,超出了$D$中已有的信息;等价地,$P(Z \mid X, D) = P(Z \mid D)$,使得 $X \to D \to Z$ 构成一个马尔可夫链。在此假设下,DPI给出 $I(X;Z) \leq I(X;D)$,其中 $I(\cdot;\cdot)$ 是香农互信息。一个紧凑的证明来自链式法则:
$$
I(X;D,Z) = I(X;D) + I(X;Z \mid D) = I(X;Z) + I(X;D \mid Z),
$$
而马尔可夫性意味着 $I(X;Z \mid D) = 0$;因此 $I(X;Z) = I(X;D) - I(X;D \mid Z) \leq I(X;D)$。最后,将“随机性”与“信息”分开是有益的。内部随机性$R$可以改变优化动力学和探索,但除非它与某个与$X$相关的变量耦合,否则它本身不会增加关于$X$的信息。形式上,如果$R$不携带超出$D$的关于$X$的信息,则 $I(X;D,R) = I(X;D)$,且应用于 $X \to (D,R) \to Z$ 的DPI仍给出相同的上界。

### 3.2 自训练循环的失败

考虑一个纯粹的自训练循环。在第$t$轮迭代中,模型状态$Z_t$通过一个(可能是随机的)生成过程$f_{\mathrm{gen}}$(即本文机制意义上的“合成数据”)生成合成监督$D^{\mathrm{syn}}_t$,下一个模型状态通过在该合成监督上训练得到:
$$
D^{\mathrm{syn}}_t \sim f_{\mathrm{gen}}(Z_t), \qquad Z_{t+1} = f_{\mathrm{train}}(D^{\mathrm{syn}}_t, R_t).
$$

相似文章

知道何时放弃:通过多阶段飞行中拒绝实现令牌高效的LLM合成数据生成

arXiv cs.AI

本文提出了多阶段飞行中拒绝(MSIFR),一种无需训练的框架,通过在中间检查点检测并终止低质量生成轨迹来减少基于LLM的合成数据生成中的令牌浪费。在五个模型和七个基准测试中,MSIFR作为独立方法可减少11%-77%的令牌消耗,与早期退出方法结合时最多减少78.2%,同时保持或提升准确率。

迭代指令微调中从合成数据学习避免模型崩溃

arXiv cs.CL

本文研究了迭代指令微调中使用合成数据时的模型崩溃问题,揭示了崩溃表现为能力极化:强项被强化,弱项则进一步退化。提出了KITE,一个两阶段框架,结合失败引导的数据生成和边界感知的不确定性筛选,确保在多次迭代中稳定提升。

制作用于微调的合成数据集

Reddit r/LocalLLaMA

作者提出了一种使用形式求解器为LLM生成多样化合成推理训练数据的流程,并询问现有工作以及关于避免重复模板的建议。

面向API调用智能体的无环境合成数据生成

Hugging Face Daily Papers

本文提出了一种面向训练API调用LLM智能体的无环境合成数据生成方法,利用LLM作为即时数字世界模型生成轨迹,并在具有挑战性的基准测试上展现出显著的性能提升。