大语言模型预训练的数据混合:综述与展望
摘要
# 大语言模型预训练的数据混合:综述与展望 来源:[https://arxiv.org/abs/2604.16380](https://arxiv.org/abs/2604.16380) [查看 PDF](https://arxiv.org/pdf/2604.16380) > 摘要:大型语言模型(LLMs)依赖于在海量且异构的语料上进行预训练,在现实中的计算和数据预算限制下,训练数据的构成对训练效率和下游泛化能力有着决定性的影响。与样本级的数据选择不同,数据混
查看缓存全文
缓存时间: 2026/04/21 07:03
# 大语言模型预训练中的数据混合:综述与展望 来源:https://arxiv.org/abs/2604.16380 查看 PDF (https://arxiv.org/pdf/2604.16380) > **摘要:**大语言模型(LLMs)依赖于对海量异构语料库的预训练。在实际的计算与数据预算约束下,训练数据的构成对训练效率及下游泛化能力具有决定性影响。与样本级数据选择不同,数据混合通过优化领域级采样权重,能够更有效地分配有限资源。近年来,涌现出大量提出严谨原则的数据混合方法以用于 LLM 预训练;然而,现有文献依然零散,缺乏专门的系统性综述。本文对 LLM 预训练中的数据混合技术进行了全面回顾。我们首先将数据混合优化形式化为概率单纯形上的双层问题,厘清了其在预训练流水线中的角色,并简要说明了现有方法如何在实践中使该公式化求解变得可行。随后,我们引入了一套细粒度分类体系,从两个维度对现有方法进行组织:静态混合与动态混合。静态混合进一步划分为基于规则和基于学习的方法,动态混合则归类为自适应与外部引导两类。针对每个类别,我们总结了代表性方案,并从性能与成本权衡的角度剖析了各自的优势与局限。基于上述分析,我们指出了跨越各类方法的共性挑战,包括在不同数据域、优化目标、模型和验证集之间有限的可迁移性,评估协议与基准测试缺乏标准化,以及基于学习方法中性能提升与成本控制之间固有的张力。最后,我们勾勒了若干探索方向,包括更细粒度的领域划分、逆向数据混合以及流水线感知设计,旨在为未来研究提供概念与方法论层面的洞见。 ## 投稿历史 From: Zhuo Chen \[查看邮箱 (https://arxiv.org/show-email/0f376c56/2604.16380)\] **\[v1\]**Wed, 25 Mar 2026 13:30:40 UTC \(3,858 KB\)
相似文章
AC-ODM: Actor-Critic在线数据混合方法用于样本高效的大语言模型预训练
AC-ODM 使用强化学习动态优化大语言模型的预训练数据组成,实现了更快的收敛速度和更高的下游任务准确率,且计算开销可忽略不计。
DataFlex:面向大语言模型数据驱动动态训练的统一框架
DataFlex是一个面向大语言模型数据驱动动态训练的统一框架,集成了样本选择、领域混合调整和样本重加权,兼容标准工作流程并支持高效大规模部署,相比静态训练实现了一致的性能提升。
DecoupleMix: 解耦比率搜索与凸优化分配用于可扩展的VLM数据配方
DecoupleMix引入了一个系统框架,通过解耦类间和类内比率搜索来优化视觉语言模型的预训练数据混合,使用凸优化来提升可扩展性和性能,超越启发式基线。
始终学习,始终混合:高效简单的全时数据混合
本文介绍了OP-Mix,一种数据混合算法,它利用在当前模型上训练的低秩适配器来廉价模拟候选数据混合,从而在预训练、持续中间训练和持续指令微调中实现高效统一的数据混合。OP-Mix 始终能找出接近最优的混合方案,而计算量仅为基线方法的一小部分;在预训练中将平均困惑度提升了6.3%,在持续学习场景中减少了66-95%的计算量。
大语言模型中的预训练数据暴露:成员推理、数据污染及安全影响综述
统一综述大语言模型中的预训练数据暴露(PDE),涵盖成员推理、数据污染和安全影响,并回顾了攻击与防御方法。