数据混合作为混合实验:响应曲面方法与大型语言模型预训练的最优设计

arXiv cs.AI 论文

摘要

本文将大型语言模型预训练的数据混合构建为混合实验,应用响应曲面方法和最优实验设计来提高代理训练运行的效率和可解释性。

arXiv:2608.23922v1 Announce Type: new 摘要:数据混合是大型语言模型预训练中的核心设计问题:在固定词符预算下,从业者必须决定如何将数据分配给每个领域。近期基于代理的方法通过在候选混合上训练小模型、拟合响应模型,并利用该响应选择混合进行更大规模训练来解决此问题。我们展示该工作流具有经典混合实验的结构。在此视角下,数据域是混合组分,词符份额是组分比例,代理训练运行是实验设计点,验证损失定义了概率单纯形上的响应曲面。我们使用稀疏二阶Scheff\'{e}响应曲面模型发展此构建,并为代理数据混合实验构建模型鲁棒的$\mathcal{I}$-最优设计。以RegMix为实证案例研究,我们演示该框架如何既解释观察到的混合响应又设计更高效的代理实验。Scheff\'{e}分析表明领域价值具有强关系性:几个在加性效应下较弱的领域通过成对交互变得有利,尤其是与源自网页的文本组合时。稀疏Scheff\'{e}模型在不同模型规模上保持混合排序,并在提供加性和交互效应显式分解的同时,与灵活的机器学习预测器保持竞争力。在基于观察代理训练响应校准的模拟研究中,模型鲁棒的$\mathcal{I}$-最优设计在移除约25\%原始代理运行后恢复了相关混合排序。这些结果表明LLM数据混合不仅应被视为预测问题,还应视为实验设计问题,其中代理混合本身可被选择以提高统计效率。
查看原文
查看缓存全文

缓存时间: 2026/08/26 09:17

# 数据混合作为混合实验:面向大语言模型预训练的响应面法与优化设计  
来源:https://arxiv.org/html/2608.23922  
作者:Yicheng Mao  
机构:加拿大阿尔伯塔省卡尔加里市卡尔加里大学数学与统计系,地址:University Drive NW, Calgary, T2N 1N4  
作者:Hongru Du  
机构:美国弗吉尼亚州夏洛茨维尔市弗吉尼亚大学系统与信息工程系  
通讯作者邮箱:hongrudu@virginia\.edu  

###### 摘要  

数据混合是大语言模型预训练中的核心设计问题:在固定的token预算下,从业者必须决定如何向各领域分配数据量。近期基于代理模型的方法通过在候选混合数据上训练小模型、拟合响应模型并利用响应选择混合方案,以用于更大规模的训练,从而解决该问题。本文证明该工作流程具有经典混合实验的结构特征。在此视角下,数据领域对应混合组分,token占比对应组分比例,代理训练运行对应实验设计点,而验证损失则定义了概率单纯形上的响应面。我们采用稀疏二阶Scheffé响应面模型阐述此框架,并构建模型稳健的$\mathcal{I}$-最优设计用于代理数据混合实验。以RegMix为实证案例,展示了该框架如何解释已观测的混合响应并设计更高效的代理实验。Scheffé分析表明领域价值具有强关联性:多个在加性效应下表现较弱的领域,通过成对交互作用(尤其是与网络文本的组合)变得更具优势。稀疏Scheffé模型在跨模型规模时保持混合排序的稳定性,其性能可与灵活的机器学习预测器相媲美,同时提供了加性与交互效应的显式分解。在基于已观测代理训练响应校准的模拟研究中,模型稳健的$\mathcal{I}$-最优设计在剔除约25%原始代理运行后仍能恢复相关的混合排序。这些结果表明,LLM数据混合不仅应视为预测问题,更应作为实验设计问题——代理混合方案本身可通过优化提升统计效率。  

关键词:混合实验,Scheffé多项式,最优实验设计,大语言模型,数据混合,预训练  

## 1 引言  

大语言模型的性能高度依赖预训练语料库的组成。现代预训练数据集由网络文本、代码、科学文献和书籍等多个数据领域组合而成,各领域的分配比例既影响验证损失,也决定下游任务表现(Gao等,2021;Longpre等,2023)。由于总token预算通常固定,增加某一领域的占比必然压缩其他领域的可用空间。因此,数据混合选择本质上是一个受限分配问题,已成为LLM预训练的核心设计议题。在大规模预训练场景下,次优的混合选择将直接导致计算资源浪费和模型能力下降,使得科学合理的混合选择具有理论与实践双重重要性。  

近期研究开始将数据混合权重视为可估计、可调整或可优化的变量,而非语料库构建的固定参数。例如,DoReMi(Xie等,2023)采用小型代理模型与分组分布鲁棒优化来学习领域权重,随后应用于更大规模预训练。更近期的研究进一步明确了混合比例与模型性能的关联机制:Data Mixing Laws(Ye等,2025)拟合预测函数描述采样混合与语言建模损失的关系;BiMix(Ge等,2025)通过建模混合比例与数据量的联合效应扩展了该思路;RegMix(Liu等,2025)同样在采样混合数据上训练小型代理模型,并通过回归模型预测未见混合在大规模训练中的表现。综上,这些研究逐渐将数据混合视为可量化的分配问题:通过变动混合比例、观测或预测模型响应,利用所得信息指导后续混合选择。  

本文的核心发现是,该分配问题具有经典混合实验的几何结构。数据混合的预测变量并非普通协变量,而是须满足非负性与和为一约束的比例值,因此所有可行混合方案均位于概率单纯形上。这一几何特征与经典混合实验完全一致——在经典实验中,响应变量取决于多种组分的相对比例,而非独立可调的输入(Cornell,2002)。典型案例是配方问题:食品产品的口感取决于原料配比,化学产品的性能取决于化合物成分比例(Goos与Hamidouche,2019;Furlanetto等,2011)。同样的混合实验逻辑也适用于更抽象的分配问题,其中“组分”并非物理原料,而是固定资源的份额。例如:广告媒介组合研究将固定预算分配至不同媒介渠道以量化渠道效应与跨媒介协同作用(Goos等,2019);出行预算研究将固定出行预算分配至不同交通方式(Zijlstra等,2019)。所有这些案例中,单一组分的效应无法脱离其他组分独立解释——增加某份额必然减少剩余份额。LLM数据混合遵循相同逻辑:组分为数据领域,混合比例为token占比,响应变量为训练后的验证损失或下游任务表现。  

该混合实验解释带来两方面方法论影响。其一,改变了响应面的构建方式。由于预测变量是受限比例值,拟合模型应尊重单纯形几何结构,而非将领域占比视为普通无约束协变量。这促使我们采用Scheffé响应面模型——该模型直接定义于单纯形(Scheffé,1958)。在当前语境中,它们可将拟合损失表面分解为领域加性贡献与成对偏离加性效应。这一点至关重要,因为某领域作为独立贡献者可能较弱,但与另一领域组合时却可能发挥优势。灵活的机器学习预测器或许能隐式捕获此类交互作用,但通常无法将其表达为可解释的量化形式。  

其二,混合实验解释改变了代理混合方案的选择方式。许多基于代理的数据混合工作流中,候选混合方案采用随机采样(如Dirichlet分布)。这种方法便捷且易于扩展,但并未探究这些混合方案是否为响应面估计的最优设计点。如果代理训练运行是实验设计点而非随机采样,则可通过优化其在单纯形上的位置来提升对混合区域的预测能力。由于实际目标是预测未见混合方案的表现,$\mathcal{I}$-最优性成为自然标准——它旨在最小化实验区域上的平均预测方差(Goos与Jones,2011)。此外,由于代理实验运行前并不知晓响应面阶数的合适性,可采用模型稳健设计在加性模型与包含交互项的候选模型之间平衡性能(Yu等,2008)。  

本文构建了面向LLM数据混合的混合实验框架:数据源作为组分,token占比作为混合比例,代理训练运行作为设计点,模型性能作为响应面。以公开的RegMix代理训练数据为实证案例,我们拟合稀疏二阶Scheffé模型以估计可解释的加性与交互效应,评估这些结构化响应面能否在跨模型规模时保持混合排序,并构建模型稳健的$\mathcal{I}$-最优设计以测试能否用更少代理运行恢复有效的混合排序。尽管实证分析基于RegMix场景,但该方法论框架适用于任何将固定训练预算分配至数据源的基于代理的数据混合工作流。  

本文贡献体现在三方面:其一,将LLM数据混合形式化为概率单纯形上的混合响应面实验,将基于代理的数据混合工作流与混合建模及最优实验设计的统计文献相联结;其二,展示稀疏Scheffé模型如何揭示原本隐藏在黑箱预测器中的领域加性效应与成对交互作用;其三,证明最优设计可用于提升代理数据混合实验效率,减少恢复可靠混合排序所需的代理训练预算,并表明代理混合方案的选择值得与结果数据的建模同等重视。  

后续章节结构如下:第2节将基于代理的数据混合形式化为混合响应面实验;第3节介绍稀疏Scheffé响应面模型与模型稳健的$\mathcal{I}$-最优设计准则;第4节报告RegMix数据的Scheffé重分析及其跨尺度排序保持性能;第5节评估代理数据混合实验的模型稳健$\mathcal{I}$-最优设计;第6节讨论局限性并展望未来研究方向。  

## 2 代理数据混合的混合实验框架  

考虑固定预训练token预算分配至$K$个数据领域。记  
$$\mathbf{x}=(x_1,\ldots,x_K)^\top$$  
为领域比例向量。每个候选混合方案满足  
$$x_i\geq 0,\qquad\sum_{i=1}^K x_i=1.$$  
因此可行数据混合空间为$(K-1)$维概率单纯形。实际目标是在该固定预算单纯形约束下,识别能优化特定训练目标(如验证损失或下游任务表现)的混合方案$\mathbf{x}$。  

基于代理的数据混合研究可视为对该单纯形的实验。研究过程包括:选择一组候选混合方案,在每种混合方案上训练或评估小模型,将所得验证损失或下游分数记录为响应值。随后拟合从混合比例到模型性能的预测模型,并用于指导后续更大规模训练的混合选择。在此视角下,数据源对应混合组分,token占比对应组分比例,代理训练运行对应实验设计点,拟合的预测器则对应单纯形上的响应面。  

RegMix代理训练数据(Liu等,2025)为此通用结构提供了有用的实证范例。RegMix从Dirichlet分布中采样候选混合方案,在每种采样混合上训练小型代理LLM,记录待优化的目标值,并使用混合比例作为特征、目标值作为标签拟合回归模型。拟合模型随后预测大规模候选混合池的表现,从中选择预测最优的混合方案用于更大规模训练。本文分析的主实验中,RegMix使用Pile数据集(Gao等,2021)的17个可用领域,在512个各含1B token的代理模型(参数规模为1M非嵌入参数)上进行训练,并在1M、60M和1B模型规模的留出混合数据上评估回归模型性能。本文分析使用的领域标签详见表1。所有实证分析均在此特定实验设置内完成,其发现能否推广至其他领域分类、语料库或训练目标,将在讨论部分进一步探讨。  

表1:RegMix主实验使用的Pile领域标签  

该设置下的代理到大规模迁移依赖跨尺度排序保持性。实际意义上,在代理预算下训练表现相对较好的混合方案,预计在更大预算下训练的大模型中仍能保持相对优势。这一假设使得利用大量低成本代理运行指导昂贵的大规模混合选择成为可能,也解释了为何RegMix主要通过跨尺度排序相关性而非绝对损失预测来评估回归模型(Liu等,2025)。  

混合实验解释使此类代理工作流的结构显式化:采样的代理混合方案是设计点,验证损失是响应值,拟合模型是单纯形上的响应面。预测变量并非普通无约束协变量:增加某领域占比必然减少其他领域的总可用比例。这种组合约束正是经典混合实验的定义特征。表2总结了此对应关系。  

表2:基于代理的数据混合与经典混合实验方法的对应关系  

此重新解释具有双重意义。其一,改变了响应面的建模方式。标准回归或机器学习预测器可用于混合排序,但不一定能表达预测变量的组合结构。例如RegMix比较了线性回归与LightGBM(Ke等,2017)。线性模型结构简单但本质具有加性,而LightGBM仅能通过拟合的树集成隐式捕获非线性与交互作用。Scheffé响应面模型提供了自然的替代方案:它们直接定义于单纯形,并可通过显式系数表示成对领域交互作用。当数据源的价值不仅取决于其自身占比,还取决于与其他领域的组合关系时,这种表达方式尤为有用。

相似文章

大语言模型预训练的数据混合:综述与展望

arXiv cs.CL

# 大语言模型预训练的数据混合:综述与展望 来源:[https://arxiv.org/abs/2604.16380](https://arxiv.org/abs/2604.16380) [查看 PDF](https://arxiv.org/pdf/2604.16380) > 摘要:大型语言模型(LLMs)依赖于在海量且异构的语料上进行预训练,在现实中的计算和数据预算限制下,训练数据的构成对训练效率和下游泛化能力有着决定性的影响。与样本级的数据选择不同,数据混

始终学习,始终混合:高效简单的全时数据混合

arXiv cs.CL

本文介绍了OP-Mix,一种数据混合算法,它利用在当前模型上训练的低秩适配器来廉价模拟候选数据混合,从而在预训练、持续中间训练和持续指令微调中实现高效统一的数据混合。OP-Mix 始终能找出接近最优的混合方案,而计算量仅为基线方法的一小部分;在预训练中将平均困惑度提升了6.3%,在持续学习场景中减少了66-95%的计算量。

数据约束下的混合预训练缩放定律

arXiv cs.LG

本文研究了在混合预训练中稀缺目标数据与丰富通用数据之间的权衡,发现重复是驱动性能的关键因素,并且混合训练能容忍目标数据重复15-20次。我们引入了一个考虑重复影响的缩放定律,以优化数据约束条件下的混合配置。