序列加权的规模化研究

Lobsters Hottest 论文

摘要

本研究探讨了语言模型训练中序列加权的缩放定律,发现模型随着规模增长表现出非单调行为:从学习通用模式转向学习数据特定模式,随后又回到通用模式。

<p><a href="https://lobste.rs/s/tamvz4/study_sequence_weighting_at_scale">评论</a></p>
查看原文
查看缓存全文

缓存时间: 2026/09/21 02:20

# 大规模序列加权研究 来源: https://blog.janestreet.com/a-study-of-sequence-weighting-at-scale/ *摘要: 我们研究了数据加权在内部及开源语言模型中的扩展规律,发现其在不同规模下呈现非单调变化特性。**我们调整训练时分配给序列的权重,并衡量模型损失降低与序列权重的相关强度。**综合来看,我们的结果符合一个普遍趋势:当模型从小规模过渡到中等规模时,其学习模式从独立于数据权重的通用规律,转变为按数据权重比例学习数据特定模式。**随着模型从中等规模过渡到大规模,它能够学习数据中存在的所有模式,再次独立于数据权重变化。* 训练神经网络时,我们常常需要深入思考希望模型学习什么。我们更关注模型在所有编程任务上的通用智能,还是专门精于OCaml?历史市场数据与近期收集的数据相比价值几何?总体而言,我们希望在多大程度上提高高质量数据的权重,让模型从中学习,还是允许模型从所有数据中学习?这些问题本质上都是*数据混合*问题,关乎如何以及在何处分配模型的表征能力和计算资源。 更复杂的是,实践中许多理想化的实验成本高昂到难以实现。即使在中等规模下,对超参数进行密集的多维网格搜索也几乎不可能,更不用说在最大规模下(针对特定任务可能只能训练一个模型)。解决这一问题的标准方法是通过*扩展规律*拟合超参数,即在小规模下拟合超参数,然后外推到更大规模(其经典案例是Chinchilla缩放定律 (https://arxiv.org/abs/2203.15556))。 跨规模学习率的Chinchilla式拟合示例。(https://blog.janestreet.com/a-study-of-sequence-weighting-at-scale/figure1.png)图1:跨规模学习率的Chinchilla式拟合示例。扩展定律的核心挑战在于,要使外推成立,大规模模型的行为必须满足以下条件之一:(a)与规模无关(例如,MuP式结果 (https://arxiv.org/abs/2203.03466),其中许多超参数最优值在不同规模下保持稳定),或(b)可通过外推小规模行为的变化来预测(例如,Kaplan式结果 (https://arxiv.org/abs/2001.08361),其中损失随规模增长可预测地下降)。遗憾的是,并非所有行为都具备这些特性:某些行为是在大规模下才涌现的,无法通过扩展定律预测。在本文中,我们将此类不可预测的扩展行为称为*异常*。 我们的内部实验表明,数据混合是一个特别容易出现异常扩展行为的场景。这与MAI-Thinking-1技术报告(第2.5.2节)(https://microsoft.ai/pdf/mai-thinking-1.pdf)中的发现相似,该报告显示随着模型规模增大,以代码为主和以STEM为主的数据混合训练质量排序发生了逆转。因此,我们着手精确量化语言模型在多大程度上按照数据混合中赋予该数据的权重比例来学习数据中的模式,以及这种行为如何随规模变化。 数据混合实验可能会将数据在语料库中的权重效应与其他重要但不同的考虑因素混为一谈。最值得注意的是,数据混合实验的结果受不同来源数据质量差异以及任何给定数据源中边际词元独特性的显著影响。为单独分离混合权重效应,本文专门分析*数据加权*——这是数据混合的一种变体,其中训练数据集中的每个独立序列在损失函数中获得不同的权重。我们通过以下方式衡量模型学习具有特定权重的训练序列的程度:首先为数据集中的每个序列分配随机*序列权重*,在该数据集上训练模型,然后在相同的训练数据集上重新评估。 我们定义了一个指标——*有效序列权重指数*(记为 p*),用于衡量序列权重的哪个幂次最接近于模型在该序列上的预期损失降低的比例(例如,p*=1表示模型在序列上的预期损失降低与其权重直接成正比,而p*=0则表示对所有可能的序列权重,预期损失降低都相同)。 先前的研究对规模如何影响该指数预测不一:Byrd & Lipton 2019 (https://arxiv.org/abs/1812.03372)和大规模插值的普遍现象 (https://arxiv.org/abs/1611.03530)预测更大模型应趋近于p*=0,而Li et al. 2026 (https://arxiv.org/abs/2608.14071)发现在固定的每参数词元数下,对有价值领域而言最优词元重复次数随模型规模轻微增加。我们提出的问题是:有效序列权重指数是随规模平滑的幂律,还是呈现异常变化? 我们在内部文本基准测试上评估了序列加权的影响。为测试不同模型家族和规模,我们评估了两个内部预训练LLM家族(参数从数千万到数千亿)和一个开源模型家族Qwen 2.5 (https://arxiv.org/abs/2412.15115)(参数从5亿到720亿)。 我们发现了若干异常扩展行为(跨规模推理数据混合确实复杂!)以及一些引人注目的趋势。综合来看,我们的结果与有效序列权重指数先升后降的非单调变化一致:小规模模型拟合较小的有效序列权重指数,独立于数据权重学习整个数据集的模式;中等规模模型拟合较大的有效序列权重指数,按数据权重比例学习数据中的模式;大规模模型再次拟合较小的有效序列权重指数,无视权重地学习数据中存在的所有模式。训练轮次的增加会使有效序列权重指数的峰值向更小的模型规模偏移。 异常扩展定律给我们的模型训练方法带来了不便,但识别它们可以避免错误的外推。在我们的研究中,我们对这类异常行为保持警惕,一旦发现,就会重新设计扩展实验和评估方法,使其变得可预测。1 (https://blog.janestreet.com/a-study-of-sequence-weighting-at-scale/#fn:1)我们的实验提出了一系列可能的补救措施,包括仅从足够大的模型评估和外推数据混合结果,以及调整训练权重以补偿观察到的p*。2 (https://blog.janestreet.com/a-study-of-sequence-weighting-at-scale/#fn:2)我们持续测量模型与预测之间的偏差,以便不断发现扩展定律下一个失效之处,从而更有信心地训练更大、更好的模型。 ## 方法论 **数据集。** 我们在一个内部文本基准测试上评估序列加权的影响。我们使用在0.01到10之间对数均匀分布的序列权重对该数据集中的序列进行加权。我们训练3个轮次,并在每个轮次后进行评估。 **模型。** 我们在该数据集上评估三个不同的模型家族: - *JS-dense*,一个包含9个模型的内部预训练密集语言模型家族 - *JS-sparse*,一个包含8个模型的内部预训练混合专家模型家族 - Qwen 2.5 (https://arxiv.org/abs/2412.15115),一个参数从5亿到720亿的开源密集语言模型家族。 JS-dense和JS-sparse模型的参数范围从数千万到数千亿。需要注意的是,在所有情况下,这些模型的留出性能都随规模增长而提高。 **衡量序列加权效应。** 我们首先在训练数据集上训练模型(每个序列的权重对应于w),然后在训练数据集上重新评估模型,并对每个序列衡量训练带来的损失降低。接着,我们拟合一个p*值,使得权重为w的特定序列上的损失降低(经过适当归一化后)最能被w^{p*}解释。 我们在附注 (https://blog.janestreet.com/a-study-of-sequence-weighting-at-scale/sequence-weighting-note.pdf)中使该拟合更加精确,但为了更好地理解不同p*值的含义,让我们考虑几种情景: - p*=0:序列上的预期损失降低不受其权重影响(即,我们不会对高权重序列比对低权重序列降低更多损失)。 - 0 < p* < 1:较高权重序列的损失降低多于较低权重序列,但减少的幅度按指数p*次线性缩放(当p*=1时,序列的损失降低与其训练权重成正比)。 - p* > 1:较高权重序列的损失降低多于较低权重序列,且其集中程度超过序列权重所暗示的水平(例如:如果模型记住了最高权重序列的对应关系,而对其他所有行随机预测,我们将看到p*→∞)。 **超参数。** 我们调整超参数以最小化验证集上的损失。3 (https://blog.janestreet.com/a-study-of-sequence-weighting-at-scale/#fn:3)由于最大的内部模型过大,无法经济地进行超参数调优,我们通过Chinchilla式幂律缩放定律设置超参数,将最优超参数拟合为规模的函数。 ## 结果与分析 p*作为模型规模(阶梯层级)和训练数据轮次数的函数,对应三个模型家族。(https://blog.janestreet.com/a-study-of-sequence-weighting-at-scale/figure2.png)图2:p*作为模型规模(阶梯层级)和训练数据轮次数的函数。每个模型家族的三维曲面图如下。作为参考,所有三个阶梯中最小的模型是JS-dense的第1层,最大的模型是JS-sparse的第8层。 以下是每个模型家族的交互式三维曲面图: 在给定的模型家族和训练轮次内,p*通常在小规模时增加(尤其是在参数达到数百亿的规模),并在更大规模(接近参数数千亿规模)时减小(作为参考,图中最大的JS-dense层级参数少于1000亿)。 训练更多轮次会使峰值向更小的模型规模偏移。在不同模型家族之间,我们发现p*的实际值之间关系不大——JS-sparse中的最小模型远大于JS-dense中的最小模型,但p*却更小;JS-sparse中的最大模型也远大于Qwen 2.5中的最大模型,但p*却更大。 为什么p*有时会先升后降?我们假设这是因为模型以不同速率学习数据中存在的不同模式。一些模式能很好地在所有序列间泛化(例如,理解英语),而另一些模式则特定于较小的序列组。在该数据集中,由特定模式带来的潜在损失降低大于由通用模式带来的损失降低。因此,我们假设小规模模型使用其有限容量学习通用模式,无法表征特定模式;中等规模模型学习通用模式和最重要的特定模式(按序列权重);而大规模模型则有容量学习所有权重的所有特定模式。训练轮次的增加允许模型学习更多通用和特定模式。 更广泛地说,我们发现小规模下的序列加权行为并不能清晰预测最大规模下的行为。这恰好概括了一个太常见的结果:更大模型可能表现出与较小模型在本质上不同的行为。因此,我们的扩展研究需要花费同样甚至更多的时间和精力去理解为什么我们的预测会偏离,而不仅仅是拟合曲线本身。 *如果您对此类内容感兴趣,考虑加入我们 (https://www.janestreet.com/join-jane-street/machine-learning/)。您将加入一个紧密团结、才华横溢、相互支持的团队,利用数万个GPU、数PB的训练数据,以及投资最佳创意的灵活性和资源。*

相似文章

神经语言模型的缩放规律

OpenAI Blog

基础性实证研究,展示了语言模型性能与模型规模、数据集大小和计算预算之间的幂律缩放关系,对最优训练资源分配和样本效率有重要启示。

大语言模型中的模型合并扩展定律

Hugging Face Daily Papers

本文建立了语言模型合并的实证扩展定律,确定了模型规模、专家数量与性能之间的幂律关系,从而能够为最佳模型组合提供预测性规划。

数据受限训练的规定性缩放定律

Hugging Face Daily Papers

一种考虑数据重复效应的修正缩放定律,为数据受限场景提供了计算最优的训练策略,表明超出某一界限后,进一步重复会适得其反,计算资源应更明智地用于模型容量。