用户事件序列上行为基础模型的缩放定律

arXiv cs.LG 论文

摘要

本文研究了在用户行为序列上训练的行为基础模型的缩放定律,发现小的事件嵌入器是计算最优的,并且评估指标本身会影响最优计算分配。

arXiv:2606.05257v1 公告类型:新 摘要:基础模型越来越多地用于推荐、支付、欺诈检测和电商等场景中对用户行为序列的训练,但这些模型仍然缺乏类似于语言模型缩放定律所提供的计算校准。我们研究了一种常见的两部件行为模型架构:基于特征的事件嵌入器将每个多模态项目映射为一个向量,而一个仅解码器的Transformer根据生成的序列预测下一个事件。在大约600次真实交互数据的实验(覆盖$10^{15}$至$10^{19}$训练FLOPs)中,我们联合变化了四个与部署相关的维度:两部件的参数分配、关键批次大小、模型/数据分配,以及在冻结嵌入器后使用的负样本数量。一个小型嵌入器(参数约占$s^{\star}\!\approx\!2\%$)在我们测试的每个预算下都是计算最优的,因为嵌入器参数不仅每一步都更昂贵,而且比上下文化器参数暴露于更多的重复项目。在低计算量下,计算最优训练相对于文本而言更偏数据密集型,但随着计算量的增加,其$D/N$比率趋近于Chinchilla启发式。采样训练目标和部署的排序指标在某些方面存在不一致,且这种不一致本身会缩放:关键批次大小、冻结后的最优负样本数量,以及损失与排序质量之间的一致性,都随计算量和所选评估指标而变化。对于负采样,更大的预算越来越倾向于更多的负样本;在$10^{19}$ FLOPs时,活跃的约束变成候选轴上的内存而非FLOPs。因此,在行为基础模型中,评估指标是缩放定律的一部分:改变它会改变计算最优的方案。
查看原文
查看缓存全文

缓存时间: 2026/06/05 08:09

# 用户事件序列上行为基础模型的缩放定律 来源:https://arxiv.org/html/2606.05257 ###### 摘要 基础模型越来越多地基于推荐、支付、欺诈和电商中的用户行为序列进行训练,但这些模型仍然缺乏语言模型缩放定律所提供的计算校准。我们研究了一种常见的两部分行为模型架构:一个基于特征的事件嵌入器将每个多模态项目映射为向量,一个仅解码器Transformer从结果序列中预测下一个事件。在大约600次真实交互数据实验(涵盖10^{15}–10^{19}训练FLOPs)中,我们联合调整了四个与部署相关的变量:两部分参数分配、关键批次大小、模型/数据分配,以及冻结嵌入器后使用的负采样数量。在我们测试的每个计算预算下,小的嵌入器(s^{⋆}≈2%的参数)是计算最优的,因为嵌入器参数每一步更昂贵,且其暴露给重复项目的次数远多于上下文化器参数。在低计算量下,计算最优训练相对于文本是数据密集型的,但其D/N比率随着计算量增加而向Chinchilla启发式靠近。采样训练目标与部署排序指标之间的不一致性本身也呈现缩放特性:关键批次大小、冻结后的最优负样本数量、以及损失与排序质量之间的一致性都随计算量和所选评估指标而变化。对于负采样,较大的计算预算越来越偏爱更多负样本;到10^{19}FLOPs时,主动约束是候选轴内存而非FLOPs。在行为基础模型中,评估指标因此成为缩放定律的一部分:改变它可能改变计算最优方案。 ###### 目录 1. 1引言 (https://arxiv.org/html/2606.05257#S1) 2. 2实验设置 (https://arxiv.org/html/2606.05257#S2) 3. 3缩放事件嵌入器 (https://arxiv.org/html/2606.05257#S3)   1. 3.1嵌入器份额 (https://arxiv.org/html/2606.05257#S3.SS1)   2. 3.2深度作为次要调节旋钮 (https://arxiv.org/html/2606.05257#S3.SS2) 4. 4跨指标的关键批次大小 (https://arxiv.org/html/2606.05257#S4) 5. 5跨计算预算的模型/数据分配 (https://arxiv.org/html/2606.05257#S5) 6. 6缩放负候选池 (https://arxiv.org/html/2606.05257#S6) 7. 7跨指标和跨区域评估 (https://arxiv.org/html/2606.05257#S7) 8. 8相关工作 (https://arxiv.org/html/2606.05257#S8) 9. 9讨论 (https://arxiv.org/html/2606.05257#S9) 10. 10结论 (https://arxiv.org/html/2606.05257#S10) 11. 参考文献 (https://arxiv.org/html/2606.05257#bib) 12. A指标定义 (https://arxiv.org/html/2606.05257#A1) 13. B额外架构结果 (https://arxiv.org/html/2606.05257#A2) 14. C阶段2:每个指标的轨迹 (https://arxiv.org/html/2606.05257#A3) 15. D阶段3训练-替代分配 (https://arxiv.org/html/2606.05257#A4) 16. E阶段4指标分层采样效率 (https://arxiv.org/html/2606.05257#A5) 17. F最大更新参数化 (https://arxiv.org/html/2606.05257#A6) 18. G跨指标细节 (https://arxiv.org/html/2606.05257#A7) 19. H上下文长度评分鲁棒性(完整切片矩阵)(https://arxiv.org/html/2606.05257#A8) ## 1引言 缩放定律将大型语言模型的开发从一系列临时训练运行转变为一个定量分配问题:给定一个计算预算,应该用多少参数在多少个token上训练,批次大小是多少,以及使用哪种优化器方案?同样的问题现在也出现在文本之外。工业系统越来越多地在人类行为序列上训练基础模型:推荐、购买、支付、金融事件、工作活动以及其他行为痕迹[5 (https://arxiv.org/html/2606.05257#bib.bib5),6 (https://arxiv.org/html/2606.05257#bib.bib6),13 (https://arxiv.org/html/2606.05257#bib.bib13),14 (https://arxiv.org/html/2606.05257#bib.bib14),16 (https://arxiv.org/html/2606.05257#bib.bib16),17 (https://arxiv.org/html/2606.05257#bib.bib17),18 (https://arxiv.org/html/2606.05257#bib.bib18),22 (https://arxiv.org/html/2606.05257#bib.bib22)]。这些模型足够大,以至于缩放定律的错误代价高昂,但该领域对它们几乎没有Chinchilla式的指导。 行为基础模型在缩放方面与文本LM有所不同。语言模型中的token通常是一个不透明的词汇表ID。而行为模型中的事件是特征丰富的:一个产品或交易可以包含文本、类别元数据、视觉特征、价格、时间戳、支付渠道以及其他结构化字段。目录也会随时间变化。因此,现代系统倾向于使用一种两部分架构:一个基于特征的*事件嵌入器*将原始项目特征映射为稠密表示,一个*上下文化器*(通常是仅解码器Transformer)对这些事件嵌入的序列进行建模。这种架构产生了普通文本LM中不存在的缩放问题。嵌入器通常以端到端方式[19 (https://arxiv.org/html/2606.05257#bib.bib19)]针对序列目标进行训练,但在完整的softmax中重新嵌入每个候选项目对于百万级目录来说代价过高。先前的工作通过一个两阶段方案解决了这个问题:首先联合训练嵌入器和上下文化器,使用批次内采样的softmax;然后冻结并缓存嵌入器,仅继续训练上下文化器,使用更大的采样候选池[19 (https://arxiv.org/html/2606.05257#bib.bib19),22 (https://arxiv.org/html/2606.05257#bib.bib22)]。由此产生的系统至少有四个耦合的调节旋钮:嵌入器中应包含多少容量,何种批次大小是数据高效的,计算应在模型大小和数据之间如何分配,以及嵌入器冻结后应采样多少个负样本。 我们在一个单一的行为模型栈和一个真实的交互语料库上校准这些旋钮。该研究涵盖大约600次运行,计算量C∈[10^{15},10^{19}] FLOPs,所有实验共享一个评估流程。目标不是提出新的架构,而是回答一个更基本的问题:如果一个从业者已经在训练这个现在标准的事件嵌入器→ transformer栈,那么下一次运行应该遵循怎样的缩放定律?我们的主要发现是: - • **计算最优的事件嵌入器很小。** 在四个数量级的计算量上,双项等FLOP拟合将最优嵌入器份额置于一个狭窄的区间,大约s^{⋆}≈2%的参数。这个最优值由两个不对称性解释:嵌入器参数每项目被触及的次数多得多,而热门项目被重复成百上千次,上下文化器窗口却很少重复。 - • **行为缩放最初是数据密集型的,但向Chinchilla启发式靠近。** 计算最优的D/N比率从10^{15} FLOPs时的大约340下降到10^{19} FLOPs时的大约36,在较大预算下接近文本LM的经验法则。在验证损失下,拟合的模型大小指数为N^{⋆}∝C^{0.617±0.025},在主要排序指标下也有类似的指数。 - • **评估指标是缩放定律的一部分。** 跨预算的指数相对稳定,但可操作的方案并非如此。关键批次大小、冻结后的最优负样本数量、以及损失与排序质量之间的一致性都取决于计算量、评估区域和目标指标。特别是,训练中使用的采样softmax损失并不总是全目录排序质量的可靠代理。 - • **负采样在大规模下从计算问题转变为内存问题。** 在较小的预算下,平滑拟合将有用的负样本数量置于几十万的低位,且最优值依赖于指标。在C=10^{19}时,每个主要指标在我们训练的最大K下仍在改善,因此主动约束变为候选轴内存而非可用FLOPs。 表1 (https://arxiv.org/html/2606.05257#S1.T1)总结了实验地图。论文的其余部分遵循该表:第2节 (https://arxiv.org/html/2606.05257#S2)定义了模型、训练、计算核算和评估协议;第3节 (https://arxiv.org/html/2606.05257#S3)至第6节 (https://arxiv.org/html/2606.05257#S6)校准了四个旋钮;第7节 (https://arxiv.org/html/2606.05257#S7)解释了为什么指标选择会改变方案;第9节 (https://arxiv.org/html/2606.05257#S9)提炼了实用时间表和限制。 **表1:实验地图。**每个轴在相同的两部分行为模型栈上进行扫描。标签保留了原始的阶段编号以便与附录交叉引用,但正文将其视为四个缩放定律问题。 ## 2实验设置 #### 模型。所有实验使用相同的两部分下一事件预测架构。基于特征的嵌入器消耗每个目录项目的原始字段,生成隐藏大小为h的事件嵌入。上下文化器是一个仅解码器Transformer,消耗长度为L_{seq}=256的事件嵌入序列,并通过采样softmax预测下一个事件。参数总数N排除了词汇参数,分解为嵌入器参数p_e和上下文化器参数p;嵌入器份额为s = p_e / N。 #### 两阶段训练。遵循已部署的方案[19 (https://arxiv.org/html/2606.05257#bib.bib19),22 (https://arxiv.org/html/2606.05257#bib.bib22)],所有运行使用两个阶段。在*阶段1*中,嵌入器和上下文化器在下一事件目标上联合训练,使用*批次内*采样softmax:正样本是真正的下一个项目,负样本是同一全局批次中的其他目标,因此候选池是批次中≤ B L_{seq}个唯一项目。在*阶段2*中,训练好的嵌入器被冻结,其事件嵌入被缓存,仅上下文化器继续训练,现在对每个位置使用一个更大的包含K个均匀采样额外负样本的池(除批次内候选外)。阶段1设置架构、批次大小和(N,D)分配;阶段2在固定的阶段1骨干上隔离负样本池大小K。这种分割使得在服务时重新嵌入百万级目录变得可行,并定义了下面两种评估区域。 #### 数据。所有扫描在一个匿名的真实世界零售交互语料库上训练,该语料库结合了线上和线下消费者活动(产品搜索、浏览、点击和购买),被分块为每个训练示例L_{seq}=256个事件的序列。每个事件是多模态的:自由文本描述、类别字段(例如事件类型、商家、设备等)、数值字段(例如价格、时间戳等)以及可选的视觉特征。目录包含大约10^8个唯一动作,训练消耗大约10^9个事件token。项目流行度呈现强烈的重尾分布:一小部分频繁动作在单次训练运行中被多次观察到,而长尾的大部分仅被观察到一两次。这种不对称性驱动了嵌入器/上下文化器的计算权衡(第3节 (https://arxiv.org/html/2606.05257#S3))。 #### 训练方案。我们使用AdamW、权重衰减0.1、bf16混合精度和全分片数据并行训练。架构、分配和采样实验使用余弦学习率衰减,带5–10%线性预热。批次大小实验使用恒定学习率,以便“达到目标的更新次数”衡量优化效率而非调度形状。每个单元的学习率根据训练损失而非验证指标选择。 #### 计算核算。我们以标准化桶报告训练计算,目标C≈6ND,遵循语言模型缩放定律惯例,其中D = T B L_{seq}是T个优化器步骤在全局批次大小B下消耗的事件token数。实验生成器使用更精细的Kaplan式每步公式: F_{step} = 6 B L_{seq} (t p_e + p + 3 B L_{seq} h), (1) 其中t=24是嵌入器上下文长度(以事件计)。隐藏大小h不是全局常数:它按架构单元设置,同时决定上下文化器使用的事件嵌入维度以及进行批次内对比评分的维度。在嵌入器份额扫描中,改变目标份额s = p_e / N会改变h和嵌入器参数计数p_e;上下文化器参数计数p随后由固定D/N比率下的目标总N决定。在深度扫描中,h和p_e固定,上下文化器深度改变p,因此嵌入器在所有深度单元上贡献相同的6 B L_{seq} t p_e计算税。项3 B L_{seq} h是在跨数据并行秩进行候选嵌入全规约后的批次内对比评分项。在解释嵌入器/上下文化器权衡时,我们也使用N_{eff} ≡ p + t p_e。 #### 评估。评估协议有意分离训练系统使用的两种区域。在嵌入器冻结之前,检查点针对每个验证批次中的唯一目标项目进行评估,匹配训练期间使用的批次内负样本分布。冻结嵌入器后,阶段2检查点针对完整的缓存部署产品目录进行评估,匹配部署时的检索设置。我们报告交叉熵、困惑度、Recall@k、NDCG@k[23 (https://arxiv.org/html/2606.05257#bib.bib23)]、MRR@10[24 (https://arxiv.org/html/2606.05257#bib.bib24)]、Coverage@k[26 (https://arxiv.org/html/2606.05257#bib.bib26)]和预测熵;标准排序指标遵循Manning等人[25 (https://arxiv.org/html/2606.05257#bib.bib25)],附录A (https://arxiv.org/html/2606.05257#A1)给出了我们计算的确切公式。通篇,“训练损失”指模型优化的采样softmax目标,而“验证损失”指在所使用的评估区域下相应的保留交叉熵。 ## 3缩放事件嵌入器 ### 3.1嵌入器份额 第一个问题是架构性的:在固定计算量下,有多少容量应属于基于特征的事件嵌入器而非Transformer上下文化器?答案稳定且小得出奇。在四个计算预算下,最佳份额约为参数的2%。这不仅仅是经验巧合:嵌入器每参数更昂贵,并且比上下文化器看到更重复的有效数据分布。这个规模也是与多模态基础模型的有用比较点,在那里一个相对较小的模态编码器馈送给一个更大的语言模型:LLaVA、Flamingo和BLIP-2使用的视觉编码器占总参数的大约百分之几到几十[8 (https://arxiv.org/html/2606.05257#bib.bib8),9 (https://arxiv.org/html/2606.05257#bib.bib9),10 (https://arxiv.org/html/2606.05257#bib.bib10)]。据我们所知,这些系统尚未用相同的编码器份额缩放定律扫描进行校准;检查类似份额定律是否适用于多模态编码器是自然的未来工作。 设置。我们将数据与参数的比率D/N≈15 (Chinchilla) 固定,跨

相似文章

神经语言模型的缩放规律

OpenAI Blog

基础性实证研究,展示了语言模型性能与模型规模、数据集大小和计算预算之间的幂律缩放关系,对最优训练资源分配和样本效率有重要启示。

数据受限训练的规定性缩放定律

Hugging Face Daily Papers

一种考虑数据重复效应的修正缩放定律,为数据受限场景提供了计算最优的训练策略,表明超出某一界限后,进一步重复会适得其反,计算资源应更明智地用于模型容量。