缓解CTR模型中的早期训练崩溃
摘要
本文分析了用于点击率预测的深度神经网络模型中的早期训练崩溃现象,并提出了缓解策略,如稀疏特征移除和值过滤,在大规模工业数据集上展示了改进效果。
arXiv:2607.09696v1 Announce Type: new
摘要:用于点击率预测的深度神经网络模型,在第一个训练周期后验证性能常急剧下降,尽管训练损失持续改善。这种不稳定性限制了有效学习和模型性能。在本研究中,我们使用大规模工业数据集分析这一行为,并评估实用的缓解策略。虽然降低学习率只能带来渐进性收益,但控制特征稀疏度可带来实质性改进。移除高度稀疏的特征并聚合罕见的特征值,可以稳定训练,将有效学习扩展到单个周期之外,并改善离线评估指标和在线系统性能。
查看缓存全文
缓存时间: 2026/07/14 04:13
# 摘要 来源:https://arxiv.org/html/2607.09696 缓解CTR模型训练初期的崩溃现象 Ergun Biçici¹, Erkan Çetinyamaç¹ ¹ 华为土耳其研发中心智能应用开发部,伊斯坦布尔,土耳其 *通讯作者:Ergun Biçici,华为土耳其研发中心,伊斯坦布尔,土耳其。邮箱:[email protected] 用于点击率预测的深度神经网络模型常在第一个训练epoch后立即出现验证性能急剧下降,尽管训练损失仍在持续改善。这种不稳定性限制了有效学习,并制约了模型性能。在本研究中,我们使用大规模工业数据集分析该行为,并评估实用的缓解策略。虽然降低学习率仅带来渐进式提升,但控制特征稀疏性却能带来显著改进。移除高度稀疏的特征并聚合低频特征值能够稳定训练,将有用学习扩展到单个epoch之外,同时提升离线评估指标和在线系统性能。 ## 关键词 CTR预测,过拟合,稀疏性,嵌入,推荐系统 ## 缩略语 CTR:点击率;CVR:转化率;AUC:曲线下面积;PRAUC:精确率-召回率AUC ## 1 引言 深度学习模型因其捕获复杂特征交互的能力而被广泛用于CTR预测[4,1,3]。然而,在具有高基数类别输入的工业环境中,模型通常在单个epoch后达到验证性能峰值,之后便退化。先前工作中已观察到该效应,并与稀疏特征空间中的快速过拟合相关[5]。 CTR数据集呈现长尾分布,其中一小部分特征值占据频率主体,而大多数特征值很少出现[6]。这种不平衡性增加了方差,并促使模型快速记忆。与视觉任务中过拟合逐渐发展不同[7],CTR模型往往突然退化。图1描绘了U形训练模式[9]中的单epoch现象。 (图1:单epoch过拟合示意图。训练性能持续提升,而验证性能由于过拟合在第一个epoch后达到峰值。) ## 2 材料与方法 ### 2.1 问题机制 该行为源于模型容量、优化动态与数据稀疏性之间的相互作用。嵌入层为每个类别值分配参数,但稀有值获得的更新极少,导致表示不稳定。自适应优化器加速收敛[8],使得模型快速拟合噪声。结果,模型早早记忆了低频模式,导致验证性能恶化。 ### 2.2 提出的策略 我们评估了三种方法: - • 学习率降低:减缓收敛速度,但未能消除早期过拟合。 - • 稀疏特征移除:消除信号弱的高基数特征。 - • 值过滤:仅保留高频值,将其余值映射到共享token。 ## 3 结果与讨论 实验使用具有数亿样本和严重类别不平衡的大规模工业CTR数据集。使用AUC、对数损失和PRAUC评估性能。 ### 3.1 离线结果 表1:离线CTR性能汇总(相对于基线)。表1的结果显示,降低学习率仅带来微小改进,且无法阻止早期退化。移除稀疏特征带来的增益最大,并将稳定训练扩展到多个epoch。值过滤通过减少嵌入更新中的方差进一步提升了鲁棒性。 ### 3.2 在线结果 部署到在线广告系统后,关键指标(包括转化率和收入效率)一致提升,证实离线增益可迁移至生产环境。表2的结果显示,广告主总价值(TAV)[10](主要改进指标)提升了1.88%。 表2:在线性能改进 TAV RPV eCPM CVR 1.88% 2.02% 1.1% 3.39% 这些改进证实了稀疏性降低可转化为实际收益。 ## 4 结论 结果表明,CTR模型训练初期的崩溃主要源于特征稀疏性,而非仅由优化动态导致。高基数输入带来了许多弱支持的参数,使得快速记忆成为可能。降低特征空间复杂度改善了泛化能力,并支持稳定的多epoch训练。虽然优化调整的收益有限,但控制特征稀疏性非常有效。移除稀疏特征并聚合稀有值既提升了稳定性,又改善了性能。所提出的方法简单、有效,且与现有系统兼容。 ## 致谢 无。 ## 利益冲突 作者声明不存在利益冲突。 ## 参考文献 - [1] Ergun Biçici. The FFCP model for predicting click-through rate. In 2023 4th International Informatics and Software Engineering Conference (IISEC), pages 1–5, 2023. - [2] Ergun Biçici. Interaction combination machine for recommendation systems. In 2025 33rd Signal Processing and Communications Applications Conference (SIU), pages 1–4, 2025. - [3] Zhiqiang Wang, Qingyun She, and Junlin Zhang. Masknet: Introducing feature-wise multiplication to CTR ranking models by instance-guided mask. In DLP-KDD ’21: Proceedings of the 3rd International Workshop on Deep Learning Practice for High-Dimensional Sparse Data, Singapore, 2021. Association for Computing Machinery. - [4] Zhishan Zhao, Sen Yang, Guohui Liu, Dawei Feng, and Kele Xu. FINT: field-aware interaction neural network for click-through rate prediction. In IEEE International Conference on Acoustics, Speech and Signal Processing, ICASSP 2022, 23-27 May 2022, pages 3913–3917, Virtual and Singapore, May 2022. IEEE. - [5] Zhao-Yu Zhang, Xiang-Rong Sheng, Yujing Zhang, Biye Jiang, Shuguang Han, Hongbo Deng, and Bo Zheng. Towards understanding the overfitting phenomenon of deep click-through rate models. In Proceedings of the 31st ACM International Conference on Information & Knowledge Management, CIKM ’22, page 2671–2680, New York, NY, USA, 2022. Association for Computing Machinery. - [6] Yuanxing Zhang, Langshi Chen, Siran Yang, Man Yuan, Huimin Yi, Jie Zhang, Jiamang Wang, Jianbo Dong, Yunlong Xu, Yue Song, Yong Li, Di Zhang, Wei Lin, Lin Qu, and Bo Zheng. PICASSO: unleashing the potential of gpu-centric training for wide-and-deep recommender systems. In 38th IEEE International Conference on Data Engineering, ICDE 2022, Kuala Lumpur, Malaysia, May 9-12, 2022, pages 3453–3466. IEEE, 2022. - [7] Kaiming He, Xiangyu Zhang, Shaoqing Ren, and Jian Sun. Deep residual learning for image recognition. In 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pages 770–778, 2016. - [8] Diederik P. Kingma and Jimmy Ba. Adam: A method for stochastic optimization. In International Conference on Learning Representations, 2015. - [9] Mikhail Belkin, Daniel Hsu, Siyuan Ma, and Soumik Mandal. Reconciling modern machine-learning practice and the classical bias–variance trade-off. Proceedings of the National Academy of Sciences, 116(32):15849–15854, 2019. - [10] Ergun Biçici. Meta learning of the effective cost per mille. In 2025 International Conference on Artificial Intelligence, Computer, Data Sciences and Applications (ACDSA), pages 1–5, 2025.
相似文章
LoopCTR:释放循环扩展威力,刷新点击率预测
LoopCTR 将“循环扩展”引入推荐模型,通过基于 MoE 的专家融合与超连接残差,在提升 CTR 预测效果的同时实现 train-deep/infer-shallow 部署,满足低延迟在线服务需求。
大语言模型顺序后训练中的表征坍塌
本文研究了大型语言模型在顺序后训练中的表征坍塌现象,表明重复的适应阶段会压缩内部表征,降低可塑性和域外泛化能力。作者提出了轻量级干预措施,在不牺牲行为增益的前提下保留未来的可学习性。
迭代指令微调中从合成数据学习避免模型崩溃
本文研究了迭代指令微调中使用合成数据时的模型崩溃问题,揭示了崩溃表现为能力极化:强项被强化,弱项则进一步退化。提出了KITE,一个两阶段框架,结合失败引导的数据生成和边界感知的不确定性筛选,确保在多次迭代中稳定提升。
模型崩溃怎么回事?
对模型崩溃的探讨,这是一种AI模型在合成数据上训练后,其质量和多样性下降的现象。
@johnschulman2:有趣的是,这些模型在网络评估中会陷入一种偏执狂般的暴怒状态。我想知道我们是否正在目睹『分块后训练』的实际效果……
约翰·舒尔曼的一条推文强调了论文《分块后训练》(Chunky Post-Training),该论文认为多样化的后训练数据集会导致模型学习到虚假相关性,从而引发非预期行为,例如拒绝以特定格式呈现的真实事实。论文引入了SURF和TURF来揭示并追踪前沿模型中的这些泛化失败。