@kimiahmdh: 我们能否判断数据域在预训练期间是合作还是竞争?加入代码使模型在……方面表现更好
摘要
这项研究探讨了不同数据域在预训练期间的互动方式,发现加入代码可以提高数学性能,而某些组合则会相互影响,并提出将数据协同纳入缩放定律。
查看缓存全文
缓存时间: 2026/07/16 18:21
我们能否判断数据域在预训练过程中是协作还是竞争?
在预训练中混入代码能让模型在数学任务上表现更好,而某些组合则会相互损害。我们称之为数据协同效应。事实证明,你可以将数据协同效应纳入缩放定律并进行估算。
这是一个激励性示例:针对不同数据混合训练出的模型,在编程基准的验证损失上拟合缩放定律。
a) 对所有混合使用相同的数据缩放指数:拟合效果很差! b) 让数据指数随混合变化:近乎完美的拟合!
我们提出了考虑两种协同效应的域感知缩放定律:
一阶协同:每个(域,基准)对都有一个系数来修正数据缩放指数。
二阶协同:当两个域同时出现时产生的额外奖励令牌。
无需训练扫描。我们通过观察已有的开放数据模型来估算协同效应,并拟合这些缩放定律。
我们发现了什么?数学数据是编程基准的巨大加速剂,而书籍和百科全书则干扰了编程基准。
跨基准共享的最强成对协同效应是:
代码 × 科学,代码 × 数学,数学 × 书籍:负协同(它们相互干扰)
结论:如果你的目标基准受益于某个域,不要在其干扰伙伴上花费令牌。
我们的域感知定律能更准确地预测保留模型在所有基准上的表现。
一旦你能根据混合预测性能,就可以优化它:我们利用这些定律来设计在给定任务上表现良好的数据混合。
感谢与我的优秀合作者@LesterMackey和@elmelis共同完成此工作。
论文:https://arxiv.org/abs/2607.11052 网站:http://data-syn.github.io
将出现在 #COLM2026!
相似文章
模态如何共同学习(49分钟阅读)
来自Meta FAIR、Reality Labs和牛津大学的一项关于多模态预训练的系统性研究,揭示了模态之间的不对称知识流动、协同与竞争动态、早期统一的益处,以及通过13.5B MoE模型验证的高效训练方案。
多模态预训练的物理:知识流动、模态协同、早期统一与配方
本文系统性地探索了多模态预训练的物理机制,揭示了知识在模态之间如何流动、协同与竞争的条件、早期统一的优势,以及在13.5B MoE模型上验证的高效预训练配方。
预训练数据,而非可验证性,是LLMs在数学(和编程)方面特别出色的原因(63分钟阅读)
本文认为,预训练数据是大型语言模型在数学和编程方面表现出色的主要原因,而非可验证性。
LLM预训练中的领域数据重复扩展研究
本文研究了在LLM预训练中重复高质量领域数据以在模型扩展时维持性能的权衡,发现最佳重复次数随模型大小增加,并与领域验证损失呈负相关。
数据约束下的混合预训练缩放定律
本文研究了在混合预训练中稀缺目标数据与丰富通用数据之间的权衡,发现重复是驱动性能的关键因素,并且混合训练能容忍目标数据重复15-20次。我们引入了一个考虑重复影响的缩放定律,以优化数据约束条件下的混合配置。