@industriaalist: 1/ 现在数据快用完了,如何最优地将多轮预训练扩展到数百个epoch?我们的首篇论文…
摘要
本论文介绍了一种方法,它训练一组模型而非单个模型,在数据稀缺的情况下扩展多轮预训练时,能显著降低损失。
1/ 现在数据快用完了,如何最优地将多轮预训练扩展到数百个epoch?
我们的第一篇来自Q! q0的论文训练了一组模型,而不是单个会快速饱和的模型,在*每个* epoch预算下都达到了显著更低的损失。
合作者:@bishmdl76 @akshayvegesna @ShmuelBerman
查看缓存全文
缓存时间: 2026/06/05 05:10
1/ 既然我们正面临数据枯竭,如何将多轮预训练最优地扩展到数百轮?
我们的第一篇论文来自 Q! q0,训练了一个模型群体,而不是快速饱和的单一模型,在每个 epoch 预算下都达到了显著更低的损失。
与 @bishmdl76 @akshayvegesna @ShmuelBerman 合作
相似文章
HRM-Text: 超越规模的高效预训练
HRM-Text 引入了一种分层循环模型,将计算解耦为慢速和快速层级,使得仅使用400亿个token和1500美元预算即可从头开始高效预训练,实现了与更大模型竞争的性能。
数据约束下的混合预训练缩放定律
本文研究了在混合预训练中稀缺目标数据与丰富通用数据之间的权衡,发现重复是驱动性能的关键因素,并且混合训练能容忍目标数据重复15-20次。我们引入了一个考虑重复影响的缩放定律,以优化数据约束条件下的混合配置。
LLM持续预训练中最佳超参数的可预测缩放规律
本文发现了LLM持续预训练中最佳超参数(学习率、批量大小)的可预测缩放规律,提出了一个两阶段框架,可将超参数搜索开销降低高达90%,同时保持性能。
Agora:集体化无许可的互联网规模大型语言模型预训练
Agora支持利用通过互联网连接的异构、可抢占的消费级GPU进行集体化、无许可的互联网规模大型语言模型预训练,成功使用330个节点的Pluralis-8B训练运行证明了这一点。
UltraX:通过自适应程序化编辑大规模优化预训练数据
UltraX 提出了一种面向大规模预训练数据的函数调用式优化框架,在删除和修改之外引入插入操作,补全了编辑函数空间,从而实现细粒度的实例级编辑。该框架构建了可靠的程序监督生成流水线,在从头训练 1B 模型时,展示了更优的数据效率和模型性能。