@industriaalist: 1/ 现在数据快用完了,如何最优地将多轮预训练扩展到数百个epoch?我们的首篇论文…

X AI KOLs Following 论文

摘要

本论文介绍了一种方法,它训练一组模型而非单个模型,在数据稀缺的情况下扩展多轮预训练时,能显著降低损失。

1/ 现在数据快用完了,如何最优地将多轮预训练扩展到数百个epoch? 我们的第一篇来自Q! q0的论文训练了一组模型,而不是单个会快速饱和的模型,在*每个* epoch预算下都达到了显著更低的损失。 合作者:@bishmdl76 @akshayvegesna @ShmuelBerman
查看原文
查看缓存全文

缓存时间: 2026/06/05 05:10

1/ 既然我们正面临数据枯竭,如何将多轮预训练最优地扩展到数百轮?

我们的第一篇论文来自 Q! q0,训练了一个模型群体,而不是快速饱和的单一模型,在每个 epoch 预算下都达到了显著更低的损失。

与 @bishmdl76 @akshayvegesna @ShmuelBerman 合作

相似文章

HRM-Text: 超越规模的高效预训练

arXiv cs.CL

HRM-Text 引入了一种分层循环模型,将计算解耦为慢速和快速层级,使得仅使用400亿个token和1500美元预算即可从头开始高效预训练,实现了与更大模型竞争的性能。

数据约束下的混合预训练缩放定律

arXiv cs.LG

本文研究了在混合预训练中稀缺目标数据与丰富通用数据之间的权衡,发现重复是驱动性能的关键因素,并且混合训练能容忍目标数据重复15-20次。我们引入了一个考虑重复影响的缩放定律,以优化数据约束条件下的混合配置。

UltraX:通过自适应程序化编辑大规模优化预训练数据

arXiv cs.CL

UltraX 提出了一种面向大规模预训练数据的函数调用式优化框架,在删除和修改之外引入插入操作,补全了编辑函数空间,从而实现细粒度的实例级编辑。该框架构建了可靠的程序监督生成流水线,在从头训练 1B 模型时,展示了更优的数据效率和模型性能。