@percyliang: Marin 535B-A23B本周开始训练!一如既往,整个过程是开放的。航行计划:预训练(80%)+中训练…

X AI KOLs Following 模型

摘要

Marin 535B-A23B AI模型的训练已开始,过程开放,涉及在GB200 NVL72硬件上使用18.75万亿tokens进行预训练和中训练,历时约3个月。

Marin 535B-A23B本周开始训练!一如既往,整个过程是开放的。 航行计划:在11 x GB200 NVL72上使用18.75万亿tokens进行预训练(80%)+中训练(20%),历时约3个月(2.7e24 FLOPs)。后续将进行后训练。 在启动运行之前,我们训练了一个从1.6B-A61M(48B tokens)到27.7B-A1.2B(926B tokens)的4级缩放阶梯,以调试问题并对我们的关键运行进行预测。这是迄今为止最大的运行,因此肯定会遇到意想不到的情况。
查看原文
查看缓存全文

缓存时间: 2026/08/22 23:34

Marin 535B-A23B 本周启动训练!一如既往,整个过程保持公开。

训练规划:在11台 GB200 NVL72 服务器上,使用18.75T tokens进行预训练(占比80%)和中期训练(占比20%),预计耗时约3个月(计算量达2.7e24 FLOPs)。后续将进行后训练阶段。

在正式训练开始前,我们搭建了从1.6B-A61M(48B tokens)到27.7B-A1.2B(926B tokens)的四级阶梯测试模型,用于调试问题并为主训练任务提供性能预测。这将是我们迄今规模最大的训练任务,难免会遇到预料之外的挑战。

相似文章