@percyliang: Marin 535B-A23B本周开始训练!一如既往,整个过程是开放的。航行计划:预训练(80%)+中训练…
摘要
Marin 535B-A23B AI模型的训练已开始,过程开放,涉及在GB200 NVL72硬件上使用18.75万亿tokens进行预训练和中训练,历时约3个月。
查看缓存全文
缓存时间: 2026/08/22 23:34
Marin 535B-A23B 本周启动训练!一如既往,整个过程保持公开。
训练规划:在11台 GB200 NVL72 服务器上,使用18.75T tokens进行预训练(占比80%)和中期训练(占比20%),预计耗时约3个月(计算量达2.7e24 FLOPs)。后续将进行后训练阶段。
在正式训练开始前,我们搭建了从1.6B-A61M(48B tokens)到27.7B-A1.2B(926B tokens)的四级阶梯测试模型,用于调试问题并为主训练任务提供性能预测。这将是我们迄今规模最大的训练任务,难免会遇到预料之外的挑战。
相似文章
@percyliang:对于下一个Marin模型,我们正在整理新的数据混合。目前我们有18T tokens,但可能需要更多。所以……
Percy Liang宣布,对于下一个Marin模型,他们正在编译新的数据混合,并请求高质量的token数据用于预训练、中期训练和SFT。
@timodonnell: 想观看一个535B参数(23B活跃)的LLM实时训练吗?在这里跟随 https://wandb.ai/marin-community/ma…
一条推文宣布了535B参数(23B活跃)大语言模型的实时训练,并提供了在Weights & Biases和GitHub上跟踪进程的链接。
@AndrewYNg:在捍卫人工智能开放性的斗争中,Marin项目是模型训练开放性的一个宝贵示范,…
Andrew Ng 强调 Marin 项目是人工智能模型训练开放性的一个宝贵范例,Percy Liang 宣布使用开放代码、数据和流程开始训练 Marin 535B-A23B。
@eliebakouch:我最喜欢的项目之一是斯坦福团队的Marin,他们采用科学的方法进行训练,并且愿意……
Marin是斯坦福大学开发的开源框架,用于可复现的基础模型研究,涵盖数据整理、分词、训练和评估;它被用于训练一个80亿参数的模型,其性能超过了Llama 3.1 8B。
@percyliang: 我们不仅希望训练出一个好模型,还希望在开始训练之前就知道它会很好。大约一个月前…
Marin团队预先注册了一个129B参数MoE模型训练运行的预测损失为2.252,实际结果为2.234,展示了在训练前准确预测损失的能力。