@percyliang:对于下一个Marin模型,我们正在整理新的数据混合。目前我们有18T tokens,但可能需要更多。所以……
摘要
Percy Liang宣布,对于下一个Marin模型,他们正在编译新的数据混合,并请求高质量的token数据用于预训练、中期训练和SFT。
对于下一个Marin模型,我们正在整理新的数据混合。目前我们有18T tokens,但可能需要更多。所以如果你手头有秘密的高质量token库存,请告诉我们!预训练、中期训练、SFT数据都欢迎。https://t.co/49DBdzvYXE
查看缓存全文
缓存时间: 2026/05/13 18:25
对于下一个Marin模型,我们正在整理一个新的数据混合。目前我们有18T tokens,但可能需要更多。所以如果您手头有一些秘密的高质量tokens储备,请告诉我们!预训练、中期训练、SFT数据都欢迎。https://t.co/49DBdzvYXE
相似文章
@percyliang: Marin 535B-A23B本周开始训练!一如既往,整个过程是开放的。航行计划:预训练(80%)+中训练…
Marin 535B-A23B AI模型的训练已开始,过程开放,涉及在GB200 NVL72硬件上使用18.75万亿tokens进行预训练和中训练,历时约3个月。
@eliebakouch:我最喜欢的项目之一是斯坦福团队的Marin,他们采用科学的方法进行训练,并且愿意……
Marin是斯坦福大学开发的开源框架,用于可复现的基础模型研究,涵盖数据整理、分词、训练和评估;它被用于训练一个80亿参数的模型,其性能超过了Llama 3.1 8B。
@percyliang: 查看我们的数据组成:https://storage.googleapis.com/marin-public/held/harrier-k40-cluster-overview/2026.08.18/…
Percy Liang 分享了 Harrier K40 训练运行的数据组成概览,详细说明了作为 Marin 团队共同努力一部分的域集群和质量桶。
@percyliang: ! 分词是你在CS336(从头构建语言模型)中做的第一件事。如果Marcel能对LM流水线的其余部分施展魔法……
Marcel Rød 宣布了 Gigatoken,一个分词器实现,比 HuggingFace 快 500-1000 倍,比 OpenAI 的 tiktoken 快 100 倍,使用 Rust 构建。
@AndrewYNg:在捍卫人工智能开放性的斗争中,Marin项目是模型训练开放性的一个宝贵示范,…
Andrew Ng 强调 Marin 项目是人工智能模型训练开放性的一个宝贵范例,Percy Liang 宣布使用开放代码、数据和流程开始训练 Marin 535B-A23B。