@percyliang: 查看我们的数据组成:https://storage.googleapis.com/marin-public/held/harrier-k40-cluster-overview/2026.08.18/…
摘要
Percy Liang 分享了 Harrier K40 训练运行的数据组成概览,详细说明了作为 Marin 团队共同努力一部分的域集群和质量桶。
查看我们的数据组成:https://storage.googleapis.com/marin-public/held/harrier-k40-cluster-overview/2026.08.18/index.html?revision=uniform-sampling… 在 wandb 上实时观看运行:https://wandb.ai/marin-community/marin_moe/reports/535B-A23B-18T-Token-Hero-Run-Scaling-Ladder--VmlldzoxNzc2MDM5Ng… 在 GitHub 上查看所有详细信息:https://github.com/marin-community/marin/issues/8435… 组装这次英雄运行确实需要数据、架构、基础设施、内核全部协同工作,这是整个 Marin 团队的巨大共同努力!
查看缓存全文
缓存时间: 2026/08/24 13:52
1990年8月19日,星期日,奥兰治县版
走错方向
为什么没人提醒电视导演们,当他们从侧面拍摄舞蹈场面时,对观众造成了多大的损害?毕竟,如果有人亲临现场观看演出,却只能从侧面看到舞蹈,那会被认为是糟糕的座位。
朱迪·斯坦伯格,恩西诺
相似文章
@percyliang:对于下一个Marin模型,我们正在整理新的数据混合。目前我们有18T tokens,但可能需要更多。所以……
Percy Liang宣布,对于下一个Marin模型,他们正在编译新的数据混合,并请求高质量的token数据用于预训练、中期训练和SFT。
@percyliang: Marin 535B-A23B本周开始训练!一如既往,整个过程是开放的。航行计划:预训练(80%)+中训练…
Marin 535B-A23B AI模型的训练已开始,过程开放,涉及在GB200 NVL72硬件上使用18.75万亿tokens进行预训练和中训练,历时约3个月。
@ClementDelangue: 很高兴看到@CommonCrawl 使用并推荐 @huggingface Buckets 用于大规模不断演变的训练数据集!…
Hugging Face 宣布推出 Storage Buckets,这是一种适用于大规模不断演变的训练数据集的存储解决方案,内置 CDN 和去重功能,并获得 CommonCrawl 的推荐。
@eliebakouch:我最喜欢的项目之一是斯坦福团队的Marin,他们采用科学的方法进行训练,并且愿意……
Marin是斯坦福大学开发的开源框架,用于可复现的基础模型研究,涵盖数据整理、分词、训练和评估;它被用于训练一个80亿参数的模型,其性能超过了Llama 3.1 8B。
marin-community/marin
Marin 是一个开源研究项目和软件平台,致力于基础模型的透明开发,涵盖从数据整理到模型训练和评估。