@WilliamBarrHeld: 要训练更好的开源模型,我们需要可预测的缩放。Delphi 是 Marin 迈出的第一步:我们预训练了许多小模型……
摘要
由 William Barr Held 领导的 Marin AI 研究团队推出了 Delphi,这是一种通过预训练小模型来准确预测更大规模 25B 参数训练结果的方法论。该研究旨在建立可预测的缩放规律,以实现更高效的人工智能开源模型开发。
查看缓存全文
缓存时间: 2026/05/11 20:43
为了训练更好的开源模型,我们需要可预测的扩展性。
Delphi 是 Marin 迈出的第一步:我们使用同一套配方预训练了许多小型模型,随后进行了 300 倍外推,以预测一次 25B 参数 / 600B Token 的训练任务,误差仅为 0.2%。
为此我们付出了不少努力 🧵 https://t.co/HmlVFl11ag
相似文章
@eliebakouch:我最喜欢的项目之一是斯坦福团队的Marin,他们采用科学的方法进行训练,并且愿意……
Marin是斯坦福大学开发的开源框架,用于可复现的基础模型研究,涵盖数据整理、分词、训练和评估;它被用于训练一个80亿参数的模型,其性能超过了Llama 3.1 8B。
@AndrewYNg:在捍卫人工智能开放性的斗争中,Marin项目是模型训练开放性的一个宝贵示范,…
Andrew Ng 强调 Marin 项目是人工智能模型训练开放性的一个宝贵范例,Percy Liang 宣布使用开放代码、数据和流程开始训练 Marin 535B-A23B。
@WilliamBarrHeld: Hugging Face上有海量的开放训练数据。让它协同工作需要什么?For Marin…
本文讨论了利用Hugging Face上的开放训练数据来训练Marin’s 535B模型的过程,涉及来自152个数据集的25万亿token,并具有允许训练的许可证。
@yuetai12575: 兴奋地看到随着模型扩展,收益进一步持续!
文章报道了OpenRSI的Marin-Scaling-Ladder实验的初步结果,其中AI代理自主提出、实现和评估新的优化器,跨越从550M到2.5B的模型规模,发现了PSPR和Codex (GPT-5.6)。
@andykonwinski: 我忍不住要一直关注这个。Marin团队正在训练史上最大的完全开放模型。535B参数(23B活跃…
Marin团队正在训练最大的完全开放模型,拥有535B参数,通过实时跟踪和开放数据日志提供前所未有的透明度。