@dlwh: 自从 Marin 启动我们的 535B/A23B MoE 关键训练运行以来,已经过去了几周。到目前为止,一切顺利得几乎无聊。它还…

X AI KOLs Timeline 模型

摘要

Open Athena 推出了一次 535B/A23B MoE 模型训练运行,进展如预期,突显了他们对开放发展的承诺以及在AI扩展方面的重大进展。

自从 Marin 启动我们的 535B/A23B MoE 关键训练运行以来,已经过去了几周。到目前为止,一切顺利得几乎无聊。距离 Marin 加入 Open Athena 也刚过一年。我写下了一些关于我们已经走了多远,以及我们是如何走到这一步的想法。https://openathena.ai/blog/marin-535b-launch-note/…
查看原文
查看缓存全文

缓存时间: 2026/09/04 10:23

自从Marin启动我们的535B/A23B MoE旗舰训练以来,已过去数周。目前进展顺利得近乎乏味。自Marin加入Open Athena也刚满一年,我写下这些文字回顾我们走过的历程及发展脉络。https://openathena.ai/blog/marin-535b-launch-note/


Marin 535B-A23B发布说明

来源:https://openathena.ai/blog/marin-535b-launch-note/ 数周前,我们启动了年度压轴训练——参数总量达535B、激活参数23B的混合专家模型(MoE)。计划基于18万亿token进行约3个月预训练,数据涵盖智能体、编程与科学领域。秉承我们对开放研发的承诺(https://openathena.ai/blog/open-development-of-frontier-ai/),本次训练全过程——包括架构设计、数据构成、损失预测等——均记录在GitHub(https://github.com/marin-community/marin/issues/8435)。

这是我们训练过的最大模型,且进展顺利得近乎乏味:各项指标均符合预期,基础架构运行平稳,几乎未出现数值异常。您可通过以下途径持续关注训练进程:W&B报告(https://wandb.ai/marin-community/marin_moe/reports/535B-A23B-18T-Token-Hero-Run-Scaling-Ladder–VmlldzoxNzc2MDM5Ng)、GitHub追踪(https://github.com/marin-community/marin/issues/8435)或专用监控面板(https://mtracker.oa.dev/hero-run-535b)。

时值Marin加入Open Athena满一年之际,回顾这段旅程实属自然。简而言之,这是收获颇丰的一年:自加入以来,Marin团队从一名全职成员发展至十人规模,并构建了诸多我们曾梦寐以求的技术体系。

  • 我们发布了Delphi缩放研究套件(https://openathena.ai/blog/delphi/),开源了基于1e23 FLOPs训练的模型,其缩放定律可在0.2%误差范围内预测300倍规模模型的性能表现。
  • Marin MoE V1(https://openathena.ai/blog/pretraining-speedup/)规模突破100B参数并达到1e23 FLOPs。其中129B参数(16B激活)的训练在预登记损失预测的1%误差内,相比稠密型Delphi方案实现6.7倍理论加速(TPU v4实际加速3.6倍)。
  • 我们开发了Iris全球算力调度系统(https://openathena.ai/blog/cluster-scheduling-with-iris/),实现全球算力资源调度;同时构建了DataKit预训练数据处理系统(https://storage.googleapis.com/marin-public/held/harrier-k40-cluster-overview/2026.08.18/index.html?revision=uniform-sampling),完成数据策展与混合的端到端管理。
  • 我们正完成Snowball(https://storage.googleapis.com/marin-public/benjaminfeuer/standing-up-a-cold-start-sft-pipeline-for-marin-models/2026.08.16/index.html)——基于10T token训练的67B-A2B MoE模型。我们将上下文长度扩展至262K,并构建了完整的后训练流程,即将发布。

此外,我们发表了系列论文,并协助孵化了两项独立的生物学基础模型(https://openathena.ai/blog/marin-dna/)构建计划。

上述任一成就在一两年前对Marin而言都是遥不可及的目标。不出所料,我总会反复提及535B训练。令我最感慨的是:自启动以来,整个过程竟如此“平淡”。

须知我们的旗舰训练传统上从不乏味。2024年当Percy与我创立Marin时,目标虽客观而言相对保守,却仍显得雄心勃勃:计划通过全开源模型对标Llama 3.1 8B。得益于Google TPU Research Cloud慷慨提供的512个TPU v5e核心(极大提升了当时的算力资源),Marin 8B(https://marin.readthedocs.io/en/latest/reports/marin-8b-retro/)成功完成训练:在19项基础评估中16项达到或超越Llama 3.1 8B。

随后我们利用预约间隙的v5p可抢占芯片启动了Marin 32B训练,直接设定超参数并启动训练,看似轻松。然而我们很快发现:在拼凑的基础设施上训练大型模型,尤其当出现损失尖峰(https://wandb.ai/marin-community/marin/reports/Marin-32B-Work-In-Progress–VmlldzoxMzM1Mzk1NQ)时,单靠一名全职成员实难兼顾监控——谁曾料想?经过多次“手术”(特别是引入QK归一化)并最终回退至稳定的v4-2048配置,模型勉强完赛,竟还成为相当不错的模型(https://marin.readthedocs.io/en/latest/reports/marin-32b-retro/)。

这段经历虽令人振奋,却清晰暴露了我们的瓶颈:我们已证明小型团队能训练出优质开源模型,但单人全职、借用设施、拼凑算力的模式已达极限。

恰在此时,Open Athena首席执行官Jeff Hammerbacher提出邀约:让Marin加入Open Athena,获得成长为正式实验室的资源,同时保持开放研发的承诺。我们欣然接受。在Jeff、David Siegel及Open Athena全体成员支持下,Marin团队从单人全职扩展至十人。

此后一年的目标明确而艰巨:将曾依赖临场发挥与英雄式拼搏的一切,转化为可复制的科学方法与基础设施体系,再将其规模化以触及技术前沿。

我们还荣幸获得Jen-Hsun与Lori Huang基金会(https://openathena.ai/blog/huang-foundation-marin-535b-training-run/)的慷慨资助,为Marin未来一年的算力需求提供保障。这份支持使我们得以开启535B-A23B的规模化训练。对于一个十人开放实验室而言,这是非凡的信任与投入,我们深怀感激。

我反复强调训练的“乏味性”,正是因为这种成熟度正是我们所有构建工作的核心目标。我们专注的平滑缩放定律与稳定超参迁移,意味着训练启动前便已精准预测模型性能。Iris及其他基础设施的完善,使我们甚至无需为值班团队设置呼叫系统:硬件故障虽时有发生,但系统会自动恢复,训练持续进行。

这并非说发布前无需大量准备:我们需最终确定架构、准备数据混合、运行缩放定律实验以验证预测,并将整个技术栈从GCP的Google TPU迁移至CoreWeave的NVIDIA GPU——这些工作自然艰巨。

显而易见,筹备工作千头万绪,而我却因故缺席:先是按计划前往哥斯达黎加家庭旅行(需说明的是,CoreWeave提前数周交付了GPU——这种情况何其罕见!),随后又因基孔肯雅热引发的高烧,连续数周陷入谵妄状态,而团队其他成员则全力推进发布进程。

尽管缺席令我倍感煎熬,但项目在我的缺位下仍平稳推进,这正是我最为自豪的成就之一。两年前甚至一年前,当Marin仅有一名全职成员时,这显然无法实现——当时我甚至无法彻底脱离工作休假。因此,尽管心怀错失(FOMO),我仍为本次训练及Marin整体成就感到无比自豪。

这也意味着本次发布的荣誉属于那些未曾裹着毯子颤抖、短暂沉浸于超现实幻觉中的成员。

基础模型成果日益归属于组织或庞大的作者列表,个体贡献往往难以辨识。这些模型是团队协作的结晶,但团队由个体组成,每位成员都应获得认可:

  • Larry Dial主导模型与训练方案设计:架构选型、优化器与路由策略、缩放阶梯设计与执行,以及最终训练规格制定。若无其工作,损失曲线不会如此“平淡”而优异。
  • Will Held负责生产数据与评估准备。他筛选了绝大部分20万亿token源数据,通过实验确定最终训练混合配比,并构建评估体系以验证方案有效性。
  • Isaac Hodes统筹全局。他将庞杂实验与目标凝练为发布前需解决的核心问题,并在答案(乃至问题)动态演变时持续更新认知图景。
  • Mark Muchane虽在发布前数周加入团队,却在数据流水线与训练内核方面均有贡献:参与构建与审核质量评分流水线,并将新型无丢失“小猫混合架构(https://cursor.com/blog/mixture-of-kittens)”后端优化至完备状态,定位其性能瓶颈。
  • Russell Power是保障训练“乏味”的基础架构关键。除开发Iris并在CoreWeave部署外,他系统排查各层级可靠性问题,将硬件故障恢复时间从约一小时缩短至数分钟。
  • Matt Wittmann围绕XLA:GPU的异步全收集通信重构了专家并行路径,同时优化原生算子。此举基本消除token丢弃,将MFU从21%提升至24%,缩减约八分之一的预估剩余训练时间。
  • Rafal Wojdyla在数据与系统层面共同保障训练实现。他创建了DataKit处理流水线,实现基于嵌入的重聚类、溯源追踪与全局模糊去重;同时构建了首个GPU友好的专家并行实现。
  • Romain Yon为自研的“Grug MoE”架构引入vLLM支持。他验证了检查点导出与推理一致性,探索了该规模模型的部署方案,并构建了从训练检查点到评估及下游应用的路径。

我们并非孤军奋战。NVIDIA与CoreWeave合作伙伴对本次训练的启动至关重要。NVIDIA的JAX团队协助解决了我们挖掘的各种特殊边界问题,CoreWeave团队则以极高响应速度追踪硬件故障。同时感谢Alec Radford与Kaiyue Wen在发布前的宝贵建议。

最后,我们要感谢Zak Stone与Google TPU Research Cloud——他们为本次训练提供缩放阶梯所需算力,并从始至终支持Marin。这份支持的重要性难以言喻:没有它,Marin根本不会存在。

这仅是我们2026年度旗舰训练的预训练阶段。训练完成后,模型将移交至Ben Feuer领导的后训练团队,相关进展即将公布。

回顾过去一年,我们专注于构建能可靠、稳定产出模型的体系。我们积累了海量数据、中间模型与过程信息——几乎全部公开于GitHub、WandB、实验报告及Discord对话中。

问题在于信息总量已过于庞大。透明度不等于可理解性。因此,我们下一年的核心目标是:将透明度转化为可消化的知识体系。我们致力于更好地将实验、决策、成功与失败转化为Marin外部社区可实际应用的经验。

两年前,Marin创立的初衷是验证微型开源项目能否训练出具有竞争力的基础模型。过去一年,我们致力于构建可靠实现这一目标的实验室。未来一年,我们需要更有效地将所学转化为普惠知识。

引用本文

@misc{hall2026_marin_535b_launch_note,
  author = {Hall, David},
  title = {Marin 535B-A23B发布说明},
  year = {2026},
  month = {sep},
  howpublished = {\url{https://www.openathena.ai/blog/marin-535b-launch-note/}},
  note = {Open Athena博客}
}

相似文章