@andykonwinski: 我忍不住要一直关注这个。Marin团队正在训练史上最大的完全开放模型。535B参数(23B活跃…
摘要
Marin团队正在训练最大的完全开放模型,拥有535B参数,通过实时跟踪和开放数据日志提供前所未有的透明度。
查看缓存全文
缓存时间: 2026/09/04 06:39
我忍不住一直关注这个项目。Marin团队正在训练史上最大的完全开源模型。535B参数(23B活跃),18万亿token数据。从未有人在如此重要的训练中如此透明——除了权重本身,连数据、日志和决策过程都完全开放。你确实应该(也完全可以)实时追踪这次训练进程,目前进度约15%! https://mtracker.oa.dev/hero-run-535b
Marin 535B-A23B MoE — Marin训练追踪器
来源:https://mtracker.oa.dev/hero-run-535b 训练状态已稳定持续近二十小时——自9月2日晚9点20分(美东时间)团队将任务切回前次使用的专家路由后端(https://github.com/marin-community/marin/issues/8506#issuecomment-5518941160)以来,此前测试的替代后端曾两次挂起。损失曲线仍保持切换前的走势。自1点19分(美东时间)至今已近十六小时,无人在任务讨论区发言。
关于门控与路由权重衰减的PR #8833(https://github.com/marin-community/marin/pull/8833)仍未合并。该修改旨在将注意力门控与路由权重持续向零值牵引,以防止训练初期几层中注意力门控的权重范数持续增长(#8818)。由于门控负责缩放每个注意力头的输出,范数增大会导致缩放比例过度依赖门控值——而该值在不同token间存在波动。测试方案是从永久保存点(非覆盖式检查点)分叉出第二训练分支,与当前主线进行对比。PR #8854(https://github.com/marin-community/marin/pull/8854)曾请求在第55,000步固化检查点,但该请求与#8833均未能在任务达到该步前(美东时间凌晨2:50左右 https://wandb.ai/marin-community/marin_moe/runs/hero-12d8b6f0-dee637)并入运行代码:回滚操作特意重启了更早的提交版本,而重启任务时将采用代码库在启动时点的配置。下一个由配置固化的永久检查点设在第60,000步,按当前训练速度约需14小时。ClassicLarry保持#8833未合并状态(https://github.com/marin-community/marin/pull/8833#issuecomment-5516713103),等待计划中的重启,以避免意外恢复导致衰减功能被提前启用。
导致切换挂起的后端问题仍作为#8870(https://github.com/marin-community/marin/issues/8870)开放。该实验性后端采用“不规则全对全通信”机制,仅将token发送给相关专家,因其在相同算力下能保留更多有效token而被选用。但在前百步内两次挂起,每次均发生在11个机架中的单个机架内,且各层级日志均未记录错误。目前尚无修复方案,因单机架测试与小规模训练均无法复现挂起现象,导致候选修复缺乏验证基准。美东时间9月3日凌晨1:19,另一个训练大型混合专家模型的团队报告了相关的前层异常(https://github.com/marin-community/marin/issues/8818#issuecomment-5520889983):他们的训练中前几层专家在数千步后停止学习,而损失与评估指标保持正常(详细说明)。该团队从相反方向发现此现象(权重范数收缩而非增长),并提醒两个系统几乎无组件重叠,此关联仅为可能性推断而非确切诊断。
Percy Liang (@percyliang): Marin 535B-A23B训练已完成13%。这次关键训练能够实现,离不开Jen-Hsun与Lori Huang基金会的慷慨支持——该基金为计算资源(Coreweave)提供了资金。感谢@JensenHuang对开源模型的支持!
相似文章
@svpino: 这对任何希望看到开源模型成功的人来说意义重大!这是我第一次看到开源模型发布检查点级别的…
该帖子强调了K2 Horizon的发布,这是一套由六个开源基础模型组成的互联系列,参数从0.9B到375B,提供检查点级别的日志、训练代码和评估,标志着开源AI发展的重大一步。
@percyliang: Marin 535B-A23B本周开始训练!一如既往,整个过程是开放的。航行计划:预训练(80%)+中训练…
Marin 535B-A23B AI模型的训练已开始,过程开放,涉及在GB200 NVL72硬件上使用18.75万亿tokens进行预训练和中训练,历时约3个月。
@dlwh: 自从 Marin 启动我们的 535B/A23B MoE 关键训练运行以来,已经过去了几周。到目前为止,一切顺利得几乎无聊。它还…
Open Athena 推出了一次 535B/A23B MoE 模型训练运行,进展如预期,突显了他们对开放发展的承诺以及在AI扩展方面的重大进展。
@timodonnell: 想观看一个535B参数(23B活跃)的LLM实时训练吗?在这里跟随 https://wandb.ai/marin-community/ma…
一条推文宣布了535B参数(23B活跃)大语言模型的实时训练,并提供了在Weights & Biases和GitHub上跟踪进程的链接。
@AndrewYNg:在捍卫人工智能开放性的斗争中,Marin项目是模型训练开放性的一个宝贵示范,…
Andrew Ng 强调 Marin 项目是人工智能模型训练开放性的一个宝贵范例,Percy Liang 宣布使用开放代码、数据和流程开始训练 Marin 535B-A23B。