@andykonwinski: 我忍不住要一直关注这个。Marin团队正在训练史上最大的完全开放模型。535B参数(23B活跃…

X AI KOLs Timeline 模型

摘要

Marin团队正在训练最大的完全开放模型,拥有535B参数,通过实时跟踪和开放数据日志提供前所未有的透明度。

我忍不住要一直关注这个。Marin团队正在训练史上最大的完全开放模型。535B参数(23B活跃),18T tokens。在hero run中从未有人如此透明。除了权重,数据、日志和决策都是开放的。你可以,也应该,实时跟踪这个训练,目前大约完成了15%! https://mtracker.oa.dev/hero-run-535b
查看原文
查看缓存全文

缓存时间: 2026/09/04 06:39

我忍不住一直关注这个项目。Marin团队正在训练史上最大的完全开源模型。535B参数(23B活跃),18万亿token数据。从未有人在如此重要的训练中如此透明——除了权重本身,连数据、日志和决策过程都完全开放。你确实应该(也完全可以)实时追踪这次训练进程,目前进度约15%! https://mtracker.oa.dev/hero-run-535b


Marin 535B-A23B MoE — Marin训练追踪器

来源:https://mtracker.oa.dev/hero-run-535b 训练状态已稳定持续近二十小时——自9月2日晚9点20分(美东时间)团队将任务切回前次使用的专家路由后端(https://github.com/marin-community/marin/issues/8506#issuecomment-5518941160)以来,此前测试的替代后端曾两次挂起。损失曲线仍保持切换前的走势。自1点19分(美东时间)至今已近十六小时,无人在任务讨论区发言。

关于门控与路由权重衰减的PR #8833(https://github.com/marin-community/marin/pull/8833)仍未合并。该修改旨在将注意力门控与路由权重持续向零值牵引,以防止训练初期几层中注意力门控的权重范数持续增长(#8818)。由于门控负责缩放每个注意力头的输出,范数增大会导致缩放比例过度依赖门控值——而该值在不同token间存在波动。测试方案是从永久保存点(非覆盖式检查点)分叉出第二训练分支,与当前主线进行对比。PR #8854(https://github.com/marin-community/marin/pull/8854)曾请求在第55,000步固化检查点,但该请求与#8833均未能在任务达到该步前(美东时间凌晨2:50左右 https://wandb.ai/marin-community/marin_moe/runs/hero-12d8b6f0-dee637)并入运行代码:回滚操作特意重启了更早的提交版本,而重启任务时将采用代码库在启动时点的配置。下一个由配置固化的永久检查点设在第60,000步,按当前训练速度约需14小时。ClassicLarry保持#8833未合并状态(https://github.com/marin-community/marin/pull/8833#issuecomment-5516713103),等待计划中的重启,以避免意外恢复导致衰减功能被提前启用。

导致切换挂起的后端问题仍作为#8870(https://github.com/marin-community/marin/issues/8870)开放。该实验性后端采用“不规则全对全通信”机制,仅将token发送给相关专家,因其在相同算力下能保留更多有效token而被选用。但在前百步内两次挂起,每次均发生在11个机架中的单个机架内,且各层级日志均未记录错误。目前尚无修复方案,因单机架测试与小规模训练均无法复现挂起现象,导致候选修复缺乏验证基准。美东时间9月3日凌晨1:19,另一个训练大型混合专家模型的团队报告了相关的前层异常(https://github.com/marin-community/marin/issues/8818#issuecomment-5520889983):他们的训练中前几层专家在数千步后停止学习,而损失与评估指标保持正常(详细说明)。该团队从相反方向发现此现象(权重范数收缩而非增长),并提醒两个系统几乎无组件重叠,此关联仅为可能性推断而非确切诊断。

Percy Liang (@percyliang): Marin 535B-A23B训练已完成13%。这次关键训练能够实现,离不开Jen-Hsun与Lori Huang基金会的慷慨支持——该基金为计算资源(Coreweave)提供了资金。感谢@JensenHuang对开源模型的支持!

相似文章