@latkins:通知有点晚,但30分钟后我將在这里演讲。这是我Trinity Large演讲的更新版,还有一些预告……
摘要
Alatkins宣布在拉斯维加斯的AI4大会上发表一场临时演讲,内容涵盖Trinity Large演讲的更新版本,并预告了关于训练一个400B MoE模型至17T tokens而无损失尖峰的内容。
查看缓存全文
缓存时间: 2026/08/05 22:29
时间仓促,但我会在30分钟后在这里发言。这是我Trinity Large演讲的更新版,并预告一些接下来将要呈现的内容。
Arcee.ai (@arcee_ai): 如果你在拉斯维加斯参加 @Ai4Conferences,请务必在上午11:20到威尼斯人宴会厅A厅听 @latkins 的演讲:
如何不炸掉一切:训练一个400B参数的MoE模型,处理17T tokens而不出现损失尖峰
相似文章
@PyTorch: 如何从每一美元的人工智能投入中获得更多有用的工作——而不仅仅是更多的令牌?本周三上午11:50在@AMD #Advancing…
PyTorch Foundation CTO Matt White将在AMD的AdvancingAI活动上发表演讲,探讨如何使用vLLM和SGLang等开源工具优化AI推理经济学,倡导使用规模合适的模型和智能路由,以改善每美元智能。
@gmkurtzer:我刚听了来自@arcee_ai首席技术官@latkins的这个视频,他谈到了训练大型MO…
Gregory Kurtzer称赞Lucas Atkins的演讲,内容涉及训练大型稀疏混合专家模型的经验教训,以及AI实验室初创公司的生活。
Liquid AI 发布基于 38T 训练的 8B-A1B MoE 模型
Liquid AI 发布了 LFM2.5-8B-A1B,这是一款边缘 MoE 模型,基于 38T tokens 训练,拥有 128K 上下文窗口,改进了工具调用和推理能力,可在 Hugging Face 上获取。
@Prince_Canuma: 我在 @aiDotEngineer 的演讲已上线:“基于 MLX 的端侧智能”。非常感谢 @swyx 和团队的邀请——ha…
作者宣布其在 aiDotEngineer 活动上的演讲《基于 MLX 的端侧智能》已上线,并对主办方及社区贡献者表示感谢。
@svlevine:在经历了一点音视频故障后,现在开始!ASEM Ballroom 203,不见不散 :) 演讲内容将涵盖如何构建……
Sergey Levine 宣布将在 ICML 2026 离线数据集决策研讨会发表演讲,内容涵盖从基于模型的优化到离线强化学习的数据驱动决策基础。