mfu

标签

Cards List
#mfu

然而,27B 密集型 Qwen 可能预训练时的 MFU 远高于 DSV4-Flash 13AB,因此它们在 GPU 小时数上差不多…

X AI KOLs Following ↗ · 2026-08-16 缓存

讨论比较了各种 AI 模型的训练成本,指出 Qwen 27B 和 DeepSeek V4 Flash 在每令牌 GPU 小时数上成本相似,强调了 MFU 在预训练效率中的作用。

0 人收藏 0 人点赞
#mfu

@FeitengLi: #面壁智能 开源 #ForgeTrain 由 AI Agent 自主写出的预训练框架,连 CUDA kernel 都是它自己写的。H100 上 MiniCPM4-0.5B 跑到 44% MFU,比 Megatron(NVidia 主推 G…

X AI KOLs Timeline ↗ · 2026-05-26 缓存

面壁智能开源了由AI Agent自主编写的预训练框架ForgeTrain,在H100上达到44% MFU,比Megatron-LM高约10%,实现了AI自我进化迭代。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈