标签
讨论比较了各种 AI 模型的训练成本,指出 Qwen 27B 和 DeepSeek V4 Flash 在每令牌 GPU 小时数上成本相似,强调了 MFU 在预训练效率中的作用。
面壁智能开源了由AI Agent自主编写的预训练框架ForgeTrain,在H100上达到44% MFU,比Megatron-LM高约10%,实现了AI自我进化迭代。