Nvidia Vera Rubin 是否真的能加速 LLM 预训练?接下来会是 10 万亿以上参数的模型吗?

Reddit r/ArtificialInteligence 新闻

摘要

文章质疑 Nvidia 的 Vera Rubin 是否会加速 LLM 预训练,并探讨了考虑到数据、电力和成本等限制,超过 10 万亿参数的模型是否可行。

Nvidia Vera Rubin 的数字看起来很大,但大部分头条收益似乎与低精度格式和推理有关。其中有多少实际上能转移到预训练中?也好奇我们是否会开始看到 10T+ 参数模型,或者数据、电力和成本现在是真正的限制,而重点仍然放在 MoE 和更好的数据上,而不是仅仅变得更大。任何有硬件或训练经验的人,我很想听听你的看法。
查看原文

相似文章