Nous Research 发布 Token Superposition Training,可将 LLM 预训练速度提升高达 2.5 倍,覆盖 270M 至 10B 参数模型

Reddit r/singularity 工具

摘要

Nous Research 发布 Token Superposition Training (TST),这是一种可将 LLM 预训练速度提升高达 2.5 倍的方法,覆盖 270M 至 10B 参数模型,在不改变架构或数据的情况下减少实际运行时间。

https://arxiv.org/abs/2605.06546 https://nousresearch.com/token-superposition 预训练大型语言模型的成本很高,即使是适度的效率提升也能转化为有意义的成本和时间节省。Nous Research 发布了 Token Superposition Training (TST),这种方法能够在固定计算量下大幅减少预训练的实际运行时间,且无需改动模型架构、优化器、分词器、并行策略或训练数据。在 10B-A1B 混合专家模型规模上,TST 实现了比匹配 FLOPs 的基线更低的最终训练损失,同时仅消耗 4,768 B200 GPU 小时,而基线为 12,311 小时——总预训练时间减少了约 2.5 倍。
查看原文

相似文章

使用Token叠加的高效预训练

Hugging Face Daily Papers

Token叠加训练(TST)通过将连续token组合成包并在叠加阶段使用多热交叉熵目标,在不改变架构的情况下实现预训练时间最多减少2.5倍,从而提高LLM预训练效率。

通过蒸馏和量化扩展Apertus LLM系列

arXiv cs.LG

本文验证了蒸馏和量化作为经济高效的方法,用于将Apertus LLM系列扩展到新的规模和硬件格式,生成了Apertus-v1.1模型,参数高达4B,在1.7T tokens上训练。