标签
提出终端收缩平均法 (TSA) 以在LLM预训练中将学习率调度与模型估计器分离,提高验证质量并可能加速基准测试。
本文分析了Muon优化器中的有限Newton-Schulz迭代如何通过平滑极映射使非光滑非凸优化受益,提供了匹配最佳已知界限的收敛保证。
本文将大型语言模型预训练的数据混合构建为混合实验,应用响应曲面方法和最优实验设计来提高代理训练运行的效率和可解释性。
OpenBMB 发布了 Ultra-FineWeb-L1,一个开放英文网络语料库,包含超过1万亿个token,用于LLM预训练,源自Common Crawl,并采用Trafilatura 2.0进行高级清理。
本文研究了在LLM预训练中重复高质量领域数据以在模型扩展时维持性能的权衡,发现最佳重复次数随模型大小增加,并与领域验证损失呈负相关。
本文介绍了MOSAIC,一个联合优化稀疏专家混合模型架构与硬件系统以支持大规模预训练的框架,表明在考虑MFU、通信成本和并行布局时,计算最优的稀疏性并不一定是集群最优的。
本文介绍了MESH,一种用于混合专家(MoE)训练的内存高效Sinkhorn优化器,它在不存储完整优化器状态的情况下恢复时间动量,相比AdamW将内存减少62.5%,同时保持有竞争力的评估损失。
一篇新的NVIDIA论文提出,像Muon和SOAP这样的高阶优化器,可以作为大规模LLM预训练中AdamW的更高效替代方案。
本文改进了高阶优化器 SOAP 和 Muon,用于大规模 LLM 预训练,解决了大批量训练中的不稳定性问题,并引入了一种与 Megatron-LM 兼容的层式分布式优化器。实验表明,在数十亿参数规模下,它们始终优于 AdamW。
本文挑战了异步流水线并行中一步梯度延迟天生不稳定的假设,表明性能下降取决于优化器的选择。研究证明,Muon等优化器对一步延迟具有鲁棒性,并引入了一种基于误差反馈的修正方法以进一步缓解陈旧的梯度问题,在高达10B参数的LLM预训练中实现了接近同步训练的性能。
一条推文分享了一篇博客文章,讨论了LLM预训练中FP8的三种方法:per-tensor、blockwise和MXFP8,重点介绍了缩放因子的附加方式。
介绍了一种基于强化学习的整体数据调度器(HDS),该框架利用多目标奖励函数在LLM预训练过程中动态调整数据混合策略,使达到目标困惑度所需的迭代次数减少44%,并在MMLU上提升7.2%。
RegMix-D 将 RegMix 扩展到动态数据混合,通过使用代理运行的损失轨迹来预测多个训练阶段的最优混合比例,相比静态方法取得了改进。
对Web规模LLM预训练数据中叙事特征的细粒度研究,引入了NarraBERT和NarraDolma来测量叙事模式及其在不同来源中的分布。
介绍Parallax,一种参数化局部线性注意力机制,结合硬件感知优化,提升LLM预训练效率和性能,在0.6B和1.7B规模实现帕累托改进。
IntologyAI 发布了 NanoGPT-Bench,这是一个用于评估编码智能体在 AI 研发任务上表现的内部基准。当前的智能体仅恢复了人类进展的 9.3%,主要通过超参数调优,凸显了算法研究能力方面的差距。
本文介绍了 SimReg,这是一种用于大语言模型预训练的正则化技术,利用嵌入相似性可将训练收敛速度提高 30% 以上,并显著提升零样本性能。
InfoLaw 是一种数据感知型缩放框架,能够根据 token 消耗量、模型规模、数据混合权重及重复度预测模型损失,从而在不同算力预算下实现高效的数据配方选择。