llm-pretraining

标签

Cards List
#llm-pretraining

终端收缩平均揭示LLM预训练中的调度-估计器交互

arXiv cs.LG ↗ · 6天前 缓存

提出终端收缩平均法 (TSA) 以在LLM预训练中将学习率调度与模型估计器分离,提高验证质量并可能加速基准测试。

0 人收藏 0 人点赞
#llm-pretraining

具有有限Newton-Schulz的Muon:非光滑非凸优化中的平滑益处

arXiv cs.LG ↗ · 2026-08-28 缓存

本文分析了Muon优化器中的有限Newton-Schulz迭代如何通过平滑极映射使非光滑非凸优化受益,提供了匹配最佳已知界限的收敛保证。

0 人收藏 0 人点赞
#llm-pretraining

数据混合作为混合实验:响应曲面方法与大型语言模型预训练的最优设计

arXiv cs.AI ↗ · 2026-08-26 缓存

本文将大型语言模型预训练的数据混合构建为混合实验,应用响应曲面方法和最优实验设计来提高代理训练运行的效率和可解释性。

0 人收藏 0 人点赞
#llm-pretraining

@AdinaYakup: Ultra-FineWeb-L1 开放英文网络语料库,用于LLM预训练,来自@OpenBMB https://huggingface.co/datasets/openbmb/Ult…

X AI KOLs Timeline ↗ · 2026-08-21 缓存

OpenBMB 发布了 Ultra-FineWeb-L1,一个开放英文网络语料库,包含超过1万亿个token,用于LLM预训练,源自Common Crawl,并采用Trafilatura 2.0进行高级清理。

0 人收藏 0 人点赞
#llm-pretraining

LLM预训练中的领域数据重复扩展研究

Hugging Face Daily Papers ↗ · 2026-08-14

本文研究了在LLM预训练中重复高质量领域数据以在模型扩展时维持性能的权衡,发现最佳重复次数随模型大小增加,并与领域验证损失呈负相关。

0 人收藏 0 人点赞
#llm-pretraining

计算最优并非集群最优:面向稀疏专家混合模型的系统感知扩展

arXiv cs.LG ↗ · 2026-08-12 缓存

本文介绍了MOSAIC,一个联合优化稀疏专家混合模型架构与硬件系统以支持大规模预训练的框架,表明在考虑MFU、通信成本和并行布局时,计算最优的稀疏性并不一定是集群最优的。

0 人收藏 0 人点赞
#llm-pretraining

MESH:用于混合专家训练的内存高效Sinkhorn优化

arXiv cs.LG ↗ · 2026-08-06 缓存

本文介绍了MESH,一种用于混合专家(MoE)训练的内存高效Sinkhorn优化器,它在不存储完整优化器状态的情况下恢复时间动量,相比AdamW将内存减少62.5%,同时保持有竞争力的评估损失。

0 人收藏 0 人点赞
#llm-pretraining

@burny_tech: 关于优化器魔法的更新

X AI KOLs Timeline ↗ · 2026-07-24 缓存

一篇新的NVIDIA论文提出,像Muon和SOAP这样的高阶优化器,可以作为大规模LLM预训练中AdamW的更高效替代方案。

0 人收藏 0 人点赞
#llm-pretraining

SOAP、Muon 及更多:推动LLM预训练规模扩展

arXiv cs.LG ↗ · 2026-07-24 缓存

本文改进了高阶优化器 SOAP 和 Muon,用于大规模 LLM 预训练,解决了大批量训练中的不稳定性问题,并引入了一种与 Megatron-LM 兼容的层式分布式优化器。实验表明,在数十亿参数规模下,它们始终优于 AdamW。

0 人收藏 0 人点赞
#llm-pretraining

一步梯度延迟并非大规模异步流水线并行LLM预训练的障碍

Hugging Face Daily Papers ↗ · 2026-06-29 缓存

本文挑战了异步流水线并行中一步梯度延迟天生不稳定的假设,表明性能下降取决于优化器的选择。研究证明,Muon等优化器对一步延迟具有鲁棒性,并引入了一种基于误差反馈的修正方法以进一步缓解陈旧的梯度问题,在高达10B参数的LLM预训练中实现了接近同步训练的性能。

0 人收藏 0 人点赞
#llm-pretraining

@eisokant:来自@ArkadiiBessonov关于我们预训练团队的一篇精彩博客文章!

X AI KOLs Timeline ↗ · 2026-06-27 缓存

一条推文分享了一篇博客文章,讨论了LLM预训练中FP8的三种方法:per-tensor、blockwise和MXFP8,重点介绍了缩放因子的附加方式。

0 人收藏 0 人点赞
#llm-pretraining

基于多目标强化学习的LLM预训练整体数据调度器

Hugging Face Daily Papers ↗ · 2026-06-23 缓存

介绍了一种基于强化学习的整体数据调度器(HDS),该框架利用多目标奖励函数在LLM预训练过程中动态调整数据混合策略,使达到目标困惑度所需的迭代次数减少44%,并在MMLU上提升7.2%。

0 人收藏 0 人点赞
#llm-pretraining

RegMix-D: 通过代理训练轨迹实现动态数据混合

arXiv cs.CL ↗ · 2026-06-18 缓存

RegMix-D 将 RegMix 扩展到动态数据混合,通过使用代理运行的损失轨迹来预测多个训练阶段的最优混合比例,相比静态方法取得了改进。

0 人收藏 0 人点赞
#llm-pretraining

Web规模LLM预训练数据中叙事内容的特征刻画

Hugging Face Daily Papers ↗ · 2026-06-17 缓存

对Web规模LLM预训练数据中叙事特征的细粒度研究,引入了NarraBERT和NarraDolma来测量叙事模式及其在不同来源中的分布。

0 人收藏 0 人点赞
#llm-pretraining

Parallax: 参数化局部线性注意力机制用于语言建模

Hugging Face Daily Papers ↗ · 2026-05-27 缓存

介绍Parallax,一种参数化局部线性注意力机制,结合硬件感知优化,提升LLM预训练效率和性能,在0.6B和1.7B规模实现帕累托改进。

0 人收藏 0 人点赞
#llm-pretraining

@IntologyAI:编码智能体能做研究吗?我们发布 NanoGPT-Bench,这是我们用来测试编码智能体在 AI 研发问题上的一项内部评估…

X AI KOLs Following ↗ · 2026-05-19 缓存

IntologyAI 发布了 NanoGPT-Bench,这是一个用于评估编码智能体在 AI 研发任务上表现的内部基准。当前的智能体仅恢复了人类进展的 9.3%,主要通过超参数调优,凸显了算法研究能力方面的差距。

0 人收藏 0 人点赞
#llm-pretraining

SimReg:通过嵌入相似性正则化在预训练阶段实现更高性能

arXiv cs.CL ↗ · 2026-05-12 缓存

本文介绍了 SimReg,这是一种用于大语言模型预训练的正则化技术,利用嵌入相似性可将训练收敛速度提高 30% 以上,并显著提升零样本性能。

0 人收藏 0 人点赞
#llm-pretraining

InfoLaw:基于质量加权混合数据与重复度的大型语言模型信息缩放定律

Hugging Face Daily Papers ↗ · 2026-05-04 缓存

InfoLaw 是一种数据感知型缩放框架,能够根据 token 消耗量、模型规模、数据混合权重及重复度预测模型损失,从而在不同算力预算下实现高效的数据配方选择。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈