标签
一个拥有1.17亿参数的Silia模型在H100 GPU上使用8200万个token训练了5小时。该模型严重欠训练,但提供了与nanoGPT的对比。
本线程解释了GPipe,这是一篇关于使用微批处理和激活检查点技术跨多个GPU扩展大模型的流水线并行论文。
用户宣布他们从零开始训练了一个自定义的78M参数AI架构,在8x3090设备上使用1B个token耗时12小时,声称该模型现在可以说话了。
一个结合 SFT 和 GRPO RL 后训练的多智能体合成数据流水线,为 14B 开源模型在 AMD MI350X GPU 上提升了 HIP 的编译和正确性。
介绍了深度方向梯度增强(Depth-wise Gradient Augmentation),这是一种通用的优化范式,沿着深度维度转换块级优化器更新。该方法,即梯度平滑(Gradient Smoothing),提升了包括Transformer和扩散模型在内的多种架构的优化和泛化性能。
NVIDIA的博客详细介绍了FP4(配合NVFP4格式和Blackwell硬件)如何从一种压缩技巧演变为训练和推理的实用基础方案,涵盖LLM和扩散模型,并实现了接近16位的精度。
本文提出多块扩散语言模型(MBD-LMs),将单块扩散扩展为并发多块解码,并采用优化训练策略如多块教师强制(Multi-block Teacher Forcing)和优化的块缓冲区解码算法。实验表明,每次前向传递的令牌数增加,基准测试准确率提升。
推荐了一个从零构建GPT风格Transformer的GitHub仓库,无需高级库,13M参数即可在免费Colab上训练一天,生成语法正确的文本。
MegaTrain 通过将 VRAM 视为瞬时无状态缓存,反转内存层次结构,在单张 GPU 上实现了 100B 以上大语言模型的全精度训练。
DSpark 的进展更新:DFlash 骨干网络和马尔可夫头的训练已完成,可在 27B 上使用。接下来将训练置信度头以实现自适应草稿生成,预计比 DFlash 加速 8-14%。
该论文识别了语言模型在策略蒸馏中的位置偏差,即学生模型生成的答案中后面的token接收到的监督质量下降。所提出的重要性加权在策略蒸馏(IW-OPD)根据累积漂移对修正进行加权,提高了学习速度和最终性能。
解释了LLM预训练中FP8缩放的三种主要方法——per-tensor、blockwise和MXFP8——重点关注scale的附加方式,并根据scale必须在matmul的收缩维度上保持恒定这一约束,推导出tile几何形状。
Lilian Weng的博客文章全面概述了深度学习中的扩展定律,涵盖了它们的推导、计算最优分配以及Kaplan等人与Chinchilla之间的争论。
您现在可以使用 TRL 的 GRPO 和 RLOO 方法来训练 Liquid AI 的 LFM2-VL 模型,并提供了示例脚本。
Nathan Lambert 分享了一段视频讲座,涵盖了他书籍的前置知识,包括语言模型基础、概率和训练流程,使用 GLM 5.2 进行讲解。
这篇来自OpenAI的论文研究了基于有益行为的强化学习能否产生超越训练分布的广泛且持久的对齐泛化。通过使用一个包含真实场景的数据集,他们表明,对有益特质进行强化训练能够提升分布外的对齐能力,并增强对对抗性攻击的持久抵抗力。
一个AI智能体从一个提示训练编码智能体的实时演示,并回顾了所有产物。