training

标签

Cards List
#training

我在5小时内在H100上训练了一个117M参数的Silia模型。

Reddit r/singularity ↗ · 2026-07-07

一个拥有1.17亿参数的Silia模型在H100 GPU上使用8200万个token训练了5小时。该模型严重欠训练,但提供了与nanoGPT的对比。

0 人收藏 0 人点赞
#training

@YuvrajS9886: 在数据并行之后,我们转向模型并行,从流水线并行开始。论文:GPipe:使用微批处理轻松扩展…

X AI KOLs Timeline ↗ · 2026-07-06 缓存

本线程解释了GPipe,这是一篇关于使用微批处理和激活检查点技术跨多个GPU扩展大模型的流水线并行论文。

0 人收藏 0 人点赞
#training

@QuixiAI:AUM说话了!我从零开始训练了我自定义的架构。在8x3090设备上用1B个token训练了78M参数…

X AI KOLs Timeline ↗ · 2026-07-04 缓存

用户宣布他们从零开始训练了一个自定义的78M参数AI架构,在8x3090设备上使用1B个token耗时12小时,声称该模型现在可以说话了。

0 人收藏 0 人点赞
#training

@AnnmariaKAntony: LLMs 擅长 CUDA,因为互联网上充满了相关内容。但一个能提供高度优化 CUDA 的模型可能仍然……

X AI KOLs Timeline ↗ · 2026-07-02 缓存

一个结合 SFT 和 GRPO RL 后训练的多智能体合成数据流水线,为 14B 开源模型在 AMD MI350X GPU 上提升了 HIP 的编译和正确性。

0 人收藏 0 人点赞
#training

梯度平滑:耦合逐层更新以改进优化

arXiv cs.LG ↗ · 2026-07-01 缓存

介绍了深度方向梯度增强(Depth-wise Gradient Augmentation),这是一种通用的优化范式,沿着深度维度转换块级优化器更新。该方法,即梯度平滑(Gradient Smoothing),提升了包括Transformer和扩散模型在内的多种架构的优化和泛化性能。

0 人收藏 0 人点赞
#training

@AaronWeiHuang:我们最新博客探讨了FP4如何从压缩工具演变为训练和推理的实用基础方案,涵盖……

X AI KOLs Following ↗ · 2026-06-30 缓存

NVIDIA的博客详细介绍了FP4(配合NVFP4格式和Blackwell硬件)如何从一种压缩技巧演变为训练和推理的实用基础方案,涵盖LLM和扩散模型,并实现了接近16位的精度。

0 人收藏 0 人点赞
#training

多块扩散语言模型

Hugging Face Daily Papers ↗ · 2026-06-30 缓存

本文提出多块扩散语言模型(MBD-LMs),将单块扩散扩展为并发多块解码,并采用优化训练策略如多块教师强制(Multi-block Teacher Forcing)和优化的块缓冲区解码算法。实验表明,每次前向传递的令牌数增加,基准测试准确率提升。

0 人收藏 0 人点赞
#training

@yibie: 推荐这个 repo,从零构建 GPT 风格 transformer,不用任何高级库。13M 参数就能产出语法正确的文本,在免费 Colab 的 T4 上一天就能训完。 从零训练自己的 LLM:13M 参数的 GPT 实现 Akshay 分…

X AI KOLs Timeline ↗ · 2026-06-29 缓存

推荐了一个从零构建GPT风格Transformer的GitHub仓库,无需高级库,13M参数即可在免费Colab上训练一天,生成语法正确的文本。

0 人收藏 0 人点赞
#training

@che_shr_cat: 1/ 我们一直误解了GPU内存的使用方式。如果GPU根本不需要存储你的模型呢?MegaTrain 实现了…

X AI KOLs Timeline ↗ · 2026-06-29 缓存

MegaTrain 通过将 VRAM 视为瞬时无状态缓存,反转内存层次结构,在单张 GPU 上实现了 100B 以上大语言模型的全精度训练。

0 人收藏 0 人点赞
#training

@Hikari_07_jp: 进展报告!DFlash 骨干网络和马尔可夫头的训练已完成,使得 DSpark 可在 27B 上使用。我们将…

X AI KOLs Timeline ↗ · 2026-06-28 缓存

DSpark 的进展更新:DFlash 骨干网络和马尔可夫头的训练已完成,可在 27B 上使用。接下来将训练置信度头以实现自适应草稿生成,预计比 DFlash 加速 8-14%。

0 人收藏 0 人点赞
#training

@VukRosic99: 当小模型从大模型学习时,一半的教训被浪费了 设置:一个小的“学生”模型写出答案…

X AI KOLs Timeline ↗ · 2026-06-28 缓存

该论文识别了语言模型在策略蒸馏中的位置偏差,即学生模型生成的答案中后面的token接收到的监督质量下降。所提出的重要性加权在策略蒸馏(IW-OPD)根据累积漂移对修正进行加权,提高了学习速度和最终性能。

0 人收藏 0 人点赞
#training

@ArkadiiBessonov: LLM预训练中使用FP8的三种主要方法——区别主要在于scale的附加方式。per-tens…

X AI KOLs Timeline ↗ · 2026-06-27 缓存

解释了LLM预训练中FP8缩放的三种主要方法——per-tensor、blockwise和MXFP8——重点关注scale的附加方式,并根据scale必须在matmul的收缩维度上保持恒定这一约束,推导出tile几何形状。

0 人收藏 0 人点赞
#training

韩国计划将全体军队培训为"无人机战士"

Ars Technica ↗ · 2026-06-26 缓存

韩国宣布计划培训全部50万军事人员操作无人机,将其作为"通用作战工具",此举受乌克兰和中东无人机战争的启发。

0 人收藏 0 人点赞
#training

训练中检测奖励欺骗的RL奖励函数调试器 [P]

Reddit r/MachineLearning ↗ · 2026-06-26

一个调试器,在强化学习训练期间检测奖励函数中的奖励欺骗,帮助开发人员识别和修复问题。

0 人收藏 0 人点赞
#training

@almond_robotics: 约1000个训练片段之一。

X AI KOLs Following ↗ · 2026-06-26 缓存

Almond Robotics分享了其机器人系统的大约1000个训练片段之一。

0 人收藏 0 人点赞
#training

@lilianweng: 一篇超级迟到的(3年以上?)关于扩展定律的帖子。计算很昂贵。扩展定律是一种帮助我们推理…

X AI KOLs Timeline ↗ · 2026-06-25 缓存

Lilian Weng的博客文章全面概述了深度学习中的扩展定律,涵盖了它们的推导、计算最优分配以及Kaplan等人与Chinchilla之间的争论。

0 人收藏 0 人点赞
#training

@SergioPaniego: 现在您可以使用 TRL 训练 @liquidai 的 LFM2-VL 模型,包含 GRPO 和 RLOO 方法,并附有示例脚本

X AI KOLs Following ↗ · 2026-06-25 缓存

您现在可以使用 TRL 的 GRPO 和 RLOO 方法来训练 Liquid AI 的 LFM2-VL 模型,并提供了示例脚本。

0 人收藏 0 人点赞
#training

@natolambert: 又一场快速讲座——很多人多次问过我关于我书籍的前置知识和应该了解的内容,所以我制作了一个小讲座…

X AI KOLs Timeline ↗ · 2026-06-24 缓存

Nathan Lambert 分享了一段视频讲座,涵盖了他书籍的前置知识,包括语言模型基础、概率和训练流程,使用 GLM 5.2 进行讲解。

0 人收藏 0 人点赞
#training

强化学习:迈向广泛且持续有益的人工智能模型

arXiv cs.AI ↗ · 2026-06-24 缓存

这篇来自OpenAI的论文研究了基于有益行为的强化学习能否产生超越训练分布的广泛且持久的对齐泛化。通过使用一个包含真实场景的数据集,他们表明,对有益特质进行强化训练能够提升分布外的对齐能力,并增强对对抗性攻击的持久抵抗力。

0 人收藏 0 人点赞
#training

@SergioPaniego: 我们让一个智能体实时训练一个编码智能体,仅从一个提示开始——哪个智能体是哪个,为什么这样做有意义,以及所有产物,都在回顾中。

X AI KOLs Timeline ↗ · 2026-06-23 缓存

一个AI智能体从一个提示训练编码智能体的实时演示,并回顾了所有产物。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈