标签
本文介绍了Steerling-8B,一种以可解释性为约束训练的扩散语言模型,展示了可解释性随规模提升,并支持无需重新训练的概念引导。
展示如何使用FeynRL框架训练一个视觉语言模型来玩贪吃蛇,以易于理解的方式说明完整的训练流程。
MiMo-V2.5-Pro-UltraSpeed 是一个超快的大模型训练 pipeline 管线。
Hugging Face 官方团队完整开源复现了 DeepSeek-R1 的训练全流程(Open-R1 项目),包括数据、训练和评测,在 GitHub 上获得 26.4k star,为行业提供了可复现的推理模型训练教科书。
一份简洁的一页速查表,涵盖PyTorch张量、模型、矩阵乘法以及用于深度学习训练流程的自动求导。
本文提出了LLM-as-Environment-Engineer框架,其中策略模型通过分析失败案例自动重新设计强化学习训练环境,并引入MAPF-FrozenLake作为可控测试平台。该框架使用Qwen3-4B模型,性能优于GPT和Gemini等更大规模模型,表明策略学习提升了模型诊断自身弱点的能力。
本文介绍了一种可扩展的开源管道,利用NVIDIA NeMo进行视频基础模型的训练和推理,通过加速数据集管理和并行化训练来解决生成高质量视频的挑战。