training-pipeline

标签

Cards List
#training-pipeline

扩展固有可解释语言模型

Hugging Face Daily Papers · 2026-08-06 缓存

本文介绍了Steerling-8B,一种以可解释性为约束训练的扩散语言模型,展示了可解释性随规模提升,并支持无需重新训练的概念引导。

0 人收藏 0 人点赞
#training-pipeline

我优化训练流水线的经验:从36步/分钟到47步/分钟

Reddit r/LocalLLaMA · 2026-07-21

作者分享了将训练流水线性能从36步/分钟提升到47步/分钟的技术。

0 人收藏 0 人点赞
#training-pipeline

我训练了一个视觉语言模型来玩贪吃蛇,你也可以。[P]

Reddit r/MachineLearning · 2026-07-14

展示如何使用FeynRL框架训练一个视觉语言模型来玩贪吃蛇,以易于理解的方式说明完整的训练流程。

0 人收藏 0 人点赞
#training-pipeline

@seclink: MiMo-V2.5-Pro-UltraSpeed 超快 , 大模型训练 pipeline 管线.

X AI KOLs Following · 2026-07-03 缓存

MiMo-V2.5-Pro-UltraSpeed 是一个超快的大模型训练 pipeline 管线。

0 人收藏 0 人点赞
#training-pipeline

@Ryrenz: 炸裂,Hugging Face 把 DeepSeek-R1 的训练全流程完整开源复现了一遍。 GitHub 26.4k star,出自 Hugging Face 官方团队,最权威的一集。 DeepSeek-R1 惊艳全场,但真正的训练配方…

X AI KOLs Timeline · 2026-07-03 缓存

Hugging Face 官方团队完整开源复现了 DeepSeek-R1 的训练全流程(Open-R1 项目),包括数据、训练和评测,在 GitHub 上获得 26.4k star,为行业提供了可复现的推理模型训练教科书。

1 人收藏 1 人点赞
#training-pipeline

@0xkozue: https://x.com/0xkozue/status/2072607035624247732

X AI KOLs Timeline · 2026-07-02 缓存

一份简洁的一页速查表,涵盖PyTorch张量、模型、矩阵乘法以及用于深度学习训练流程的自动求导。

0 人收藏 0 人点赞
#training-pipeline

从受训者到训练者:面向多智能体推理的强化学习的LLM设计训练环境

arXiv cs.CL · 2026-06-17 缓存

本文提出了LLM-as-Environment-Engineer框架,其中策略模型通过分析失败案例自动重新设计强化学习训练环境,并引入MAPF-FrozenLake作为可控测试平台。该框架使用Qwen3-4B模型,性能优于GPT和Gemini等更大规模模型,表明策略学习提升了模型诊断自身弱点的能力。

0 人收藏 0 人点赞
#training-pipeline

使用NVIDIA NeMo训练视频基础模型

Papers with Code Trending · 2025-03-17 缓存

本文介绍了一种可扩展的开源管道,利用NVIDIA NeMo进行视频基础模型的训练和推理,通过加速数据集管理和并行化训练来解决生成高质量视频的挑战。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈