@bojie_li: 刚刚看完中关村学院的何纪言老师带领7名博士生从零开始训练一个7B模型……

X AI KOLs Timeline 模型

摘要

何纪言老师和中关村学院的7名博士生在3个月内从零开始训练了一个7B模型,达到了7B模型类别的最先进性能,分享了高效训练和数据质量的见解。

刚刚看完中关村学院的何纪言老师带领7名博士生从零开始训练一个7B模型,用时3个月,从预训练到中训练再到后训练全部自行完成,在7B规模模型类别中达到了SOTA水平。 首先,尽管很多人在吹捧RSI,但技术报告指出,当前模型的能力远未达到完全自主,仍然只能在模型架构设计、学习算法设计和数据清洗等领域提供L2级别的辅助。我自己也有同样的感觉——无论是Astra还是Fable,都无法替代我的架构设计,我必须不断提醒自己不要外包自己的思考。 其次,模型训练是一个经典的'会者不难,难者不会'的案例。对于会的人来说,不需要太多计算资源;但对于不会的人来说,无论堆砌多少算力或人力也无法完成。例如,MiMo V2.6 RL只花了300多万美元,对于一家基础模型公司来说非常便宜。整个MiMo核心团队只有几十名正式员工,没有采用蒸馏等捷径。但那些花费上亿美元、投入数千人的模型也不一定能成功。对于中关村学院来说,一名老师加7名学生在短短3个月内完成数据创建、预训练、中训练和后训练,令人印象深刻。 最后,数据是新的代码,数据质量与代码质量同等重要。在过去几年里,我总是试图通过代码实现Agent自我进化,但很快遇到了天花板。直到去年,我才意识到这些我通过代码做的事情,应该通过训练数据来表达并融入模型。我们都知道脏代码的危害——脏数据也是一样。这个中关村学院的7B模型在数据方面做得非常深入:预训练数据清洗和课程学习,中训练时扩展上下文长度,后训练使用开源和蒸馏痕迹构建基础能力如指令遵循和长上下文,然后构建更高阶能力如长链式思维推理和工具调用;在强化学习中,持续移除已经高概率解决的问题以保持GRPO学习效率。 技术报告:
查看原文
查看缓存全文

缓存时间: 2026/09/26 06:55

刚看完中关村学院的何吉言老师带领7名博士生用3个月从头训练出一个7B模型——从预训练到中训再到后训练全程自主完成,在7B模型规模中达到了顶级水平。

首先,虽然很多人在鼓吹RSI(研究型自我改进),但技术报告指出当前模型的能力远未达到完全自主,仅在模型架构设计、学习算法设计和数据清洗等领域达到L2级辅助水平。我自己也有同感——无论是Astra还是Fable,都无法替代我的架构设计,必须时刻提醒自己不要外包思考过程。

其次,模型训练是典型的“会者不难,难者不会“。对于掌握方法的人而言,无需消耗大量算力资源;但对于不得其法的人,即使堆砌再多算力和人力也难以成功。例如MiMo V2.6 RL仅耗资300多万美元——对基础模型公司来说非常廉价。整个MiMo核心团队仅有数十名正式员工,且未采用蒸馏等捷径。而那些烧掉上亿美元、投入数千人规模的项目也未必能成功。对于中关村学院而言,一名教师加七名学生在短短三个月内完成数据创建、预训练、中训及后训练全流程,实属非常了不起。

最后,数据即新时代的代码,数据质量与代码质量同等重要。过去几年我始终试图通过代码实现Agent自我进化,但很快触及天花板。直到去年才意识到,这些本应通过代码实现的功能,其实更应该通过训练数据来表达并固化到模型中。我们都知道脏代码的危害——脏数据同样如此。中关村学院的这个7B模型在数据层面做了极深入的工作:预训练数据清洗与课程学习、中训阶段的上下文长度扩展、后训阶段用开源和蒸馏数据构建指令遵循与长上下文等基础能力,进而构建长链思维推理和工具调用等高阶能力;在强化学习阶段,持续移除高概率已解决的问题以维持GRPO学习效率。

技术报告:

相似文章

@mylifcc: 他们拿了 230 万条 Claude(一个很强很贵的AI)在推理时候留下的“思考过程”数据,去训练了一个很小的模型(Qwen3-4B,只有40亿参数)。 结果这个小模型在测试里表现得非常“稳”: 它在512次不同测试里,每次输出都完全一样…

X AI KOLs Timeline

使用230万条Claude推理轨迹数据蒸馏Qwen3-4B模型,得到100%输出一致性和极低幻觉的小模型,且学生模型未被教师模型限制,还收敛出一个普世真理。

@berryxia: 小块有大智慧?这下真成真了! 7B小模型现在直接当上了GPT-5、Claude Sonnet 4、Gemini 2.5 Pro这些顶级大模型的老板。 一篇最新论文里,一个用强化学习训练的7B模型学会了写自然语言子任务、分配给不同大模型、精…

X AI KOLs Timeline

一篇最新论文提出通过强化学习训练7B小模型作为任务调度器,自动分解子任务并分配给GPT-5、Claude等顶级大模型,在多项硬核基准上超越单一前沿模型,证明端到端奖励学习可有效替代人工Prompt工程与多智能体流水线设计。

@zhixianio: 这两天新机器到了之后,我开始了「苦行僧」式的强迫自己使用本地模型来完成常见任务的修行 本以为会非常痛苦,没想到无论是速度还是质量都大大超出我的预期: 模型: Qwen3.6-35B-A3B-oQ6-fp16-mtp 运行:oMLX,开 N…

X AI KOLs Timeline

作者在本地新机器上使用Qwen3.6-35B-A3B模型和oMLX工具进行日常任务,发现速度和效果远超预期,甚至在PA和Coding场景下优于远程LLM,体现了端侧AI能力的显著提升。