@bojie_li: 刚刚看完中关村学院的何纪言老师带领7名博士生从零开始训练一个7B模型……
摘要
何纪言老师和中关村学院的7名博士生在3个月内从零开始训练了一个7B模型,达到了7B模型类别的最先进性能,分享了高效训练和数据质量的见解。
查看缓存全文
缓存时间: 2026/09/26 06:55
刚看完中关村学院的何吉言老师带领7名博士生用3个月从头训练出一个7B模型——从预训练到中训再到后训练全程自主完成,在7B模型规模中达到了顶级水平。
首先,虽然很多人在鼓吹RSI(研究型自我改进),但技术报告指出当前模型的能力远未达到完全自主,仅在模型架构设计、学习算法设计和数据清洗等领域达到L2级辅助水平。我自己也有同感——无论是Astra还是Fable,都无法替代我的架构设计,必须时刻提醒自己不要外包思考过程。
其次,模型训练是典型的“会者不难,难者不会“。对于掌握方法的人而言,无需消耗大量算力资源;但对于不得其法的人,即使堆砌再多算力和人力也难以成功。例如MiMo V2.6 RL仅耗资300多万美元——对基础模型公司来说非常廉价。整个MiMo核心团队仅有数十名正式员工,且未采用蒸馏等捷径。而那些烧掉上亿美元、投入数千人规模的项目也未必能成功。对于中关村学院而言,一名教师加七名学生在短短三个月内完成数据创建、预训练、中训及后训练全流程,实属非常了不起。
最后,数据即新时代的代码,数据质量与代码质量同等重要。过去几年我始终试图通过代码实现Agent自我进化,但很快触及天花板。直到去年才意识到,这些本应通过代码实现的功能,其实更应该通过训练数据来表达并固化到模型中。我们都知道脏代码的危害——脏数据同样如此。中关村学院的这个7B模型在数据层面做了极深入的工作:预训练数据清洗与课程学习、中训阶段的上下文长度扩展、后训阶段用开源和蒸馏数据构建指令遵循与长上下文等基础能力,进而构建长链思维推理和工具调用等高阶能力;在强化学习阶段,持续移除高概率已解决的问题以维持GRPO学习效率。
技术报告:
相似文章
@mylifcc: 他们拿了 230 万条 Claude(一个很强很贵的AI)在推理时候留下的“思考过程”数据,去训练了一个很小的模型(Qwen3-4B,只有40亿参数)。 结果这个小模型在测试里表现得非常“稳”: 它在512次不同测试里,每次输出都完全一样…
使用230万条Claude推理轨迹数据蒸馏Qwen3-4B模型,得到100%输出一致性和极低幻觉的小模型,且学生模型未被教师模型限制,还收敛出一个普世真理。
@berryxia: 小块有大智慧?这下真成真了! 7B小模型现在直接当上了GPT-5、Claude Sonnet 4、Gemini 2.5 Pro这些顶级大模型的老板。 一篇最新论文里,一个用强化学习训练的7B模型学会了写自然语言子任务、分配给不同大模型、精…
一篇最新论文提出通过强化学习训练7B小模型作为任务调度器,自动分解子任务并分配给GPT-5、Claude等顶级大模型,在多项硬核基准上超越单一前沿模型,证明端到端奖励学习可有效替代人工Prompt工程与多智能体流水线设计。
@zhixianio: 这两天新机器到了之后,我开始了「苦行僧」式的强迫自己使用本地模型来完成常见任务的修行 本以为会非常痛苦,没想到无论是速度还是质量都大大超出我的预期: 模型: Qwen3.6-35B-A3B-oQ6-fp16-mtp 运行:oMLX,开 N…
作者在本地新机器上使用Qwen3.6-35B-A3B模型和oMLX工具进行日常任务,发现速度和效果远超预期,甚至在PA和Coding场景下优于远程LLM,体现了端侧AI能力的显著提升。
@f14bertolotti:一款3B模型的出色表现。这些成果主要通过对Qwen2.5进行训练后优化而实现……
本技术报告介绍了VibeThinker-3B,一个3B参数的模型,通过对Qwen2.5-Coder进行训练后优化(包括基于课程的有监督微调、多域强化学习和离线自蒸馏),实现了前沿水平的可验证推理性能,达到或超越了DeepSeek V3.2等更大的模型。
@alex_verem: 一组研究人员刚刚证明,你不需要更大的模型,你需要更聪明的计划。来自清华大学和……
来自清华大学和华南理工大学的研究人员引入了原子任务图(ATG),这是一个框架,通过基于有向图的规划和内部模拟,大幅降低幻觉率,使7B-8B开源模型在不进行微调的情况下,在复杂智能体基准测试中超越GPT-4。