基础模型已不再是瓶颈(15分钟阅读)
摘要
文章认为,基础AI模型不再是主要瓶颈,改进现在由训练后增强驱动,如最近发布的GLM5.3和Qwen3.6所见。
开源模型在短短几个月内有了显著改进。现在可以在家中的硬件上运行上一代Opus级别的智能。基础模型内嵌了大量原始知识,这些知识随着参数数量的增加而扩展。这些模型可以被剪枝,并且仍然擅长特定任务。
查看缓存全文
缓存时间: 2026/09/01 11:40
# @adlrocha - 基础模型不再是瓶颈
来源:https://adlrocha.substack.com/p/adlrocha-base-models-stopped-being
[](https://substackcdn.com/image/fetch/$s_!hRwk!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F6c7bede0-33d2-4e90-8e90-f4dd646b0e07_1168x784.webp)
上周我结束了关于Kimi K3的文章 (https://adlrocha.substack.com/p/adlrocha-wwhat-changed-in-kimi-k3),并承诺会用同样的方式,**用通俗易懂的英文解释新发布的Qwen3.8和GLM5.3模型的改进**。结果当我写这篇文章时,Qwen和GLM决定同时发布它们的新Flash模型*(把那天标记在日历上吧,AI独立日)*,所以我想这终究会成为一个三部曲系列。
GLM5.3和Qwen3.6中我真正喜欢且值得分析的一点是,**这些模型没有引入任何架构变更。**
GLM-5.3 (https://z.ai/blog/glm-5.3) 于8月14日发布,其基础与GLM-5.2相同(相同的尺寸和参数量),但经过了额外一个月的后训练。Z.ai将此次发布总结如下:***“对于GLM-5.3,我们所做的就是扩展后训练。”*** 这就够了,经过一个月的训练,同样的底层大脑进入了CyberGym (https://www.cybergym.io/cybergym/) 和GDPval (https://artificialanalysis.ai/evaluations/gdpval-aa) 的顶级排名。
通过那个月的训练,该模型在排名上接近了一些前沿模型,甚至在部分基准测试中显著击败了更大的开源模型,如Kimi K3。但让我们用我自己的个人“感觉基准测试”来说。正如你们许多人所知,我也订阅了GLM,所以它一发布我就测试了,它很棒。**我本来就很喜欢GLM5.2,老实说我没想到从5.2到5.3会有明显提升,但我确实感受到了。**不知道为什么,它感觉更快、更智能、更直奔主题*(这是我非常欣赏LLM的一点,不仅因为这样每个任务消耗的token更少)。*
X领域的许多八卦者将这种提升归因于蒸馏,即模型是用来自一些顶级前沿模型(如Fable或GPT-sol)的推理痕迹训练出来的,**但我认为仅凭蒸馏本身无法解释这种性能提升**,尤其是当大型实验室如此保护他们自己的推理痕迹时*(这个话题我以后再说)。*
那么,如何仅通过训练来解释如此巨大的提升呢?**让我们稍微绕个弯,解释一下LLM的不同训练阶段,以及我们如何通过额外的后训练(取决于任务)榨取每一点智能。**
[](https://substackcdn.com/image/fetch/$s_!vdns!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F45b98d43-4fff-45e3-b995-1532c73d9251_1916x1094.png)
**LLM训练的第一阶段是预训练。** 在这个阶段,模型阅读互联网上的大量内容(现在还包括一些其他来源,如打包在不同数据集中的书籍和论文),并学习预测下一个token。这为模型提供了所谓的**“潜在能力”,意味着模型最终掌握了技能**,比如Python、C语言内存语义,或者如何写标准的英文,仅仅通过阅读海量文本,并能够准确预测接下来会出现什么。如果你要求一个预训练模型写一首诗,或者从Stack Overflow的帖子中生成一个看起来合理的错误报告,它可能会做得很好,因为所有这些都存在于它的训练语料库中。
**这是LLM训练中最昂贵的阶段,也是GLM5.3完全没有涉及的阶段之一**(相同的架构,没有重新预训练)。
然后是中期训练,这是一个许多人不考虑的阶段,因为它是一个中间阶段,其中在基础LLM模型(来自预训练)上,使用精选数据、长上下文扩展、更多代码、特定领域数据集等,进行一个类似于预训练的过程,只是为了在特定领域略微提升基础模型的那些“潜在能力”。GLM5.3也没有触及这个阶段。
**然后是后训练阶段,** 这是**基础模型被塑造成具有特定行为(在很多情况下是个性),并能够执行特定任务(比如我们不断要求它们做的代理任务)**的地方。后训练阶段本身包含三个不同的阶段。
**有监督微调**,你向模型展示良好行为的示范并训练它模仿。这就是指令遵循、响应格式和拒绝行为的来源。信号基于*他人的输出*。这意味着模型学会了完美复制特定行为。**这是后训练中可以通过蒸馏改进的部分**,因为你可以获取来自更智能模型在特定任务上的输出和推理痕迹的大型语料库,并将其用作有监督微调的输入。
**偏好优化(RLHF、DPO等)**,这实现了GPT-4的飞跃*(感觉已经是很多年前的事了)。* 在这个阶段,人类对成对的响应进行排名,根据这些排名拟合一个奖励模型,然后根据该奖励模型优化策略。信号基于*一个学习到的代理人类偏好的模型*。这也很大程度上可以复制,因为品味在输出中是可辨识的,并且可能通过蒸馏创建一个好的训练数据语料库。
最后,**带可验证奖励的强化学习。** 去年最耀眼的明星。**模型被放入一个环境,执行数百次操作,并获得由*运行某些东西*计算出的奖励。** 测试通过了或没有。崩溃复现了或没有。信号基于执行。对于RLVR,需要有一个清晰的目标和限定的环境,LLM使用它来训练并通过奖励循环理解它在特定任务中的表现如何。其中一些环境导致了Open AI模型攻击Hugging Face的事件(参见报告 (https://metr.org/hugging-face-incident-report-aug-2026.pdf))。但再次,我们把这个话题留到以后的文章再谈。
[](https://substackcdn.com/image/fetch/$s_!tM7h!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F93faf021-ad34-437a-8e3d-778ee4c9bda0_640x761.png)
最后这个阶段解释了GLM5.3的改进。对于GLM5.3,**Z.ai (http://z.ai/)决定改进他们在这个后训练阶段使用的环境。** 迄今为止构建的大多数环境看起来像编程挑战:带有检查器的自包含谜题,答案在书后的教科书问题。用Z.ai的话说,GLM-5.3的环境*“看起来更不像编程练习,而更像真正的工作单元”*。有些代表了一位经验丰富的工程师几天的工作量。博客中的例子是一个ML基础设施任务:**模型获得了与工程师相同的工作环境**,计算集群、存储、内部文档、代码库和实验结果。它必须诊断训练堆栈中的瓶颈,实施优化,运行自己的实验,并在不破坏正确性的前提下提供测量到的端到端加速。
我认为报告中的这句话解释了一切:*“随着代理能力的提高,扩展后训练的大部分困难从模型转移到了环境。”***所以模型不再是瓶颈,现在的挑战是训练它来执行特定任务。**
人们无法手工构建数千个多天的专家任务来训练模型,**因此为了绕过这个瓶颈,他们构建了一个环境工厂。** 研究代理从真实工作中收集任务模式,并将它们转化为可运行的、具有隐藏状态和多步依赖关系的长期环境。一个评判代理必须在任务计入之前实际解决每个任务。没人能通过的考试永远不会被设置。然后一个解决器运行并探测每个环境的捷径,即无需实际工作就能得分的方法,并将它们关闭。结果是一个能自我编写和评分的训练课程,人类只需审核边缘情况。
我在一月份描述了我的“Spec-Test-Lint”编码流程 (https://adlrocha.substack.com/p/adlrocha-taming-the-agents-my-spec),其核心是:规格说明越完整,测试越接近规格说明,代理就能越自主地工作。我本质上是在为我的编码代理手工构建小型健身房,具有清晰客观的特定任务反馈循环。在某种程度上,Z.ai (http://z.ai/)做了同样的事情,但规模更大,并用于模型的RL训练(这个类比可能不1:1匹配,但我试图再次强调为代理拥有客观反馈循环的重要性)。
作为这一切的一部分,Z.ai将漏洞发现数据和环境混入了训练中。**他们期望模型能更好地发现和推理缺陷。然后,用他们的话说,“网络能力的发展比我们预期的要快”:** 模型“开始跨多个利用阶段进行推理,形成完整的利用链的连贯计划”。
因此他们将其投入现实世界进行验证。与安全团队合作,在真实代码库上运行,经过专家审查和去重后,该模型在269个开源项目中识别了2,436个漏洞,其中1,097个为中等至高危漏洞。最古老的漏洞可追溯到1981年。平均每个漏洞存在了26.6年才被人发现。Z.ai正在通过公共账本 (cvd.z.ai) 进行披露:目前已披露53个问题,2,383个仍在保密期。
**所以,通过试图提高他们的推理能力,他们教会了模型如何黑客攻击。**
Qwen3.8-27B也于8月14日发布,与GLM5.3同一天。我对这个模型发布如此兴奋的原因是,与GLM5.3不同,**你可以用不到10K美元的硬件在家中运行Qwen3.8-27B**,比如一台具有足够统一内存的Mac、一台DGX Spark或一块RTX3090。GLM5.3令人兴奋是因为它升级了我最喜欢的开源模型之一,但Qwen3.8-27B升级了我的家庭智能(这转化为无限的token配额)。
在我们深入了解内部变化之前,让我感到疯狂的是,**在他们的公告中,他们决定直接与Opus4.6-Max*(传奇)*进行比较。** 所以本质上,我们得到的是一个上一代的Opus级模型,可以在家庭硬件上运行*(我还需要一些时间继续测试,以确定它与Opus 4.6相比感觉如何,但仅仅是这个承诺,即使它“刷榜”,也是一个成就)。*
[](https://substackcdn.com/image/fetch/$s_!sCmC!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F051e1c89-c085-4746-bdd8-1df9095d8641_2048x1789.png)
**如果你查看Qwen3.8的模型卡,你会看到该模型*“建立在Qwen3.5的架构基础之上”*(实际上,如果你查看model_type,你会发现它仍然显示为qwen3_5)。** 层数、隐藏维度、前馈网络宽度、头布局和原生上下文与3.6-27B基本相同。GLM-5.3和Qwen3.8-27B之间小版本升级的主要区别在于Qwen确实重新训练了B。混合注意力布局是继承的,而非新的:64层,排列为16个重复单元,每个单元包含三个门控DeltaNet(线性注意力)块,后跟一个门控注意力(全注意力)块,多token预测跨多个步骤训练。设计不错,但这是3.5的设计*(我们把这些层的解释留到以后的文章)。*
**模型卡列出的训练阶段是“预训练和后训练”。** 而Z.ai则明确冻结了基础模型,只进行了后训练。因此,我们可以从这两个发布中学到,虽然战争知识随着参数数量扩展,但长期可靠性是一种后训练属性,一个具有良好后训练的小模型可以在某些任务上击败更大的模型(即使它们对世界的了解较少)。
似乎没有关于Qwen训练的环境工厂、RL方法论或语料库披露的记载。阅读模型卡和Qwen3.8-Max的报告,有几点引起了我的注意。
**第一点是preserve_thinking默认开启,保留每个历史消息中的思考块**,而不仅仅是最后一轮(与Qwen3.6不同)。这意味着在RL展开过程中,当情节运行时,模型自己的推理保留在窗口中,因此模型**学会了将其过去的思考作为工作记忆,而不是每一轮都重新生成新的理由。** Qwen给出了三个原因:长序列中决策的一致性,减少冗余的重复推理,更好的KV缓存利用。留在前缀中的思考块保持缓存状态。你每一轮都丢弃并重建的思考块是代理循环变得昂贵的原因。
第二点是reasoning_effort,有xhigh、medium和low三个档位,且xhigh是默认值。三个预算意味着他们训练模型在三个预算下确实表现不同,而不是只发布一个策略并希望系统提示能让它变得简洁。与GLM-5.3不同,思考仍然可以完全关闭。
第三点是**“下游兼容性:更广泛地支持流行的框架”**,这被列为主要功能,模型卡中的每个编码基准测试都是通过Claude Code框架运行的。这是Z.ai在GLM5.3中学到的同样教训:**如果你想让模型在一个真实的代理循环中工作,你就在一个真实的代理循环中进行后训练**,使用真实的工具调用格式和返回的真实错误信息。这也是为什么它可以无缝集成到OpenCode或你已经使用的任何框架中,并且运行良好*(考虑到我们目前如何使用这些模型,并且如果你和我一样热爱皮尔斯,每个模型都应该这样做)。*
Z.ai冻结了基础模型,花了一个月时间构建环境。阿里巴巴将模型尺寸大幅缩小,并改进了他们的后训练流水线,以在更小的空间内挤出更多智能。开源模型在短短几个月内取得的成就是疯狂的,**我们现在可以在家中拥有上一代Opus级的智能,并且通过一些REAP(推理高效适应剪枝),你只需要一点硬件投资就可以让一个模型在家中运行。** 我还没有开始谈论GLM5.3-Flash和Qwen3.7-Flash*(这对我标志着AI独立日,我会留到下周的文章再谈)。*
早在七月,我就认为未来是专门化的 (https://adlrocha.substack.com/p/adlrocha-forget-fat-models-the-future),REAP风格的专家剪枝让你可以剪掉模型知道但你永远不会问到的所有东西,并在你拥有的硬件上保留你需要的部分。在那篇文章中,我认为我们可以压缩一个现有的模型,移除所有与当前任务无关的专家。这篇文章是同一笔交易的另一半*(也是为什么我对这些可以在家中运行的模型如此兴奋)。***基础模型在其内部嵌入了大量的原始知识,这些知识随着参数数量扩展,**但我们可以使用该基础模型并对其进行剪枝,以便通过后训练引导它擅长特定任务,即使减少了其核心参数。**我们将原始知识建模为在我们感兴趣的任务中表现出色**(模型正在成为一个载荷
相似文章
我们在AI实施中看到的一个模式:模型不再是瓶颈了。
观察者指出,在AI部署中,模型性能不再是主要限制因素;挑战现在集中在基础设施、数据和集成上。
模型不再是瓶颈(6分钟阅读)
Anthropic 的通用AI模型 Claude(未经化学微调)在核磁共振分析中表现优于 ChemDraw 和 MestReNova 等专业软件,这表明科学AI领域的瓶颈已从模型能力转向工作流设计。
@TheAhmadOsman: GLM 5.3 Flash 和 Qwen 3.8 Flash Next 是本地AI进步的绝佳范例,这是一个积极的时间线
这条推文探讨了本地AI的进展,强调了像GLM 5.3 Flash和Qwen 3.8 Flash Next这样的模型现在能够在单个GPU上运行,从而改善了对硬件的要求。
本地模型从几乎无用迅速变得真正有用。是什么发生了变化?
文章指出,过去一年中,本地AI模型变得显著更有用,从玩具变成了编程和工作流程的实用工具,尽管在复杂任务上仍落后于闭源模型。
我们身在何处:一年之间,天地翻覆——Kimi、Minimax、Qwen、Gemma、GLM
作者感慨本地 AI 能力进步神速,如今借助 Qwen 27b、Minimax 2.7 等模型,在平价硬件上就能完成过去只有顶级云端大模型才能搞定的任务。