@lqiao: https://x.com/lqiao/status/2070026145895256314

X AI KOLs Following 产品

摘要

Fireworks 正在提供一种针对 GLM 5.2 的强化学习训练的托管服务,该服务通过批次不变性和零 KLD 对齐确保训练和推理之间的数值一致性,以前只有顶尖前沿实验室才能使用。这使得任何人都可以定制并超越前沿质量。

https://t.co/KlrnWFHMNn
查看原文
查看缓存全文

缓存时间: 2026/06/25 11:17

位级一致:前沿训练的差异化关键

前沿训练最大的差异化因素与其说是模型或庞大的 GPU 集群,不如说是让数值精确对齐的那几个比特。

我们已为大型 MoE 模型(包括 GLM 5.2!)的在线策略 RL 训练实现了批不变性和零 KLD。

训练与推理之间的微小数值不匹配足以破坏巨型模型的强化学习。只有少数前沿实验室拥有消除这种不匹配的基础设施。

今天,我们正在改变这一局面——GLM 5.2 是一个前沿质量的开源权重模型。现在任何人都可以对其进行定制,并在自己的应用中突破前沿质量。

对前沿模型进行强化学习的难点通常不在于算法,而在于确保训练和推理在数值上完全相同的基础设施:端到端的零 KLD。在 Fireworks,我们长期投资于训练质量,现在将其作为托管服务提供,从 GLM 5.2 开始。

多年来,能够成功让强化学习在巨型模型上工作起来的专家团队仅限于拥有不显眼但至关重要的基础设施的顶级前沿实验室:经过工程设计、能重复产生相同数字的训练和服务栈。

该基础设施建立在那些实验室之外的人从未考虑过的概念上,例如批不变性训练与服务的零 KLD:使推理引擎和训练器产生相同的数字。这听起来像是管道工程,但却是强化学习运行能否成功爬坡与悄然崩溃之间的区别。

过去只存在于少数实验室内的工具包,现在作为托管理服务在 Fireworks 的 GLM 5.2 上可用。我们帮助您获得可以拥有而不是租用的前沿专业化智能。

曾经只有前沿实验室才有的功能

在 LLM 上进行强化学习是一个循环:模型生成响应,这些响应被评分,然后训练器更新权重。整个过程基于一个假设:训练器认为模型赋予每个 token 的概率,与推理引擎实际用于生成该 token 的概率相匹配。当这个假设成立时,学习信号才能流动。否则,你就是在针对噪音进行优化。

在现代前沿模型上维持这一假设确实很困难,Fireworks 为您提供了大型实验室构建的工具来实现它:

  • 大型 MoE 的批不变性——一个请求无论与什么其他流量共享同一批次,都返回相同的结果。没有它,“在线策略”运行会悄悄变成离线策略:推理是由一个与你正在更新的模型有细微差异的模型生成的,仅仅因为服务器繁忙。这些构建块正日益公开:开源引擎为较小的密集模型(vLLM、SGLang)提供了批不变性内核,而 DeepSeek 的 DeepGEMM(DeepSeek-V4 背后的内核库)为 MoE 提供了批不变性的分组 GEMM 内核。它端到端地取代了 cuBLAS,并恰恰因为 split-K 破坏了不变性而放弃了它。但一堆批不变性内核并不能构成一个批不变性系统。真正的端到端不变性意味着所有归约操作——注意力、MoE 路由器、专家 GEMM 以及多秩 all-reduce 栈——在真实生产负载下始终保持一致。据我们所知,以托管服务的形式为 GLM 5.2 这样的前沿 MoE 提供这种全系统保证,在业界尚属首次。

  • 训练/服务的零 KLD 对齐——对于像 GLM 5.2 这样的模型,常规的补丁远远不够。流行的 MoE 修复方法——路由器重放(在训练器内重放推理引擎的专家选择)——处理了哪些专家被触发的问题,但无法触及这些模型产生分歧的另一个地方:稀疏注意力索引器选择了哪些 token。这些选择无法通过重放来追踪。因此,这里没有折中方案。生成引擎、提示读取路径和训练器必须共享同一个数值定义,这样你训练的就是你服务的模型:端到端的零 KLD。

零 KLD 训练/服务循环:同一个请求流经服务预填充和生成,然后进入训练器路径。当服务的 logits 与训练器的 logprobs 匹配且 KLD = 0 时,两条流汇合。

这些正是大多数平台所没有的部分,它们的缺失也是为什么如此多的强化学习努力停滞不前的原因。

验证

下面是同一个 RL 任务——GLM 倒计时推理任务——以两种方式运行。两者使用相同的算法和数据。唯一的区别是底层的数值计算。

验证运行:当训练器和推理引擎不一致时,相同的 GLM 倒计时推理任务表现不同:奖励崩溃,裁剪丢弃了学习信号。使用零 KLD 数值计算,循环保持在线策略。

没有 Fireworks 数值栈时,训练器和推理引擎不一致(训练-推理 KL 约为 0.013),运行严重依赖行业通常的拐杖:重要性采样和裁剪丢弃了每个批次约 45% 的 token 只是为了保持稳定。但这仍然不够。大约在第 20 步时,奖励崩溃,从约 0.9 下降到 0.2 以下,因为策略追逐一个不再与它生成内容匹配的目标。

有了 Fireworks 栈,训练器和推理引擎以端到端零 KLD 运行——比特级完全一致——零 token 被裁剪,并且奖励在整个运行过程中保持健康。相同的任务,相同的算法。唯一改变的是让数字一致。

这就是重要性采样加裁剪方法的陷阱:它是一种税收,而不是一种修复。每个被裁剪的 token 都是被丢弃的学习信号,超过某个点后,再多的裁剪也无法拯救一个数字不匹配的运行。

为什么比特级一致是一个复杂的问题

这归结于浮点数学的一个特性,几乎让每个人都感到棘手:加法不具有结合性。(a + b) + c 在比特级上不等于 a + (b + c),因此 GPU 加法运算的顺序会改变结果,通常只在最后几位,但有时足以翻转一个 token。

一个前沿 MoE 会不断改变这个顺序,原因与你的请求无关:

  • 潜在注意力 (MLA)——使 GLM 在长上下文下成本低廉的压缩技巧——将其归约分解为 GPU 上的块,这些块的边界会随共享批次的序列长度而变化,因此同一个查询可能在不同时刻以不同顺序累积其注意力。

  • 稀疏索引器决定每个查询查看哪些历史 token,它可能以不同的顺序返回相同的集合。由于注意力总和遵循该顺序,结果会发生漂移。

  • 每个专家的矩阵乘法根据该专家在此步骤中获得的 token 数量(这取决于其他所有人的 token,而不仅仅是你的)运行不同的内核和分块策略。

  • 路由器可能在两个专家之间出现几乎平局;一个舍入误差大小的抖动就会翻转哪个专家被触发,token 的整个计算也随之改变。

  • 跨 GPU 的 all-reduce 根据消息大小切换算法,这同样取决于负载。

将这些叠加起来,“温度 0”在繁忙服务器上会悄悄变得非确定性:相同的提示,与不同流量共批次,会返回微妙且有时意义重大的不同结果。这就是那个将在线策略 RL 运行悄悄变成离线策略的差距。

要获得可信任的数值,意味着要固定每一个这样的决策,使其仅依赖于你的请求:无论批次如何,注意力中固定的归约顺序;无论 token 数量如何,专家 matmuls 的一个确定的核选择;路由器中的确定性平局判定;以及一个单一的固定跨 GPU 归约路径。所有这些都不能牺牲太多速度,以至于训练器在日常 SFT/DPO 中变得不可用。

然后,我们将训练器自身的前向传播对齐到相同的服务定义,这样在验证过的 GLM-5.2 LoRA 路径上,训练器和服务达到零 KLD——训练-推理生成的 KL 恰好为 0,比特级完全一致,并且服务的模型在温度 0 下无论并发情况如何都返回相同的输出。

端到端零 KLD

微小的训练-推理数值不一致并非无害的噪音:它们会悄悄地将在线策略 RL 变为离线策略,并可能独立导致运行崩溃。关于推理非确定性的相关背景,请参阅 TML;关于 RL 失败模式,请参阅此诊断。干净的解决方案不是用重要性采样来纠正差距,这只会增加方差,而是消除它。当训练和推理被设为比特级一致,使得 KLD 恰好为 0 时,RL 训练步骤更少,达到更高奖励(vLLM x TorchTitan)。

这正是 Fireworks 在 GLM 5.2 上交付的:批不变性服务与零 KLD 训练-推理对齐。 推理引擎返回比特级完全相同的 logits,无论批次大小、并发负载或跨多少个 GPU 分片,训练器也遵循相同的比特精确标准,因此完整的训练-推理循环以零 KLD 运行。这是前沿实验室内部构建的保证,并且在不同引擎、内核和并行布局之间保持这一点确实很难。仅确定张量并行大小下的非确定性,直到今年仍是一个开放的研究问题(TBIK, ICML 2026)。

其他所有人遇到的障碍是速度:开源确定性模式通常运行速度慢 35-60%(SGLang)。Fireworks 几乎不支付这种代价。GLM 训练器保持每个节点约 3,500 token/秒,与 OSS TileLang 实现相当,并在其之上叠加了零 KLD 数值计算,而不是以速度换取它们。一个栈为 SFT/DPO 多数用例提供全吞吐量,并为 RL 团队提供零 KLD 数值计算:前沿实验室基础设施,作为托管服务交付。

今天在 Fireworks 上你能获得什么

  • 一个前沿模型,为 RL 准备就绪。 GLM 5.2 已通过 Fireworks 训练 API 上线用于微调,并继承了 GLM 5.1 的完整数值基础。已验证的训练形状今天已公开。

  • 重要的方法。 通过训练 API 进行 SFT、DPO 和 RL;在托管训练上进行 SFT 和 DPO。在线策略 RL,其中训练器和推理引擎真正一致,因此你的信号是真实的学习,而不是被裁剪掉的漂移。

  • 可重现、可审计的推理。 温度 0 的请求无论服务器负载如何都返回相同答案,从而获得可信的评估、有意义的回归测试以及企业合规性所需的可重复性。

  • 在关键环节快速。 一个针对 SFT/DPO 吞吐量优化的训练器,推理在 GLM 5.2 上比 GLM 5.1 生成速度快约 1.8 倍(每个节点约 5,000 token/秒,根据 promotion-CI),以及零 KLD 训练-服务数值计算,使 RL 真正在线。

  • 托管、自助服务且共置。 在托管基础设施上运行完整循环,训练器与部署共置以实现快速权重同步,或通过 API 自行驱动更长的运行。

为何重要:前沿专业化智能作为护城河

前沿现在已经开放。任何人都可以下载一个最先进的模型。仍然稀缺的是在这些模型之一上正确进行强化学习的能力:数字足够匹配以致收敛的循环,你可以重现的结果,以及足够快以便迭代的训练器。这些过去只存在于最大的实验室中。

GLM 5.1 和 GLM 5.2 在 Fireworks 上的工作:在一个栈中提供用于 RL 的比特级零 KLD 数值计算和用于 SFT/DPO 的原始速度,这正是过去需要前沿实验室内部系统团队才能构建的基础设施。

要开始使用,请立即联系我们的训练团队,或直接通过我们的托管训练文档深入了解。

相似文章