为团队感到无比自豪。经历了无数个深夜,Inkling 终于发布了,我特别想强调 post-……

X AI KOLs Timeline 模型

摘要

Thinking Machines 发布了 Inkling,这是一个开源的多模态推理模型,在 post-training RL 方面有创新,实现了稳定扩展到 3000 万+ 次 rollout 和可控的思考投入。该模型展现出压缩推理的特点,即将开放微调。

为团队感到无比自豪。经历了无数个深夜,Inkling 终于发布了,我特别想强调其背后的 post-training 堆栈和 RL 配方。 以下是我最喜欢的一些细节: 我们将最大的 RL 运行扩展到 3000 万+ 次 rollout 和数千次连续训练步骤,整个过程没有崩溃,没有重启,KL 散度和熵保持稳定。推理性能从 SFT 初始化到发布的检查点呈现对数线性提升。许多幕后创新使这成为可能,结果充分证明了我们的 post-training 技术。 我们直接通过 RL 训练可控的思考投入。通过改变系统提示和每 token 成本,模型学会了按需权衡 token 数量和性能。 我们还观察到推理风格出现了涌现性转变:随着 RL 的推进,思维链变得越来越压缩,去掉了语法上的冗余。Inkling 的推理方式就像一位穴居数学家——这种独特风格与其他开源模型截然不同。 我们今天还预告了 Inkling-small,并计划很快发布。它在同等规模下表现出色,我们预计社区会发现它非常有用。 在如此短的时间内构建一个简单、稳定且可扩展的 RL 堆栈,是很少有人认为可能的事情。但这个团队证明了相反。
查看原文
查看缓存全文

缓存时间: 2026/07/16 16:21

团队的表现让我无比自豪。经过无数个深夜奋战,Inkling 终于出炉,这里我特别想强调一下背后的训练后堆栈和强化学习方案。

一些我最喜欢的细节:

我们最大的强化学习运行规模达到了 3000 万以上的 rollout 和数千次连续训练步骤——没有崩溃、没有重启,KL 散度和熵值始终保持稳定。从 SFT 初始化到发布检查点,推理性能呈对数线性提升。多项底层创新使这一切成为可能,而最终结果也充分证明了我们训练后技术的实力。

我们直接通过强化学习训练了可控的思考努力程度。通过改变系统提示和每 Token 成本,模型学会了按需权衡 Token 消耗与性能表现。

我们还观察到推理风格中涌现出的一种转变:随着强化学习的推进,思考链变得越来越精简,语法冗余被逐步剥离。Inkling 的推理方式就像一位穴居数学家——这种独特风格在其他开源模型中难得一见。

今天我们同时推出了 Inkling-small 预览版,不久后将正式发布。它在同等规模下表现极为出色,相信社区会发现它的广泛用途。

在如此短的时间内构建一个简单、稳定且可扩展的强化学习堆栈,此前几乎没人认为可能。但这个团队证明了,他们可以做到。

Frrrr

谢谢你,Clare!

想念你。

相似文章

Thinking Machines Lab 发布首个模型

Wired

由前 OpenAI 高管创立的 Thinking Machines Lab 发布了其首个开源权重 AI 模型 Inkling,该模型拥有 9750 亿参数,具备推理、编程以及处理音频、视频和文本的能力。