OpenAI Astra与循环Transformer(2分钟阅读)

TLDR AI 新闻

摘要

本文澄清了围绕OpenAI Astra模型的炒作,解释了‘循环Transformer’概念是一种小型架构调整,通过重用层来增加容量而不增加参数,如在Nanbeige 4.2等模型中所见。

OpenAI的模型是一个循环Transformer,这意味着它在Transformer块中重用层来增加容量而不增加参数。这可以显著增加模型的大小,而不需要增加托管所需的存储和RAM数量。然而,这也增加了运行模型的成本,因为嵌入文本需要经过更多层。循环Transformer方面只是一个小型架构调整,并不是Astra模型真正优秀的原因。
查看原文
查看缓存全文

缓存时间: 2026/09/03 23:47

# OpenAI Astra 与循环Transformer 来源:https://sebastianraschka.com/blog/2026/openai-astra-looped-transformers.html 近期关于 OpenAI 的 Astra 模型是"循环深度或循环Transformer"的讨论热度颇高,让我们稍作剖析。 大约两个月前,我曾介绍过 Nanbeige 的架构细节,例如"Nanbeige4.2-3B 采用循环Transformer架构,在28万亿token上从零预训练,通过复用层堆栈在不增加参数的情况下提升模型容量"。 确实如此。循环Transformer的核心思想就是在Transformer模块中复用层。 以 Nanbeige 为例,其核心设计是将相同的22层堆栈(即Transformer模块)重复使用两次而非单次。这样实际上将22层架构扩展至44层深度,却没有重复权重参数。 简言之,这相当于将模型规模扩大了一倍(暂时忽略嵌入层和输出层)。但由于组件被复用,模型存储和内存占用保持不变。不过计算成本却近乎翻倍,因为嵌入文本需要通过近两倍的层进行处理。 为何如此设计?Nanbeige 4.2技术报告中指出,两次传递能取得最佳平衡,可保留标准架构约75%的token效率。(更多传递带来的收益微乎其微,却会使训练速度大幅下降、成本剧增。) 虽然就我所知 Nanbeige 4.2 是首个采用此方法的重要开源模型,但该思想最早可追溯至 NeurIPS 论文《Mixture-of-recursions: Learning dynamic recursive depths for adaptive token-level computation》。该论文提出了更复杂的机制——通过可学习路由器决定每个token应接受一次、两次或更多次处理。这样简单token可提前终止,复杂token则获得额外计算资源。 总而言之,Astra 或许是出色的模型,但讨论焦点不应局限于"循环Transformer"这一微小的架构调整。 此外,"新技术能以某种方式隐藏AI部分或全部推理过程,即所谓'思维链'"的论断,对循环Transformer方法而言并不一定成立。《The Information》记者可能指的是其他技术,或是误解了循环Transformer的工作原理。 单纯复用层本身并不会抑制可见的思维链。它只是在生成下一个token前,于隐层状态中增加计算过程,正如普通Transformer层一样。 但根据现有信息,最合理的解读是:若模型采用更多循环传递,可能需要生成较少的中间推理token。这样更多计算将发生在无法转化为文本的潜在激活态中。不过这种效应在我们扩大模型规模时也会出现,例如从GPT 5.6 Luna升级到GPT 5.6 Sol。 (综合对比图:将OpenAI Astra的循环深度设计、Nanbeige 4.2的重复Transformer层以及Mixture-of-Recursions的token级路由机制进行比较) **图1**. OpenAI Astra循环深度、Nanbeige 4.2循环Transformer与Mixture-of-Recursions token级路由的相关报道对比。关于循环深度和循环Transformer的视频讲解请参见下方说明。来源:我的Substack网站版本(https://substack.com/@rasbt/note/c-328050608)。

相似文章

什么是 Looped Transformers?清晰解释(8分钟阅读)

TLDR AI

Looped transformers 在多次传递中重复使用相同的层,以参数数量换取计算量,用更少的权重实现更好的推理。文章追溯了这一想法到 Universal Transformer (2018),并解释了其最初因扩展定律和时机而失败的原因。